6 min lexim
Mësimi kundërshtar
Të mashtrosh një makinë me qëllim
Një model IA nuk e sheh botën ashtu si ti. Ai kërkon modele te numrat, pikselat dhe tingujt. Shpesh kjo funksionon mjaftueshëm mirë. Por meqë i percepton gjërat ndryshe nga ne, mund të mashtrohet nga hyrje që një person do t'i quante krejt të zakonshme.
Mësimi kundërshtar i makinës është studimi pikërisht i kësaj: përgatitja e hyrjeve, ose manipulimi i atyre ekzistuese, në mënyrë që modeli ta japë përgjigjen gabim me qëllim. Hyrja e manipuluar shpesh i duket krejt normale një njeriu, dhe pikërisht kjo e bën marifetin efektiv dhe të vështirë për t'u vënë re.
Shembuj të thjeshtë
Disa shembuj të përdorur gjerësisht e bëjnë idenë konkrete:
- Shenja STOP e ndryshuar. Studiuesit ngjitën disa ngjitëse të vogla, të vendosura me kujdes, mbi një shenjë rrugore. Për një person ishte ende qartazi një shenjë STOP. Për një sistem njohjeje pamjesh në një makinë, modeli mjaftoi për ta lexuar shenjën si diçka krejt tjetër, si një kufi shpejtësie.
- Ndryshimi i padukshëm. Merr një foto që modeli e etiketon saktë si një kafshë. Ndrysho pikselat në një mënyrë aq të lehtë sa fotoja të duket e njëjtë për ty, dhe modeli mund papritur, plot vetëbesim, ta etiketojë si një kafshë krejt tjetër.
- Modeli që të fsheh. Një model i posaçëm i printuar mbi një bluzë mund ta ndalojë sistemin e zbulimit të një kamere të njohë se aty ka fare një person.
Në çdo rast një njeri nuk mashtrohet, por makina po. Ndryshimi synon mënyrën se si modeli e lexon botën, jo si e lexon ti.
Pse vetëbesimi s'është e njëjta gjë me saktësinë
Pjesa shqetësuese është se një model i mashtruar nuk vepron i pasigurt. Zakonisht e jep përgjigjen e gabuar me vetëbesim të plotë, me të njëjtin ton që përdor kur ka të drejtë. S'ka asnjë dridhje në zë për të të paralajmëruar.
Kjo ka rëndësi kudo ku një vendim i IA-s ka pasoja të vërteta: miratimi ose bllokimi i një transaksioni, shqyrtimi i një fotoje a dokumenti, sinjalizimi i përmbajtjes, shkyçja e një pajisjeje, ose drejtimi i një makine. Nëse dikush mund të përgatisë një hyrje që e shtyn modelin te përgjigjja që ai do, vetëbesimi i tij bëhet një detyrim, jo një qetësim.
Mësimi praktik
Nuk të duhet t'i mbrosh vetë këto sulme. Mësimi ka të bëjë me besimin. Një vendim i IA-s është një hyrje e fortë për një gjykim, jo fjala e fundit, dhe një model i vetëm mund të gabojë, ose të bëhet të gabojë, ndërsa tingëllon krejtësisht i sigurt.
Prandaj, për çdo gjë që ka rëndësi, mbaj një njeri në zinxhir, lejo një mënyrë për të vënë në pyetje ose apeluar një vendim automatik, dhe mos lejo që "sistemi e tha" të jetë fjala e fundit e bisedës. Besimi i verbër te një dalje e vetme e IA-s është pikërisht hendeku që një sulm kundërshtar është ndërtuar për të shfrytëzuar.
Një pyetje për ta çuar përpara: mendo për një vendim të vetëm automatik që tashmë të prek, një pagesë që miratohet, një foto që përputhet, një pajisje që shkyçet nga fytyra jote. Nëse ai model mund të mashtrohej në heshtje drejt vetëbesimit të plotë, a do ta merrje vesh, dhe çfarë rruge kthimi do të kishe për ta vënë në pyetje?
Nga vjen ky mësim
Ndërtuar mbi
- Workshop 5: AI Security Tools and Defending Against AI-Enabled Threats (udhëzuesi V3.0): mësimi kundërshtar i makinës
Kurset e alphaPlan ndërtohen mbi programe të zhvilluara në klasë, e nuk shpiken për web-in. Kur një pohim mbështetet mbi një standard të jashtëm ose mbi një rast të raportuar, ai emërtohet më sipër që ta kontrollosh vetë e të mos na besosh në fjalë.
shënim: ky material u krijua në kuadër të projektit 'U.S. Cybersecurity Leadership in AI for Albania', financuar nga departamenti i shtetit i shteteve të bashkuara. mendimet, gjetjet dhe përfundimet e paraqitura këtu janë të autorit(ëve) dhe nuk pasqyrojnë domosdoshmërisht ato të departamentit të shtetit të shteteve të bashkuara.
Disclaimer: This material was created on behalf of the 'U.S. Cybersecurity Leadership in AI for Albania' project, funded by the United States Department of State. The opinions, findings, and conclusions stated herein are those of the author(s) and do not necessarily reflect those of the United States Department of State.
ShënimGjete diçka të paqartë, të vjetruar ose që mund të përmirësohet? Sugjero një përmirësim