AI-modeller og platforme
TextFooler Algoritmen Får NLP AI Til At Lyve
Så imponerende som naturligsproglige bearbejdningstalgoritmer og -systemer er blevet de seneste år, er de stadig sårbare over for en type udnyttelse kendt som et “adversarialt eksempel”. Adversarial eksempler er omhyggeligt designede fraser, der kan få et NLP-system til at opføre sig på uventede og uønskede måder. AI-programmer kan fås til at opføre sig forkert med disse underlige eksempler, og som følge heraf prøver AI-forskere at designe måder at beskytte imod effekterne af adversarial eksempler.
For nylig samarbejdede et hold af forskere fra både University of Hong Kong og Agency for Science, Technology, and Research i Singapore om at skabe en algoritme, der demonstrerer farerne ved adversarial eksempler. Som Wired rapporterede, blev algoritmen kaldt TextFooler af forskerholdet, og den fungerer ved at ændre bestemte dele af en sætning, hvilket kan påvirke, hvordan en NLP-klassifikator kan fortolke sætningen. Som eksempel konverterede algoritmen en sætning til en anden lignende sætning, og sætningen blev født ind i en klassifikator designet til at bestemme, om en anmeldelse var negativ eller positiv. Den originale sætning var:
“Figurerne, der er castet i umuligt konstruerede situationer, er totalt fravalgt fra virkeligheden.”
Den blev konverteret til denne sætning:
“Figurerne, der er castet i umuligt designet omstændigheder, er fuldstændigt fravalgt fra virkeligheden.”
Disse subtile ændringer fik tekstklassifikatoren til at klassificere anmeldelsen som positiv i stedet for negativ. Forskerholdet testede den samme tilgang (erstatning af bestemte ord med synonymer) på flere forskellige datasæt og tekstklassifikationsalgoritmer. Forskerholdet rapporterer, at de kunne reducere en algoritmes klassifikationsnøjagtighed til kun 10%, ned fra 90%. Dette er på trods af, at mennesker, der læser disse sætninger, ville fortolke dem som havende samme betydning.
Disse resultater er bekymrende i en æra, hvor NLP-algoritmer og AI bruges mere og mere hyppigt, og til vigtige opgaver som vurdering af medicinske krav eller analyse af juridiske dokumenter. Det er ukendt, hvor stor en fare adversarial eksempler er for nuværende algoritmer. Forskerhold rundt om i verden prøver stadig at fastslå, hvor stor en indvirkning de kan have. For nylig foreslog en rapport udgivet af Stanford Human-Centered AI-gruppen, at adversarial eksempler kunne bedrage AI-algoritmer og bruges til at begå skattebedrageri.
Der er nogle begrænsninger i den seneste studie. For eksempel bemærker Sameer Singh, en adjunktprofessor i datalogi ved UC Irvine, at den adversarial metode, der blev brugt, var effektiv, men den afhænger af visse kendskab til AI’ens arkitektur. AI’en skal gentagne gange undersøges, indtil en effektiv gruppe af ord kan findes, og sådanne gentagne angreb kan muligvis blive bemærket af sikkerhedsprogrammer. Singh og kolleger har udført deres egen forskning på emnet og fundet, at avancerede systemer som OpenAI-algoritmer kan levere racistiske, skadelige tekster, når de udløses med bestemte udløsende fraser.
Adversarial eksempler er også et potentiale problem, når det handler om visuelle data som billeder eller video. Et berømt eksempel involverer at anvende bestemte subtile digitale transformationer på et billede af en killling, hvilket får billedklassifikatoren til at fortolke det som en skærm eller en desktop-PC. I et andet eksempel fandt forskning udført af UC Berkeley-professoren Dawn Song, at adversarial eksempler kan bruges til at ændre, hvordan vejsskilte opfattes af computer vision systemer, hvilket potentielt kan være farligt for selvstændige køretøjer.
Forskning som den, der er udført af Hong Kong-Singapore-holdet, kan hjælpe AI-ingeniører med at forstå, hvilke slags sårbarheder AI-algoritmer har, og potentielt designe måder at beskytte imod disse sårbarheder. For eksempel kan ensemble-klassifikatorer bruges til at reducere sandsynligheden for, at et adversarial eksempel kan bedrage computer vision systemet. Med denne teknik bruges en række klassifikatorer, og små transformationer gøres på inputbilledet. De fleste klassifikatorer vil typisk opdage aspekter af billedets sande indhold, som derefter samles sammen. Resultatet er, at selv om nogle af klassifikatorerne bliver bedraget, så gør de fleste det ikke, og billedet bliver korrekt klassificeret.












