AI-modeller och plattformar
TextFooler-algoritmen lurar NLP-AI
Så imponerande som naturligt språkbehandlingsalgoritmer och system har blivit under de senaste åren är de fortfarande sårbara för en typ av exploatering som kallas “adversarial exempel”. Adversarial exempel är noggrant utformade fraser som kan få en NLP-system att bete sig på oväntade och oönskade sätt. AI-program kan fås att missbete sig med dessa konstiga exempel, och som ett resultat försöker AI-forskare att utforma sätt att skydda mot effekterna av adversarial exempel.
Nyligen samarbetade en grupp forskare från både University of Hong Kong och Agency for Science, Technology, and Research i Singapore för att skapa en algoritm som demonstrerar faran med adversarial exempel. Enligt Wired döptes algoritmen till TextFooler av forskarteamet och den fungerar genom att subtilt ändra delar av en mening, vilket påverkar hur en NLP-klassificerare kan tolka meningen. Som exempel omvandlade algoritmen en mening till en annan liknande mening och meningen matades in i en klassificerare som var utformad för att bestämma om en recension var negativ eller positiv. Den ursprungliga meningen var:
“Karaktärerna, som är placerade i omöjliga konstruerade situationer, är totalt främmande för verkligheten.”
Den omvandlades till denna mening:
“Karaktärerna, som är placerade i omöjliga utformade omständigheter, är fullständigt främmande för verkligheten.”
Dessa subtila ändringar fick textklassificeraren att klassificera recensionen som positiv istället för negativ. Forskarteamet testade samma tillvägagångssätt (att byta ut vissa ord med synonymer) på flera olika datamängder och textklassificeringsalgoritmer. Forskarteamet rapporterar att de kunde minska en algoritmns klassificeringsnoggrannhet till bara 10%, ner från 90%. Detta trots att människor som läser dessa meningar skulle tolka dem som att ha samma betydelse.
Dessa resultat är oroande i en era där NLP-algoritmer och AI används alltmer frekvent och för viktiga uppgifter som att bedöma medicinska anspråk eller analysera juridiska dokument. Det är okänt hur stor fara adversarial exempel utgör för för närvarande använda algoritmer. Forskarteam runt om i världen försöker fortfarande att fastställa hur stor inverkan de kan ha. Nyligen publicerade en rapport från Stanford Human-Centered AI-gruppen att adversarial exempel kunde lura AI-algoritmer och användas för att begå skattebedrägeri.
Det finns vissa begränsningar i den senaste studien. Till exempel noterar Sameer Singh, biträdande professor i datavetenskap vid UC Irvine, att den adversarial metod som användes var effektiv, men den kräver viss kunskap om AI:s arkitektur. AI:n måste undersökas upprepade gånger tills en effektiv grupp av ord kan hittas, och sådana upprepade attacker kan upptäckas av säkerhetsprogram. Singh och kollegor har gjort sin egen forskning på ämnet och funnit att avancerade system som OpenAI-algoritmer kan leverera rasistisk, skadlig text när de utlöses av vissa utlösande fraser.
Adversarial exempel är också ett potentiellt problem när det gäller visuella data som foton eller video. Ett berömt exempel innebär att applicera vissa subtila digitala transformationer på en bild av en kattunge, vilket får bildklassificeraren att tolka den som en skärm eller en dator. I ett annat exempel fann forskning som utfördes av UC Berkeley-professorn Dawn Song att adversarial exempel kan användas för att ändra hur vägskyltar uppfattas av datorseende system, vilket potentiellt kan vara farligt för autonoma fordon.
Forskning som den som utförts av Hongkong-Singapore-teamet kan hjälpa AI-ingenjörer att bättre förstå vilka typer av sårbarheter AI-algoritmer har och potentiellt utforma sätt att skydda mot dessa sårbarheter. Till exempel kan ensemble-klassificerare användas för att minska chansen att ett adversarial exempel kan lura datorseende systemet. Med denna teknik används ett antal klassificerare och subtila transformationer görs på indata-bilden. De flesta klassificerarna kommer vanligtvis att upptäcka aspekter av bildens verkliga innehåll, som sedan sammanfogas. Resultatet är att även om några av klassificerarna luras, kommer de flesta inte att göra det och bilden kommer att klassificeras korrekt. När de används och subtila transformationer görs på indata-bilden, kommer de flesta klassificerarna att upptäcka aspekter av bildens verkliga innehåll, som sedan sammanfogas. Resultatet är att även om några av klassificerarna luras, kommer de flesta inte att göra det och bilden kommer att klassificeras korrekt.












