AI-modeller og plattformer

TextFooler-algoritmen narret NLP-AI

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Så imponerende som naturlig språkbehandling-algoritmer og -systemer har blitt de siste årene, er de fortsatt sårbare for en type angrep kjent som “adversarial eksempel”. Adversarial eksempler er nøye konstruerte fraser som kan få et NLP-system til å oppføre seg på uventede og uønskede måter. AI-programmer kan bli tvunget til å oppføre seg dårlig med disse merkelige eksemplene, og som et resultat prøver AI-forskerne å designe måter å beskytte mot effekten av adversarial eksempler.

Nylig samarbeidet et team av forskere fra både University of Hong Kong og Agency for Science, Technology, and Research i Singapore for å lage en algoritme som demonstrerer faren med adversarial eksempler. Som Wired rapporterte, ble algoritmen kalt TextFooler av forskningsteamet, og den fungerer ved å endre små deler av en setning, som påvirker hvordan en NLP-klassifikator kan tolke setningen. Som et eksempel konverterte algoritmen en setning til en annen lignende setning, og setningen ble matet inn i en klassifikator designet for å bestemme om en anmeldelse var negativ eller positiv. Den opprinnelige setningen var:

“Figurene, castet i umulige konstruerte situasjoner, er fullstendig frakoblet fra virkeligheten.”

Den ble konvertert til denne setningen:

“Figurene, castet i umulige konstruerte omstendigheter, er fullstendig frakoblet fra virkeligheten.”

Disse små endringene førte til at tekst-klassifikatoren klassifiserte anmeldelsen som positiv i stedet for negativ. Forskingsteamet testet samme tilnærming (bytting av visse ord med synonymer) på flere forskjellige datasett og tekst-klassifikasjonsalgoritmer. Forskingsteamet rapporterer at de var i stand til å redusere en algoritmes klassifikasjonsnøyaktighet til bare 10%, ned fra 90%. Dette er til tross for at mennesker som leser disse setningene ville tolke dem som å ha samme mening.

Disse resultater er bekymringsverdige i en tid hvor NLP-algoritmer og AI brukes mer og mer hyppig, og for viktige oppgaver som å vurdere medisinske krav eller analysere juridiske dokumenter. Det er ukjent hvor stor fare adversarial eksempler er for nåværende algoritmer. Forskingsteam rundt om i verden prøver fortsatt å fastslå hvor stor innvirkning de kan ha. Nylig publiserte en rapport fra Stanford Human-Centered AI-gruppen at adversarial eksempler kunne narre AI-algoritmer og brukes til å begå skattebedrageri.

Det finnes noen begrensninger i den nylige studien. For eksempel bemerket Sameer Singh, en assistentprofessor i datavitenskap ved UC Irvine, at den adversarial metoden som ble brukt var effektiv, men den avhenger av noen kunnskap om AI-arkitekturen. AI-en må bli gjentakende testet til en effektiv gruppe ord kan bli funnet, og slike gjentakende angrep kan bli lagt merke til av sikkerhetsprogrammer. Singh og kolleger har gjort sin egen forskning på emnet og funnet at avanserte systemer som OpenAI-algoritmer kan levere rasistiske, skadelige tekster når de blir promptet med bestemte utløsende fraser.

Adversarial eksempler er også et potensielt problem når det gjelder visuell data som bilder eller video. Et berømt eksempel involverer å bruke bestemte subtile digitale transformasjoner på et bilde av en katt, og får bilde-klassifikatoren til å tolke det som en skjerm eller en datamaskin. I et annet eksempel fant forskning gjort av UC Berkeley-professoren Dawn Song at adversarial eksempler kan brukes til å endre hvordan veiskilt blir oppfattet av datavisjonssystemer, noe som potensielt kan være farlig for autonome kjøretøy.

Forskning som det som er gjort av Hong Kong-Singapore-teamet kan hjelpe AI-ingeniører til bedre å forstå hvilke typer sårbarheter AI-algoritmer har, og potensielt designe måter å beskytte mot disse sårbarhetene. For eksempel kan ensemble-klassifikatorer brukes til å redusere sjansen for at et adversarial eksempel kan narre datavisjonssystemet. Med denne teknikken brukes en rekke klassifikatorer, og små transformasjoner blir gjort på inndata-bildet. De fleste klassifikatorene vil vanligvis oppdage aspekter av bildets sanne innhold, som deretter blir aggregert sammen. Resultatet er at selv om noen av klassifikatorene blir narret, vil de fleste ikke bli det, og bildet vil bli korrekt klassifisert.

Blogger og programmerer med spesialområder i Machine Learning og Deep Learning emner. Daniel håper å hjelpe andre med å bruke kraften av AI for sosialt godt.