AI-modellen en platforms

TextFooler-algoritme misleidt NLP-AI

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Hoewel natuurlijke taalverwerking algoritmen en systemen in de afgelopen jaren indrukwekkend zijn geworden, zijn ze nog steeds kwetsbaar voor een soort exploit bekend als een “adversarial example”. Adversarial examples zijn zorgvuldig geconstrueerde zinnen die een NLP-systeem kunnen doen gedragen op onverwachte en ongewenste manieren. AI-programma’s kunnen met deze vreemde voorbeelden worden misleid, en als gevolg daarvan proberen AI-onderzoekers manieren te ontwerpen om zich te beschermen tegen de effecten van adversarial examples.

Onlangs werkten onderzoekers van de Universiteit van Hong Kong en het Agentschap voor Wetenschap, Technologie en Onderzoek in Singapore samen om een algoritme te creëren dat de gevaarlijkheid van adversarial examples aantoont. Volgens Wired noemde het onderzoekteam het algoritme TextFooler en het werkt door subtiele veranderingen aan te brengen in delen van een zin, waardoor de manier waarop een NLP-classificator de zin interpreteert, wordt beïnvloed. Als voorbeeld zette het algoritme één zin om in een andere vergelijkbare zin en voerde deze in een classificator die was ontworpen om te bepalen of een beoordeling positief of negatief was. De oorspronkelijke zin was:

“De personages, gecast in onmogelijk geconstrueerde situaties, zijn volledig vervreemd van de realiteit.”

Het werd omgezet in de volgende zin:

“De personages, gecast in onmogelijk geëngineerde omstandigheden, zijn volledig vervreemd van de realiteit.”

Deze subtiele veranderingen zorgden ervoor dat de tekstclassificator de beoordeling als positief in plaats van negatief classificeerde. Het onderzoeksteam testte dezelfde aanpak (het vervangen van bepaalde woorden met synoniemen) op verschillende datasets en tekstclassificatie-algoritmen. Het onderzoeksteam meldt dat ze erin slaagden de classificatie-accuratesse van een algoritme te verlagen tot slechts 10%, van 90%. Dit is ondanks het feit dat mensen die deze zinnen lezen, ze zouden interpreteren als having dezelfde betekenis.

Deze resultaten zijn verontrustend in een tijdperk waarin NLP-algoritmen en AI steeds vaker worden gebruikt, en voor belangrijke taken zoals het beoordelen van medische claims of het analyseren van juridische documenten. Het is onbekend hoe groot het gevaar is dat adversarial examples vormen voor de momenteel gebruikte algoritmen. Onderzoeksteams over de hele wereld proberen nog steeds te bepalen hoe groot de impact kan zijn. Onlangs suggereerde een rapport van de Stanford Human-Centered AI-groep dat adversarial examples AI-algoritmen kunnen misleiden en gebruikt kunnen worden om belastingfraude te plegen.

Er zijn enkele beperkingen aan de recente studie. Zo merkt Sameer Singh, een assistent-professor in de informatica aan de UC Irvine, op dat de gebruikte adversarial-methode effectief was, maar dat deze afhankelijk is van enige kennis van de AI-architectuur. De AI moet herhaaldelijk worden geprobeerd totdat een effectieve groep woorden kan worden gevonden, en dergelijke herhaalde aanvallen kunnen door beveiligingsprogramma’s worden opgemerkt. Singh en zijn collega’s hebben hun eigen onderzoek gedaan naar het onderwerp en hebben ontdekt dat geavanceerde systemen zoals OpenAI-algoritmen racistische, schadelijke tekst kunnen leveren wanneer ze worden geprompt met bepaalde triggerfrases.

Adversarial examples vormen ook een potentieel probleem bij het omgaan met visuele gegevens zoals foto’s of video’s. Een beroemd voorbeeld houdt in dat bepaalde subtiele digitale transformaties worden toegepast op een afbeelding van een kat, waardoor de beeldclassificator de afbeelding als een monitor of desktop-pc interpreteert. In een ander voorbeeld vond onderzoek van de UC Berkeley-professor Dawn Song uit dat adversarial examples kunnen worden gebruikt om te veranderen hoe verkeersborden worden waargenomen door computervisi-systemen, wat potentieel gevaarlijk kan zijn voor autonome voertuigen.

Onderzoek zoals dat door het Hong Kong-Singapore-team is gedaan, kan helpen om AI-ingenieurs beter te laten begrijpen welke soorten kwetsbaarheden AI-algoritmen hebben, en potentieel manieren te ontwerpen om zich te beschermen tegen deze kwetsbaarheden. Als voorbeeld kunnen ensemble-classificatoren worden gebruikt om de kans te verkleinen dat een adversarial example een computervisi-systeem kan misleiden. Met deze techniek worden meerdere classificatoren gebruikt en worden subtiele transformaties aangebracht op de invoer-afbeelding. De meerderheid van de classificatoren zal typisch aspecten van de werkelijke inhoud van de afbeelding onderscheiden, die vervolgens worden geaggregeerd. Het resultaat is dat zelfs als een paar classificatoren worden misleid, de meeste dat niet zullen zijn en de afbeelding correct zal worden geclassificeerd. De meeste classificatoren zullen de afbeelding correct classificeren, zelfs als een paar worden misleid.

Blogger en programmeur met specialisaties in Machine Learning en Deep Learning onderwerpen. Daniel hoopt anderen te helpen de kracht van AI te gebruiken voor het sociale goede.