Andersons vinkel

Attackerar naturliga språkbehandlingsystem med adversariala exempel

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Forskare i Storbritannien och Kanada har utvecklat en serie svarta låda-angrepp mot naturliga språkbehandlingsystem (NLP) som är effektiva mot en mängd olika språkbehandlingsramverk, inklusive breda system från Google, Facebook, IBM och Microsoft.

Attacken kan potentiellt användas för att lamslå maskinöversättningsystem genom att tvinga dem att antingen producera nonsens eller faktiskt ändra översättningens natur; för att flaskhalsa utbildning av NLP-modeller; för att missklassificera giftigt innehåll; för att förgifta sökmotorsresultat genom att orsaka felaktig indexering; för att orsaka att sökmotorer misslyckas med att identifiera skadligt eller negativt innehåll som är perfekt läsbart för en person; och till och med för att orsaka DoS-attacker mot NLP-ramverk.

Forskarna har avslöjat de föreslagna sårbarheterna i artikeln för olika oidentifierade parter vars produkter finns med i forskningen, men de anser att NLP-branschen har varit långsam med att skydda sig mot adversariala attacker. Artikeln säger:

‘Dessa attacker utnyttjar språkkodningsfunktioner, såsom osynliga tecken och homoglyfer. Även om de har setts ibland i det förflutna i skräppost och phishingbedrägerier, verkar det som att utvecklarna av de många NLP-system som nu distribueras i stor skala har ignorerat dem helt.’

Flera av attackerna genomfördes i en så “svart låda”-miljö som möjligt – via API-anrop till MLaaS-system, snarare än lokalt installerade FOSS-versioner av NLP-ramverken. Om systemens kombinerade effektivitet skriver författarna:

‘Alla experiment utfördes i en svart låda-miljö där obegränsade modellutvärderingar tillåts, men åtkomst till den utvärderade modellens vikt eller tillstånd är inte tillåten. Detta representerar en av de starkaste hotmodellerna för vilka attacker är möjliga i nästan alla miljöer, inklusive mot kommersiella Machine-Learning-as-a-Service (MLaaS)-erbjudanden. Varje modell som undersöktes var sårbar för oförnimmelbara perturbationsattacker.

‘Vi tror att tillämpbarheten av dessa attacker bör i teorin generaliseras till alla textbaserade NLP-modeller utan tillräckliga försvar på plats.’

Artikeln heter Bad Characters: Imperceptible NLP Attacks, och kommer från tre forskare vid tre institutioner vid University of Cambridge och University of Edinburgh, och en forskare från University of Toronto.

Artikelns titel är exemplarisk: den är fylld med “oförnimmelbara” Unicode-tecken som utgör grunden för en av de fyra huvudsakliga attackmetoderna som forskarna har antagit.

Även artikelns titel har dolda mysterier.

Även artikelns titel har dolda mysterier.

Metod/er

Artikeln föreslår tre primära effektiva attackmetoder: osynliga tecken; homoglyfer; och omordningar. Dessa är de “universella” metoderna som forskarna har funnit har stor räckvidd mot NLP-ramverk i svarta låda-scenarier. En ytterligare metod, som innebär användning av en ta bort-tecken, fann forskarna vara lämplig endast för ovanliga NLP-pipelines som använder operativsystemets urklipp.

1: Osynliga tecken

Denna attack använder kodade tecken i en teckensnitt som inte kartläggs till en glyf i Unicode-systemet. Unicode-systemet var designat för att standardisera elektronisk text, och täcker nu 143 859 tecken över flera språk och symbolgrupper. Många av dessa kartläggningar kommer inte att innehålla något synligt tecken i ett teckensnitt (som inte kan innehålla tecken för varje möjlig post i Unicode).

Från artikeln, ett hypotetiskt exempel på en attack som använder osynliga tecken, som delar upp orden i segment som antingen inte betyder något för ett naturligt språkbehandlingsystem, eller, om de är noggrant utformade, kan betyda något annat för en korrekt översättning. För den vanliga läsaren är den ursprungliga texten korrekt.

Från artikeln, ett hypotetiskt exempel på en attack som använder osynliga tecken, som delar upp indataorden i segment som antingen inte betyder något för ett naturligt språkbehandlingsystem, eller, om de är noggrant utformade, kan förhindra en korrekt översättning. För den vanliga läsaren är den ursprungliga texten i båda fallen korrekt. Source: https://arxiv.org/pdf/2106.09898.pdf

Vanligtvis kan du inte bara använda ett av dessa icke-tecken för att skapa ett nollbreddsutrymme, eftersom de flesta system kommer att rendera en “platshållar”-symbol (såsom en fyrkant eller ett frågetecken i en vinklad ruta) för att representera det oigenkända tecknet.

Men, som artikeln observerar, är det bara ett fåtal teckensnitt som dominerar den nuvarande datormiljön, och, inte oväntat, tenderar de att följa Unicode-standarden.

Därför valde forskarna GNU:s Unifont-glyfer för sina experiment, delvis på grund av dess “robusta täckning” av Unicode, men också för att det liknar många av de “standard”-teckensnitten som sannolikt kommer att matas in i NLP-system.

Tillämpningar
När vi återvänder till artikelns “utformade” titel, kan vi se att att utföra en Google-sökning från den valda texten inte ger det förväntade resultatet:

Detta är en klient-sidoeffekt, men server-sidoeffekterna är en aning allvarligare. Artikeln observerar:

‘Även om ett perturberat dokument kan crawlas av en sökmotors crawler, kommer termerna som används för att indexera det att påverkas av perturbationerna, vilket gör det mindre troligt att det dyker upp från en sökning på operturberade termer. Det är således möjligt att dölja dokument från sökmotorer “i öppen dager.”

‘Som ett exempel på tillämpning, kunde ett ohederligt företag maskera negativ information i sina finansiella rapporter så att specialiserade sökmotorer som används av aktieanalytiker misslyckas med att upptäcka dem.’

De enda scenarierna där “osynliga tecken”-attacken visade sig vara mindre effektiv var mot giftigt innehåll, namngiven entitetsigenkänning (NER) och sentimentanalysmodeller. Författarna antar att detta beror på att modellerna tränades på data som också innehöll osynliga tecken, eller att modellens tokenisator (som bryter ner rå språkingång i modulära komponenter) redan var konfigurerad för att ignorera dem.

2: Homoglyfer

En homoglyf är ett tecken som ser ut som ett annat tecken – en semantisk svaghet som utnyttjades 2000 för att skapa en scam-replika av PayPal (PYPL ) -betalningsprocessens domän.

I ett hypotetiskt exempel från artikeln, ändrar en homoglyf-attack översättningens betydelse genom att ersätta visuellt olikartade homoglyfer (i rött) med vanliga latinska tecken.

I ett hypotetiskt exempel från artikeln, ändrar en homoglyf-attack översättningens betydelse genom att ersätta visuellt olikartade homoglyfer (i rött) med vanliga latinska tecken.

Författarna kommenterar:

‘Vi har funnit att maskinlärningsmodeller som bearbetar användar-tillhandahållet text, såsom neuralt översättningssystem, är särskilt sårbara för denna typ av attack. Tänk till exempel på den marknadsledande tjänsten Google Translate. Vid tidpunkten för skrivandet, när man anger strängen “paypal” i den engelska till ryska modellen, producerar den korrekt “PayPal”, men om man ersätter det latinska tecknet a i indata med det kyrilliska tecknet а producerar den felaktigt “папа” (“far” på engelska).’

Forskarna observerar att medan många NLP-pipelines kommer att ersätta tecken som ligger utanför deras språkspecifika ordbok med en <unk> (‘okänd’) token, kan de program som anropar det förgiftade texten i pipelinen propagera okända ord för utvärdering innan denna säkerhetsåtgärd kan aktiveras. Författarna påstår att detta “öppnar en överraskande stor attackyta”.

3: Omordningar

Unicode tillåter språk som skrivs från vänster till höger, med ordningen hanterad av Unicode’s Bidirectional (BIDI)-algoritm. Att blanda höger-till-vänster- och vänster-till-höger-tecken i en enskild sträng är därför förvirrande, och Unicode har gjort tillstånd för detta genom att tillåta BIDI att åsidosättas av specialkontrolltecken. Dessa möjliggör nästan godtycklig rendering för en fast kodningsordning.

I ett annat teoretiskt exempel från artikeln, orsakar en omordningsattack att översättningsmekanismen sätter alla bokstäver i den översatta texten i fel ordning, eftersom den lyder den felaktiga höger-till-vänster/vänster-till-höger-kodningen, på grund av en del av den adversariala källtexten (cirkel) som befaller den att göra så.

I ett annat teoretiskt exempel från artikeln, orsakar en omordningsattack att översättningsmekanismen sätter alla bokstäver i den översatta texten i fel ordning, eftersom den lyder den felaktiga höger-till-vänster/vänster-till-höger-kodningen, på grund av en del av den adversariala källtexten (cirkel) som befaller den att göra så.

Författarna påstår att vid tidpunkten för artikelskrivandet var metoden effektiv mot Unicode-implementationen i Chromium-webbläsaren, den uppströmskällan för Google’s Chrome-webbläsare, Microsoft’s Edge-webbläsare och ett antal andra grenar.

Även: Ta bort

Inkluderat här så att de efterföljande resultattabellerna är tydliga, är ta bort-attacken en attack som innebär att man inkluderar ett tecken som representerar en backspace eller annan text-påverkande kontroll/kommando, som effektivt implementeras av språk-lässystemet på ett sätt som liknar en text-makro.

Författarna observerar:

‘En liten mängd kontrolltecken i Unicode kan orsaka att intilliggande text tas bort. De enklaste exemplen är backspace (BS) och delete (DEL). Det finns också carriage return (CR) som orsakar text-renderingsalgoritmen att återvända till början av raden och skriva över dess innehåll.

‘Till exempel, kodad text som representerar “Hello CRGoodbye World” kommer att renderas som “Goodbye World”.’

Som nämnts tidigare, kräver denna attack en osannolik nivå av åtkomst för att fungera, och skulle bara vara helt effektiv med text som kopierats och klistrats via en urklipp, systematiskt eller inte – en ovanlig NLP-ingestionspipeline.

Forskarna testade den ändå, och den presterar jämförbart med dess stabilmakare. Men attacker som använder de tre första metoderna kan implementeras genom att bara ladda upp dokument eller webbsidor (i fallet med en attack mot sökmotorer och/eller webbskrapning NLP-pipelines).

I en ta bort-attack, tar de utformade tecknen effektivt bort vad som föregår dem, eller tvingar enstaka radtext in i en andra rad, i båda fallen utan att göra detta uppenbart för den vanliga läsaren.

I en ta bort-attack, tar de utformade tecknen effektivt bort vad som föregår dem, eller tvingar enstaka radtext in i en andra rad, i båda fallen utan att göra detta uppenbart för den vanliga läsaren.

Effektivitet mot nuvarande NLP-system

Forskarna utförde en rad oriktade och riktade attacker mot fem populära slutna modeller från Facebook, IBM, Microsoft, Google och HuggingFace, samt tre öppen källkodsmodeller.

De testade också ‘sponge’-attacker mot modellerna. En sponge-attack är i princip en DoS-attack för NLP-system, där indata-texten “inte fungerar”, och orsakar att utbildning blir kritiskt långsam – en process som normalt borde vara omöjlig att göra på grund av dataförbehandling.

De fem NLP-uppgifter som utvärderades var maskinöversättning, giftigt innehållsdetektering, textuell implikation, namngiven entitetsigenkänning och sentimentanalys.

Testerna utfördes på ett obestämt antal Tesla P100 GPU:er, var och en som körde en Intel Xeon Silver 4110 CPU på Ubuntu. För att inte bryta mot tjänstevillkor i fallet med API-anrop, upprepades experimenten enhetligt med en perturbationsbudget på noll (opåverkad källtext) till fem (maximal störning). Forskarna hävdar att resultaten de fick kunde överskridas om ett större antal iterationer tilläts.

Resultat från att applicera adversariala exempel mot Facebooks Fairseq EN-FR-modell.

Resultat från att applicera adversariala exempel mot Facebooks Fairseq EN-FR-modell.

Resultat från attacker mot IBMs giftigt innehållsklassificerare och Googles Perspective API.

Resultat från attacker mot IBMs giftigt innehållsklassificerare och Googles Perspective API.

Två attacker mot Facebooks Fairseq: 'oriktad' syftar till att störa, medan 'riktad' syftar till att ändra översatt språks betydelse.

Två attacker mot Facebooks Fairseq: ‘oriktad’ syftar till att störa, medan ‘riktad’ syftar till att ändra översatt språks betydelse.

Forskarna testade också sitt system mot tidigare ramverk som inte kunde generera “läsbart” perturberande text på samma sätt, och fann att systemet var i stort sett jämförbart med dessa, och ofta märkbart bättre, samtidigt som det behöll den stora fördelen med smyg.

Den genomsnittliga effektiviteten över alla metoder, attackvektorer och mål svävar runt 80%, med mycket få iterationer körda.

I en kommentar om resultaten säger forskarna:

‘Kanske den mest oroande aspekten av våra oförnimmelbara perturbationsattacker är deras breda tillämpbarhet: alla textbaserade NLP-system vi testade är sårbara. Verkligen, alla maskinlärningsmodeller som bearbetar användar-tillhandahållen text som indata är teoretiskt sett sårbara för denna attack.

‘De adversariala implikationerna kan variera från en tillämpning till en annan och från en modell till en annan, men alla textbaserade modeller är baserade på kodad text, och all text är föremål för adversarial kodning såvida inte kodningen är lämpligt begränsad.’

Universal optisk teckenigenkänning?

Dessa attacker beror på vad som i princip är “sårbarheter” i Unicode, och skulle undvikas i en NLP-pipeline som rasteriserar all inkommande text och använder optisk teckenigenkänning som en saneringsåtgärd. I så fall skulle samma icke-maligna semantiska betydelse som är synlig för människor som läser dessa perturberade attacker också överföras till NLP-systemet.

Men när forskarna implementerade en OCR-pipeline för att testa denna teori, fann de att BLEU (Bilingual Evaluation Understudy) poängen minskade baseline-precisionen med 6,2%, och föreslog att förbättrade OCR-teknologier sannolikt skulle krävas för att åtgärda detta.

De föreslog också att BIDI-kontrolltecken bör tas bort från indata som standard, att ovanliga homoglyfer bör mappas och indexeras (vilket de karakteriserar som “en överväldigande uppgift”), och att tokenisatorer och andra ingestionsmekanismer bör beväpnas mot osynliga tecken.

I slutet av forskargruppen uppmanar NLP-sektorn att bli mer medveten om möjligheterna för adversariala attacker, som för närvarande är ett område av stort intresse inom datorteknikforskning.

‘[Vi] rekommenderar att alla företag som bygger och distribuerar textbaserade NLP-system implementerar sådana försvar om de vill att deras applikationer ska vara robusta mot skadliga aktörer.’

 

 

* Min omvandling av inline-citat till hyperlänkar

18:08 den 14 december 2021 – tog bort dubbel nämnande av IBM, flyttade auto-intern länk från citat – MA

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai