Andersons vinkel

Angrep mot naturlig språkbehandlingssystemer med motstridende eksempler

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Forskere i Storbritannia og Canada har utviklet en rekke svarte boks-angrep mot naturlig språkbehandlingssystemer (NLP) som er effektive mot en rekke populære språkbehandlingsrammeverk, inkludert vidt distribuerte systemer fra Google, Facebook, IBM og Microsoft.

Angrepet kan potensielt brukes til å lamme maskinlærings-oversettelsessystemer ved å tvinge dem til å produsere nonsens eller endre naturen til oversettelsen; å hindre trening av NLP-modeller; å misklassifisere giftig innhold; å forgifte søkemotorens resultater ved å forårsake feilaktig indeksering; å få søkemotorene til å feile å identifisere skadelig eller negativt innhold som er fullstendig lesbar for en person; og sogar å forårsake DoS-angrep på NLP-rammeverk.

Selv om forfatterne har avdekket papirets foreslåtte sårbarheter til ulike ubeskrevne parter hvis produkter er med i forskningen, mener de at NLP-bransjen har vært sen med å beskytte seg mot motstridende angrep. Papiret sier:

‘Disse angrep utnytter språkkodingsegenskaper, som usynlige tegn og homoglyfer. Selv om de har vært sett tidligere i spam og phishing-svindel, ser det ut til at designerne av de mange NLP-systemene som nå deployeres i stor skala, har ignorert dem fullstendig.’

Flere av angrepene ble utført i en så “svart boks”-miljø som mulig – via API-forespørsler til MLaaS-systemer, i stedet for lokalt installerte FOSS-versjoner av NLP-rammeverkene. Om systemenes kombinerede effektivitet skriver forfatterne:

‘Alle eksperimentene ble utført i en svart boks-innstilling der ubegrensede modellvurderinger er tillatt, men å få tilgang til den vurderede modellens vekter eller tilstand er ikke tillatt. Dette representerer en av de sterkeste trusselmodellene for hvilke angrep er mulige i nesten alle sammenhenger, inkludert mot kommersielle Machine-Learning-as-a-Service (MLaaS)-tilbud. Hver modell som ble undersøkt, var sårbar for usynlige perturbasjonsangrep.

‘Vi tror at anvendeligheten av disse angrep bør i teorien generalisere til enhver tekstbasert NLP-modell uten tilstrekkelige forsvar.’

Papiret het Bad Characters: Imperceptible NLP Attacks, og kommer fra tre forskere på tre avdelinger ved University of Cambridge og University of Edinburgh, og en forsker fra University of Toronto.

Papirets tittel er eksemplarisk: den er fylt med ‘usynlige’ Unicode-tegn som danner grunnlaget for en av de fire hovedangrepsmetodene som forskerne har valgt.

Even the paper's title has hidden mysteries.

Even the paper’s title has hidden mysteries.

Metode/r

Papiret foreslår tre primære effektive angrepsmetoder: usynlige tegn; homoglyfer; og omordning. Disse er de ‘universelle’ metodene som forskerne har funnet å ha stor rekkevidde mot NLP-rammeverk i svarte boks-sammenhenger. En ekstra metode, som involverer bruk av en slett-tegn, ble funnet av forskerne å være egnet kun for uvanlige NLP-pipelines som bruker operativsystemets klippbord.

1: Usynlige tegn

Dette angrepet bruker kodete tegn i en font som ikke kartlegger til et glyf i Unicode-systemet. Unicode-systemet ble designet for å standardisere elektronisk tekst, og dekker nå 143 859 tegn over flere språk og symbolgrupper. Mange av disse kartleggingene vil ikke inneholde noen synlig tegn i en font (som ikke kan, naturligvis, inneholde tegn for hver mulig innføring i Unicode).

From the paper, a hypothetical example of an attack using invisible characters, which split up the words into segments which either mean nothing to a Natural Language Processing system, or, if carefully crafted, can mean something different to an accurate translation. For the casual reader, the original text is correct.

From the paper, a hypothetical example of an attack using invisible characters, which splits up the input words into segments that either mean nothing to a Natural Language Processing system, or, if carefully crafted, can prevent an accurate translation. For the casual reader, the original text in both cases is correct. Source: https://arxiv.org/pdf/2106.09898.pdf

Vanligvis kan du ikke bare bruke ett av disse ikke-tegnene til å opprette en null-bredde mellomrom, siden de fleste systemer vil rendre en ‘placeholder’-symbol (slik som en firkant eller et spørsmål i en vinklet boks) for å representere det ukjente tegnet.

Men, som papiret observerer, er det bare et fåtall fonter som dominerer den nåværende datamaskinscenen, og, ikke overraskende, holder de til Unicode-standarden.

Forskerne valgte derfor GNU’s Unifont-glyfer for sine eksperimenter, delvis på grunn av dens ‘robuste dekning’ av Unicode, men også fordi den ligner mange av de andre ‘standard’-fontene som sannsynligvis vil bli matet til NLP-systemer. Mens de usynlige tegnene produsert fra Unifont ikke rendres, teller de likevel som synlige tegn i NLP-systemene som ble testet.

Anvendelser
Ved å returnere til papirets ‘craftede’ tittel, kan vi se at å utføre en Google-søk fra den valgte teksten ikke oppnår det forventede resultatet:

Dette er en klient-sidig effekt, men server-sidig konsekvenser er litt mer alvorlige. Papiret observerer:

‘Selv om en perturbert dokument kan bli crawlet av en søkemotors crawler, vil termene som brukes til å indeksere det, bli påvirket av perturbasjonene, og gjøre det mindre sannsynlig at det dukker opp fra en søk på uperturberte termer. Det er derfor mulig å skjule dokumenter fra søkemotorene “i åpenbarhet”.

‘Som et eksempel på anvendelse, kunne en uærlig bedrift maskere negativ informasjon i sine finansielle rapporter, så at spesialist-søkemotorene som brukes av aksjeanalytikere, ikke klarer å oppdage det.’

De eneste scenariene hvor ‘usynlige tegn’-angrepet viste seg å være mindre effektivt, var mot giftig innhold, Navn-Entitet-Gjenkjenning (NER) og sentiment-analysemodeller. Forfatterne antar at dette skyldes at modellene ble trent på data som også inneholdt usynlige tegn, eller at modellens tokenizer (som bryter rå språkinndata ned i modulære komponenter) allerede var konfigurert til å ignorere dem.

2: Homoglyfer

En homoglyf er et tegn som ligner et annet tegn – en semantisk svakhet som ble utnyttet i 2000 for å lage en svindel-replika av PayPal (PYPL ) -betalingssystemets domene.

In this hypothetical example from the paper, a homoglyph attack changes the meaning of a translation by substituting visually indistinguishable homoglyphs (outlined in red) for common Latin characters.

In this hypothetical example from the paper, a homoglyph attack changes the meaning of a translation by substituting visually indistinguishable homoglyphs (outlined in red) for common Latin characters.

Forfatterne kommenterer:

‘Vi har funnet at maskinlæringsmodeller som prosesserer bruker-tilførte tekst, som neurale maskin-oversettelsessystemer, er spesielt sårbare for denne typen angrep. Betenk for eksempel den markedsledende tjenesten Google Translate. På tidspunktet for skriving, ved inntasting av strengen “paypal” i den engelsk til russisk modell, utgangspunktet korrekt “PayPal”, men ved å erstatte det latinske tegnet a i inndata med det kyrilliske tegnet а, utgangspunktet feilaktig “папа” (“far” på engelsk).’

Forskere observerer at mens mange NLP-pipelines vil erstatte tegn som er utenfor deres språkspesifikke ordbok med en <unk> (‘ukjent’) token, kan programvareprosessene som kalles inn i pipelinen, propagere ukjente ord for evaluering før denne sikkerhetsmessige måltaket kan settes i gang. Forfatterne fastslår at dette ‘åpner en overraskende stor angrepsflate’.

3: Omordning

Unicode tillater språk som skrives fra venstre til høyre, med ordering håndtert av Unicodes Bidirectional (BIDI)-algoritme. Blanding av høyre-til-venstre og venstre-til-høyre tegn i en enkelt streng er derfor forvirrende, og Unicode har gjort tilbud for dette ved å tillate BIDI å bli overstyrt av spesielle kontrolltegn. Disse tillater nesten arbitrær rendering for en fast kodestruktur.

In another theoretical example from the paper, a translation mechanism is caused to put all the letters of the translated text in the wrong order, because it is obeying the wrong right-to-left/left-to-right encoding, due to a part of the adversarial source text (circled) commanding it to do so.

In another theoretical example from the paper, a translation mechanism is caused to put all the letters of the translated text in the wrong order, because it is obeying the wrong right-to-left/left-to-right encoding, due to a part of the adversarial source text (circled) commanding it to do so.

Forfatterne fastslår at på tidspunktet for skriving av papiret, var metoden effektiv mot Unicodes implementering i Chromium-nettleseren, kildekoden for Googles Chrome-nettleser, Microsofts Edge-nettleser og en rekke andre fork.

Også: Sletting

Inkludert her for at de påfølgende resultattabellene skal være klare, sletting-angrepet innebærer å inkludere et tegn som representerer en bakrom eller annen tekst-påvirkende kontroll/kommando, som effektivt implementeres av språklesingssystemet på en måte lik en tekst-makro.

Forfatterne observerer:

‘En liten mengde kontrolltegn i Unicode kan forårsake nabotekst å bli fjernet. De enkleste eksemplene er backspace (BS) og delete (DEL)-tegnene. Det er også carriage return (CR) som forårsaker tekst-renderingsalgoritmen å returnere til begynnelsen av linjen og overskriver dens innhold.

‘For eksempel, kodet tekst som representerer “Hello CRGoodbye World” vil bli rendret som “Goodbye World”.’

Som tidligere nevnt, krever dette angrepet en usedvanlig høy grad av tilgang for å fungere, og ville bare være fullstendig effektivt med tekst kopiert og limt via en clipboard, systematisk eller ikke – en uvanlig NLP-inngangs-pipeline.

Forskere testet det likevel, og det fungerer sammenlignbart med sine stabiletegn. Imidlertid kan angrep som bruker de tre første metodene implementeres enkelt ved å laste opp dokumenter eller nettsider (i tilfelle et angrep mot søkemotorene og/eller web-skraping NLP-pipelines).

In a deletions attack, the crafted characters effectively erase what precedes them, or else force single-line text into a second paragraph, in both cases without making this obvious to the casual reader.

In a deletions attack, the crafted characters effectively erase what precedes them, or else force single-line text into a second paragraph, in both cases without making this obvious to the casual reader.

Effektivitet mot nåværende NLP-systemer

Forskere utførte en rekke urettede og rettede angrep mot fem populære lukkede modeller fra Facebook, IBM, Microsoft, Google og HuggingFace, samt tre åpne modeller.

De testet også ‘sponge’ angrep mot modellene. Et sponge-angrep er effektivt et DoS-angrep for NLP-systemer, der inndata-teksten ‘ikke regner’, og forårsaker trening å bli kritisk langsommere – en prosess som normalt burde være umulig å gjøre på grunn av data-forbehandling.

De fem NLP-oppdragene som ble evaluert, var maskin-oversettelse, giftig innhold-dettekt, tekstuell implikasjon-klassifisering, navn-entitet-gjenkjenning og sentiment-analyse.

Testene ble utført på en ukjent mengde Tesla P100-GPU-er, hver kjører en Intel Xeon Silver 4110-prosessor over Ubuntu. For å ikke bryte tjenestevilkårene i tilfelle å gjøre API-forespørsler, ble eksperimentene jevnt gjentatt med en perturbasjonsbudsjett på null (upåvirket kilde-tekst) til fem (maksimal forstyrrelse). Forskerne hevder at resultater de fikk, kunne bli overgått hvis en større mengde iterasjoner var tillatt.

Results from applying adversarial examples against Facebook's Fairseq EN-FR model.

Results from applying adversarial examples against Facebook’s Fairseq EN-FR model.

Results from attacks against IBM's toxic content classifier and Google's Perspective API.

Results from attacks against IBM’s toxic content classifier and Google’s Perspective API.

Two attacks against Facebook's Fairseq: 'untargeted' aims to disrupt, whilst 'targeted' aims to change the meaning of translated language.

Two attacks against Facebook’s Fairseq: ‘untargeted’ aims to disrupt, whilst ‘targeted’ aims to change the meaning of translated language.

Forskere testet også sitt system mot tidligere rammeverk som ikke kunne generere ‘menneske-lesbar’ perturbende tekst på samme måte, og fant systemet stort sett på linje med disse, og ofte merket betydelig bedre, samtidig som de beholdt den store fordelen av skjulthet.

Gjennomsnittlig effektivitet over alle metoder, angrepsvektorer og mål svæver rundt 80%, med svært få iterasjoner kjørt.

I kommentar til resultater, sier forskerne:

‘Kanskje det mest forstyrrende aspektet ved våre usynlige perturbasjonsangrep er deres brede anvendelighet: alle tekstbaserte NLP-systemer vi testet, er sårbare. I virkeligheten, enhver maskinlæringsmodell som inngår bruker-tilførte tekst som inndata, er teoretisk sårbare for dette angrepet.

‘De motstridende implikasjonene kan variere fra en anvendelse til en annen og fra en modell til en annen, men alle tekstbaserte modeller er basert på kodet tekst, og all tekst er underlagt motstridende kodning, med mindre kodingen er tilstrekkelig begrenset.’

Universell optisk tegngjenkjenning?

Disse angrepene er avhengige av hva som i virkeligheten er ‘sårbarheter’ i Unicode, og ville bli avvist i en NLP-pipeline som rasteriserte all inngående tekst og brukte optisk tegngjenkjenning som en saneringsmåte. I dette tilfellet ville den samme ikke-maligne semantiske betydningen som er synlig for mennesker som leser disse perturberte angrepene, bli overført til NLP-systemet.

Men da forskerne implementerte en OCR-pipeline for å teste denne teorien, fant de at BLEU (Bilingual Evaluation Understudy)-poengene sank baseline-nøyaktigheten med 6,2%, og foreslår at bedret OCR-teknologi ville sannsynligvis være nødvendig for å rette opp dette.

De foreslår videre at BIDI-kontrolltegn bør fjernes fra inndata som standard, uvanlige homoglyfer bør kartlegges og indekseres (hvilket de karakteriserer som ‘en overveldende oppgave’), og tokenisatorer og andre inngangs-mekanismer bør væpnes mot usynlige tegn.

I avslutning, oppfordrer forskergruppen NLP-sektoren til å bli mer oppmerksom på mulighetene for motstridende angrep, et felt av stor interesse i datavisjonsforskning.

‘[Vi] anbefaler at alle firmaer som bygger og deployer tekstbaserte NLP-systemer, implementerer slike forsvar hvis de ønsker at deres applikasjoner skal være robuste mot skadelige aktører.’

 

 

* Min konvertering av inline-citater til hyperlenker

18:08 14. des. 2021 – fjernet duplikat omtale av IBM, flyttet auto-internt lenke fra sitat – MA

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai