Andersons vinkel
Angreb på Naturlig Sprogbehandlingssystemer med Adversarial Eksempler

Forskere i Storbritannien og Canada har udviklet en række sorte boks-adversarial angreb mod Naturlig Sprogbehandling (NLP)-systemer, der er effektive mod en bred vifte af populære sprogbehandlingsrammer, herunder bredt anvendte systemer fra Google, Facebook, IBM og Microsoft.
Angrebet kan potentielt bruges til at lamme maskinlærings-oversættelsessystemer ved at tvinge dem til enten at producere nonsens eller faktisk ændre oversættelsens natur; til at begrænse træning af NLP-modeller; til at misklassificere giftigt indhold; til at forgifte søgemaskine-resultater ved at forårsage fejlbeskrevne indekser; til at få søgemaskiner til at fejle i at identificere skadeligt eller negativt indhold, der er perfekt læseligt for en person; og endda til at forårsage Denial-of-Service (DoS)-angreb på NLP-rammer.
Selvom forfatterne har afsløret papirets foreslåede sårbarheder for diverse navnløse parter, hvis produkter er med i forskningen, mener de, at NLP-industrien har været langsom til at beskytte sig selv mod adversarial angreb. Papiret fastslår:
‘Disse angreb udnytter sprogkodningsfunktioner, såsom usynlige tegn og homoglyfer. Selvom de har været set lejlighedsvis i fortiden i spam og phishing-svindel, synes designerne af de mange NLP-systemer, der nu deployes i stor målestok, at have ignoreret dem fuldstændigt.’
Flere af angrebene blev udført i en så “sort boks”-lignende miljø som muligt – via API-kald til MLaaS-systemer, snarere end lokalt installeret FOSS-versioner af NLP-rammerne. Om systemernes kombinerede effektivitet skriver forfatterne:
‘Alle eksperimenter blev udført i en sort boks-indstilling, hvor ubegrænsede modelvurderinger er tilladt, men adgang til den vurderede models vægt eller tilstand ikke er tilladt. Dette repræsenterer en af de stærkeste trusler, som angreb er muligt i næsten alle indstillinger, herunder mod kommercielle Machine-Learning-as-a-Service (MLaaS)-tilbud. Hver model, der blev undersøgt, var sårbar over for umærkelige perturbationsangreb.
‘Vi mener, at anvendeligheden af disse angreb burde i teorien generalisere til enhver tekstbaseret NLP-model uden tilstrækkelige forsvar.’
Papiret er titlen Bad Characters: Imperceptible NLP Attacks, og kommer fra tre forskere på tre afdelinger på University of Cambridge og University of Edinburgh, og en forsker fra University of Toronto.
Papirets titel er exemplarisk: Den er fyldt med ‘umærkelige’ Unicode-tegn, der danner grundlag for en af de fire principielle angrebsmetoder, som forskerne har valgt.

Even the paper’s title has hidden mysteries.
Metode/r
Papiret foreslår tre primære effektive angrebsmetoder: usynlige tegn; homoglyfer; og omordning. Disse er de ‘universelle’ metoder, som forskerne har fundet at have bred rækkevidde mod NLP-rammer i sorte boks-scenarier. En ekstra metode, der involverer brug af en slet-tegn, blev fundet af forskerne at være egnet kun til usædvanlige NLP-pipelines, der bruger operativsystemets clipboard.
1: Usynlige tegn
Dette angreb bruger kodede tegn i en font, der ikke kan kortlægges til et glyf i Unicode-systemet. Unicode-systemet blev designed til at standardisere elektronisk tekst og dækker nu 143.859 tegn på tværs af multiple sprog og symbolgrupper. Mange af disse kortlægninger vil ikke indeholde noget synligt tegn i en font (der naturligvis ikke kan indeholde tegn for hver mulig indgang i Unicode).

From the paper, a hypothetical example of an attack using invisible characters, which splits up the input words into segments that either mean nothing to a Natural Language Processing system, or, if carefully crafted, can prevent an accurate translation. For the casual reader, the original text in both cases is correct. Source: https://arxiv.org/pdf/2106.09898.pdf
Typisk kan du ikke bare bruge et af disse ikke-tegn til at oprette et nultegn-mellemrum, da de fleste systemer vil rendre en ‘placeholder’-symbol (såsom en firkant eller et spørgsmål i en vinkelret boks) for at repræsentere det ukendte tegn.
Men som papiret observerer, er der kun en håndfuld fonts, der dominerer den nuværende computermiljø, og de følger som regel Unicode-standarden.
Forskere valgte derfor GNU’s Unifont-glyffer til deres eksperimenter, dels på grund af dets ‘robust dækning’ af Unicode, men også fordi det ligner mange af de andre ‘standard’-fonts, der sandsynligvis vil blive ført til NLP-systemer. Mens de usynlige tegn, der er produceret fra Unifont, ikke renderes, bliver de alligevel talt som synlige tegn af de NLP-systemer, der blev testet.
Anvendelser
Vendende tilbage til papirets ‘forskede’ titel, kan vi se, at udførelse af en Google-søgning fra den valgte tekst ikke giver det forventede resultat:

Dette er en klient-side-effekt, men server-side-ramificationerne er lidt mere alvorlige. Papiret observerer:
‘Selvom en perturberet dokument kan være crawled af en søgemaskines crawler, vil de termer, der bruges til at indeksere det, være påvirket af perturbationerne, hvilket gør det mindre sandsynligt, at det vil dukke op fra en søgning på uperturberede termer. Det er således muligt at skjule dokumenter fra søgemaskiner “i åben lys.”
‘Som et eksempel på en anvendelse, kunne en uærlig virksomhed maskere negative oplysninger i sine finansielle rapporter, således at de specialiserede søgemaskiner, der bruges af aktieanalytikere, ikke vil opdage dem.’
De eneste scenarier, hvor ‘usynlige tegn’-angrebet viste sig at være mindre effektivt, var mod giftigt indhold, Navnet-Entity-Recognition (NER) og sentiment-analyse-modeller. Forfatterne formoder, at dette skyldes, at modellerne blev trænet på data, der også indeholdt usynlige tegn, eller at modellens tokenizer (der bryder rå sprogindgang ned i modulære komponenter) allerede var konfigureret til at ignorerer dem.
2: Homoglyfer
En homoglyf er et tegn, der ligner et andet tegn – en semantisk svaghed, der blev udnyttet i 2000 til at skabe en scam-replika af PayPal (PYPL ) -betalingssystemets domæne.

In this hypothetical example from the paper, a homoglyph attack changes the meaning of a translation by substituting visually indistinguishable homoglyphs (outlined in red) for common Latin characters.
Forfatterne kommenterer*:
‘Vi har fundet, at maskinlæringsmodeller, der behandler bruger-tilført tekst, såsom neurale maskin-oversættelsessystemer, er særligt sårbare over for denne type angreb. Overvej for eksempel den markedsledende service Google Translate. På tidspunktet for skrivning af denne artikel udgav indtastning af strengen “paypal” i den engelsk-russiske model korrekt “PayPal”, men erstattede det latinske tegn a i indtastningen med det kyrilliske tegn а forkert udgav “папа” (“far” på engelsk).’
Forskere observerer, at mens mange NLP-pipelines vil erstatte tegn, der er uden for deres sprog-specifikke ordbog, med en <unk> (‘ukendt’) token, kan de software-processer, der kalder den forgiftede tekst ind i pipelinen, propagere ukendte ord til vurdering, før denne sikkerhedsforanstaltning kan træde i kraft. Forfatterne fastslår, at dette ‘åbner en overraskende stor angrebsflade’.
3: Omordning
Unicode tillader sprog, der skrives fra venstre til højre, med omordningen håndteret af Unicodes Bidirectional (BIDI)-algoritme. Blandende højre-til-venstre og venstre-til-højre-tegn i en enkelt streng er derfor forvirrende, og Unicode har gjort plads til dette ved at tillade BIDI at blive overskrevet af særlige kontroltegn. Disse tillader næsten arbitrær rendering for en fast kodningsrækkefølge.

In another theoretical example from the paper, a translation mechanism is caused to put all the letters of the translated text in the wrong order, because it is obeying the wrong right-to-left/left-to-right encoding, due to a part of the adversarial source text (circled) commanding it to do so.
Forfatterne fastslår, at på tidspunktet for skrivning af papiret var metoden effektiv mod Unicodes implementering i Chromium-webbrowseren, den oprindelige kilde til Googles Chrome-browser, Microsofts Edge-browser og en række andre forks.
Også: Sletninger
Inkluderet her, så de efterfølgende resultater-grafer er klare, indebærer sletninger-angrebet at inkludere et tegn, der repræsenterer en backspace eller anden tekst-påvirkende kommando, som effektivt implementeres af sprog-læsningssystemet på en måde lignende en tekst-makro.
Forfatterne observerer:
‘Et lille antal kontroltegn i Unicode kan forårsage nærliggende tekst til at blive fjernet. De enkleste eksempler er backspace (BS) og delete (DEL)-tegnene. Der er også carriage return (CR), der får tekst-renderingsalgoritmen til at vende tilbage til begyndelsen af linjen og overskriver dens indhold.
‘For eksempel, kodet tekst, der repræsenterer “Hello CRGoodbye World” vil blive renderet som “Goodbye World”.’
Som tidligere nævnt, kræver dette angreb effektivt en utrolig høj grad af adgang for at virke, og ville kun være fuldstændigt effektivt med tekst, der kopieres og indsættes via en clipboard, systematisk eller ej – en usædvanlig NLP-indtagelses-pipeline.
Forskere testede det alligevel, og det fungerer sammenligneligt med sine stabile kammerater. Men angreb, der bruger de første tre metoder, kan implementeres ved blot at uploade dokumenter eller websider (i tilfælde af et angreb mod søgemaskiner og/eller web-scraping NLP-pipelines).

In a deletions attack, the crafted characters effectively erase what precedes them, or else force single-line text into a second paragraph, in both cases without making this obvious to the casual reader.
Effektivitet mod nuværende NLP-systemer
Forskere udførte en række ubevidste og målrettede angreb på fem populære lukkede modeller fra Facebook, IBM, Microsoft, Google og HuggingFace, samt tre open source-modeller.
De testede også ‘sponge’-angreb mod modellerne. Et sponge-angreb er effektivt et DoS-angreb for NLP-systemer, hvor input-teksten ‘ikke kan beregnes’, og forårsager træning til at blive kritisk langsommere – en proces, der normalt burde være umulig på grund af data-forbehandling.
De fem NLP-opgaver, der blev evaluaret, var maskin-oversættelse, giftigt indhold-detection, tekstuel entailment-klassificering, navn-entitet-genkendelse og sentiment-analyse.
Testene blev udført på en ikke-specificeret antal Tesla P100-GPU’er, hver kørende en Intel Xeon Silver 4110 CPU over Ubuntu. For at undgå at krænke vilkår for API-kald, blev eksperimenterne gentaget med en perturbationsbudget på nul (upåvirket kilde-tekst) til fem (maksimal forstyrrelse). Forskerne hævder, at resultaterne, de fik, kunne overgås, hvis en større antal iterationer var tilladt.

Results from applying adversarial examples against Facebook’s Fairseq EN-FR model.

Results from attacks against IBM’s toxic content classifier and Google’s Perspective API.

Two attacks against Facebook’s Fairseq: ‘untargeted’ aims to disrupt, whilst ‘targeted’ aims to change the meaning of translated language.
Forskere testede deres system mod tidligere rammer, der ikke kunne generere ‘menneskeligt læselige’ perturberende tekst på samme måde, og fandt systemet stort set på linje med disse, og ofte bemærkelsesværdigt bedre, mens de fastholdt den enorme fordel af skjulthed.

Gennemsnits-effektiviteten over alle metoder, angrebsvektorer og mål svæver omkring 80%, med meget få iterationer kørt.
Kommenterende på resultaterne, siger forskerne:
‘Måske det mest foruroligende aspekt af vores umærkelige perturbationsangreb er deres brede anvendelighed: alle tekstbaserede NLP-systemer, vi testede, er sårbare. Sandt enough, enhver maskinlæringsmodel, der indtager bruger-tilført tekst som input, er teoretisk sårbar over for dette angreb.
‘De adversarial implikationer kan variere fra en anvendelse til en anden og fra en model til en anden, men alle tekstbaserede modeller er baseret på kodet tekst, og al tekst er underlagt adversarial kodning, medmindre kodningen er passende begrænset.’
Universal Optical Character Recognition?
Disse angreb afhænger af, hvad der effektivt er ‘sårbarheder’ i Unicode, og ville være elimineret i en NLP-pipeline, der rasteriserer al indgående tekst og bruger Optical Character Recognition som en sanitationsforanstaltning. I dette tilfælde ville den samme ikke-maligne semantiske betydning, der er synlig for mennesker, der læser disse perturberede angreb, blive overført til NLP-systemet.
Men da forskerne implementerede en OCR-pipeline for at teste denne teori, fandt de, at BLEU (Bilingual Evaluation Understudy)-scorerna faldt baseline-nøjagtigheden med 6,2%, og foreslår, at forbedret OCR-teknologi sandsynligvis ville være nødvendig for at afhjælpe dette.
De foreslår yderligere, at BIDI-kontroltegn skal fjernes fra input som standard, usædvanlige homoglyfer skal kortlægges og indekseres (hvilket de karakteriserer som ‘en overvældende opgave’), og tokenisatorer og andre indtagelses-mekanismer skal værnes mod usynlige tegn.
I afslutning opfordrer forskningsgruppen NLP-sektoren til at blive mere opmærksom på mulighederne for adversarial angreb, der i øjeblikket er et felt af stor interesse i computer-vision-forskning.
‘[Vi] anbefaler, at alle virksomheder, der bygger og deployer tekstbaserede NLP-systemer, implementerer sådanne forsvar, hvis de ønsker, at deres applikationer skal være robuste mod malicious aktører.’
* Min konvertering af inline-citationer til hyperlinks
18:08 14. december 2021 – fjernet duplikeret omtale af IBM, flyttede auto-internt link fra citat – MA












