Andersonin kulma

Luonnonkielen prosessointijärjestelmien hyökkäys adversariaalisilla esimerkeillä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tutkijat Isossa-Britanniassa ja Kanadassa ovat kehittäneet sarjan mustan ruudun adversariaalisia hyökkäyksiä luonnonkielen prosessointijärjestelmien (NLP) vastaan, jotka ovat tehokkaita laajasti suositeltujen kielenkäsittelykehyksien, mukaan lukien laajasti käytettyjä järjestelmiä Googlelta, Facebookilta, IBM:ltä ja Microsoftilta.

Hyökkäys voidaan mahdollisesti käyttää koneoppimisen käännösjärjestelmiä heikentämään pakottamalla ne joko tuottamaan järjettömiä tai muuttamaan käännöksen luonnetta; pullistamaan NLP-mallien koulutusta; luokittelemaan myrkyllistä sisältöä väärin; myrkyttämään hakutuloksia aiheuttamalla virheellistä indeksointia; aiheuttamaan hakukoneiden epäonnistumista tunnistamaan vaarallista tai negatiivista sisältöä, joka on täydellisesti luettavissa ihmisille; ja jopa aiheuttamaan palvelunestohyökkäyksiä NLP-kehyksille.

Vaikka kirjoittajat ovat ilmoittaneet tutkimuksensa ehdotettujen haavoittuvuuksien nimettömille osapuolille, jotka osallistuvat tutkimukseen, he pitävät sitä, että NLP-teollisuus on ollut hitaasti suojelemassa itseään adversariaalisilta hyökkäyksiltä. Tutkimus toteaa:

Nämä hyökkäykset hyödyntävät kielikoodauksen ominaisuuksia, kuten näkymättömiä merkkejä ja homoglyfejä. Vaikka niitä on joskus aiemmin nähty roskapostissa ja huijauksissa, monien NLP-järjestelmien suunnittelijat, jotka ovat nyt käyttöön otettu laajasti, näyttävät jättäneen ne täysin huomiotta.

Useita hyökkäyksiä tehtiin “mustan ruudun” ympäristössä, joka on mahdollista – MLaaS-järjestelmiin API-kutsujen kautta, paikallisesti asennettujen FOSS-versioiden NLP-kehyksistä. Järjestelmien yhdistetyistä vaikutuksista kirjoittajat kirjoittavat:

Kaikki kokeet suoritettiin mustan ruudun asetelmaa, jossa rajattomat mallin arviot on sallittu, mutta pääsy arvioituun mallin painoihin tai tilaan ei ole sallittu. Tämä edustaa yhtä voimakkaimmista uhkamalleista, joita vastaan hyökkäykset ovat mahdollisia lähes kaikissa asetelmissa, myös kaupallisia Machine-Learning-as-a-Service (MLaaS) -tarjoajia vastaan. Jokainen tutkittu malli oli altis havaitsemattomille häiriöille.

Uskomme, että näiden hyökkäysten soveltaminen pitäisi teoriassa yleistyä mihin tahansa tekstipohjaiseen NLP-malliin, jossa ei ole riittäviä puolustuksia.

Tutkimus tutkimus on nimeltään Pahat merkit: Havaitsemattomat NLP-hyökkäykset, ja se tulee kolmelta tutkijalta yli kolmessa osastossa Cambridgen yliopistossa ja Edinburghin yliopistossa, sekä tutkijalta Toronton yliopistosta.

Tutkimuksen otsikko on esimerkki: se on täynnä “havaitsemattomia” Unicode-merkkejä, jotka muodostavat yhden neljästä pääasiallisesta hyökkäysmenetelmästä, jonka tutkijat ovat omaksuneet.

Jopa tutkimuksen otsikko sisältää piilotettuja mysteerejä.

Jopa tutkimuksen otsikko sisältää piilotettuja mysteerejä.

Menetelmä/t

Tutkimus ehdottaa kolmea ensisijaisesti vaikuttavaa hyökkäysmenetelmää: näkymättömät merkit; homoglyfit; ja uudelleenjärjestelyt. Nämä ovat “yleiset” menetelmät, joita tutkijat ovat löytäneet laajasti NLP-kehyksiä vastaan mustan ruudun tilanteissa. Lisäksi tutkijat löysivät menetelmän, joka käytti “poistoa” -merkkiä, joka oli sovelias vain epätavallisille NLP-putkistolle, jotka käyttävät käyttöjärjestelmän leikepöydää.

1: Näkymättömät merkit

Tämä hyökkäys käyttää koodattuja merkkejä fontissa, jotka eivät kartoita glyfiin Unicode-järjestelmässä. Unicode-järjestelmä suunniteltiin standardoimaan sähköistä tekstiä, ja se kattaa nyt 143 859 merkkiä useiden kielten ja symboliryhmien yli. Monet näistä kartoituksista eivät sisällä näkyvää merkkiä fontissa (joka ei voi luonnollisesti sisältää merkkejä jokaiselle mahdolliselle Unicode-sisääntulolle).

Tutkimuksesta, hypoteettinen esimerkki hyökkäyksestä, joka käyttää näkymättömiä merkkejä, jotka jakavat sanat osiin, jotka joko eivät merkitse mitään luonnonkielen prosessointijärjestelmälle tai, jos ne on huolellisesti muotoiltu, voivat tarkoittaa jotain toista tarkalleen käännetylle kielelle. Keskivertaiselle lukijalle alkuperäinen teksti on kummassakin tapauksessa oikein.

Tutkimuksesta, hypoteettinen esimerkki hyökkäyksestä, joka käyttää näkymättömiä merkkejä, jotka jakavat syötetekstin osiin, jotka joko eivät merkitse mitään luonnonkielen prosessointijärjestelmälle tai, jos ne on huolellisesti muotoiltu, voivat estää tarkan käännöksen. Keskivertaiselle lukijalle alkuperäinen teksti on kummassakin tapauksessa oikein.

Yleensä et voi vain käyttää yhtä näistä ei-merkeistä luomaan nollaleveyden välilyöntiä, koska useimmat järjestelmät renderöivät “paikkaa pitävän” symbolin (kuten neliön tai kysymysmerkin kulmassa olevan ruudun) edustamaan tunnistamatonta merkkiä.

Kuitenkin, kuten tutkimus huomauttaa, vain muutamia fontteja hallitsee nykyistä tietokonelaitteistoa, ja ne noudattavat luonnollisesti Unicode-standardeja.

Tutkijat valitsivat GNU:n Unifont-glyfit kokeisiinsa osittain sen “vankkaan” Unicode-kattavuuden vuoksi, mutta myös siksi, että se muistuttaa monia muita “standard” -fontteja, joita todennäköisesti syötetään NLP-järjestelmiin. Vaikka Unifontin näkymättömät merkit eivät renderöi, ne lasketaan kuitenkin näkyviksi merkeiksi testatuilla NLP-järjestelmillä.

Sovellukset
Palatessamme tutkimuksen “muotoillun” otsikkoon, voimme nähdä, että suorittamalla Google -haku valitusta tekstistä ei saada odotettua tulosta:

Tämä on asiakaspuolen vaikutus, mutta palvelinpuolen seuraukset ovat hieman vakavampia. Tutkimus toteaa:

Vaikka häiriintynyt asiakirja voidaan siirtää hakukoneen hakutoiminnon kautta, hakusanoja, joilla se indeksoidaan, vaikuttaa häiriintymiseen, mikä tekee siitä vähemmän todennäköisen, että se tulee esiin hakutoiminnosta, joka ei ole häiriintynyt. On siis mahdollista piilottaa asiakirjoja hakukoneilta “avoinna”.

Esimerkiksi epärehellinen yritys voisi piilottaa negatiivista tietoa taloudellisissa ilmoituksissaan, jotta erityiset hakukoneet, joita osakkeiden analyytikot käyttävät, eivät pystyisi löytämään sitä.

Ainoat skenaariot, joissa “näkymättömien merkkien” hyökkäys osoittautui vähemmän tehokkaaksi, olivat myrkyllisen sisällön, nimettyjen entiteettien tunnistamisen ja mielipidetutkimuksen mallit. Tutkijat olettavat, että tämä johtuu siitä, että mallit on koulutettu tiedoissa, jotka sisältävät näkymättömiä merkkejä, tai mallin tokenisaattori (joka jakaa raakatekstin modulaarisiin osiin) on jo konfiguroitu ohittamaan ne.

2: Homoglyfit

Homoglyfi on merkki, joka näyttää toiselta merkkiltä – semanttinen heikkous, jota hyödynnettiin vuonna 2000 luomaan huijausreplica PayPalin maksujen käsittelyverkkotunnukselle.

Tutkimuksen hypoteettisessa esimerkissä homoglyyfihyökkäys muuttaa käännöksen merkitystä korvaamalla visuaalisesti erottamattomat homoglyfit (punaisella kehyksellä) yleisille latinankielisille merkeille.

Tutkimuksen hypoteettisessa esimerkissä homoglyyfihyökkäys muuttaa käännöksen merkitystä korvaamalla visuaalisesti erottamattomat homoglyfit (punaisella kehyksellä) yleisille latinankielisille merkeille.

Tutkijat toteavat:

Olemme löytäneet, että koneoppimismallit, jotka käsittelevät käyttäjän toimittamaa tekstiä, kuten neuronaaliset käännösjärjestelmät, ovat erityisen alttiita tälle hyökkäystyypille. Käydään esimerkiksi läpi markkinajohtavaa palvelua Google Translate. Kirjoittamishetkellä syöttämällä merkkijonon “paypal” englannin ja venäjän malliin, se tuottaa oikein “PayPal”, mutta korvaamalla latinankirjaimen a syötteen sisällä kyrillisen kirjaimella а se tuottaa virheellisesti “папа” (“isä” englanniksi).

Tutkijat huomauttavat, että vaikka monet NLP-putkit ovat korvanneet merkkejä, jotka ovat ulkona kielen määritellystä sanastosta, <unk> (‘tuntematon’) -tokenilla, ohjelmat, jotka kutsuvat myrkytettyä tekstiä putkeen, voivat propagoida tuntemattomia sanoja arvioinnin aikana ennen kuin tämä turvallisuustoimi voidaan ottaa käyttöön. Tutkijat toteavat, että tämä “avaa yllättävän suuren hyökkäyspinnan”.

3: Uudelleenjärjestelyt

Unicode sallii kieliä, jotka kirjoitetaan vasemmalta oikealle, ja järjestyksen käsitellään Unicoden Bidirectional (BIDI) -algoritmin avulla. Sekoittamalla oikealta vasemmalle ja vasemmalta oikealle merkkejä yhteen merkkijonoon on hämmentävää, ja Unicode on tehnyt sille tilan sallimalla BIDI:n ohittamisen erityisillä ohjausmerkeillä. Nämä mahdollistavat melkein mielivaltaisen renderöinnin kiinteän koodauksen järjestyksessä.

Tutkimuksen teoreettisessa esimerkissä käännösmekanismi pakotetaan asettamaan kaikki käännöksen kirjaimet väärään järjestykseen, koska se noudattaa väärää oikealta vasemmalle / vasemmalta oikealle -koodausta, johtuen osasta hyökkäyksen lähdekohtaa (ympyröity), joka käskee sitä tekemään niin.

Tutkimuksen teoreettisessa esimerkissä käännösmekanismi pakotetaan asettamaan kaikki käännöksen kirjaimet väärään järjestykseen, koska se noudattaa väärää oikealta vasemmalle / vasemmalta oikealle -koodausta, johtuen osasta hyökkäyksen lähdekohtaa (ympyröity), joka käskee sitä tekemään niin.

Tutkijat toteavat, että kirjoittamishetkellä menetelmä oli tehokas Chromen selaimen Unicoden toteutusta, Chromiumin lähdekoodin selaimelle, Microsoftin Edge-selaimelle ja useille muille forkille vastaan.

Myös: Poistot

Sisällytetty tähän, jotta seuraavat tulokset ovat selviä, “poistot” -hyökkäys käsittää merkin sisällyttämisen, joka edustaa backspace- tai muuta tekstiä vaikuttavaa ohjausta / komentoa, jota toteutetaan kielen lukemisjärjestelmässä tyyliin, joka muistuttaa tekstiä makroa.

Tutkijat toteavat:

Joitakin Unicoden ohjausmerkkejä voidaan käyttää naapureiden tekstin poistamiseen. Yksinkertaisimmat esimerkit ovat backspace (BS) ja delete (DEL) -merkit. On myös rivinvaihto (CR), joka aiheuttaa tekstin renderöintialgoritmin paluun rivin alkuun ja ylikirjoittaa sen sisällön.

Esimerkiksi koodattu teksti, joka edustaa “Hei CRHyvästi Maailma” renderöidään “Hyvästi Maailma”.

Kuten aiemmin mainittiin, tämä hyökkäys vaatii epätodennäköisen tason pääsyä, ja se toimisi vain, jos tekstiä kopioidaan ja liitetään leikepöydästä järjestelmään systemaattisesti tai ei.

Tutkijat testasivat sitä kuitenkin, ja se suorittaa vertailukelpoisesti sen kolmen ensisijaisen menetelmän kanssa. Hyökkäykset, jotka käyttävät ensimmäistä kolmea menetelmää, voidaan kuitenkin toteuttaa yksinkertaisesti lataamalla asiakirjoja tai verkkosivuja (hakukoneiden ja / tai verkkoluukuvan NLP-putkistojen tapauksessa).

Poistohyökkäyksessä muotoillut merkit poistavat tehokkaasti edeltävät merkit tai pakottavat yksirivisen tekstin toiseen kappaaseen, kummassakin tapauksessa ilman, että se on selvää keskivertaiselle lukijalle.

Poistohyökkäyksessä muotoillut merkit poistavat tehokkaasti edeltävät merkit tai pakottavat yksirivisen tekstin toiseen kappaaseen, kummassakin tapauksessa ilman, että se on selvää keskivertaiselle lukijalle.

Tehtävyyden vaikutus nykyisiin NLP-järjestelmiin

Tutkijat suorittivat joukon kohdattuja ja kohdattomia hyökkäyksiä viidelle suositulle suljetulle mallille Facebookilta, IBM:ltä, Microsoftilta, Googlelta ja HuggingFacelta, sekä kolmelle avoimen lähdekoodin mallille.

He testasivat myös “sponge” -hyökkäyksiä mallien vastaan. Sponge-hyökkäys on käytännössä palvelunestohyökkäys NLP-järjestelmiä vastaan, jossa syöteteksti “ei laske”, ja aiheuttaa koulutuksen merkittävän hidastumisen – prosessi, joka pitäisi normaalisti olla mahdoton johtuen esikäsittelyyn liittyvistä tietojen ennakoiduista rajoituksista.

Neljä NLP-tehtävää, jotka arvioitiin, olivat konekäännös, myrkyllisen sisällön havaitseminen, tekstuaalinen johtaminen, nimettyjen entiteettien tunnistaminen ja mielipidetutkimus.

Kokeet suoritettiin määrittelemättömän määrän Tesla P100 -näytönohjaimilla, joissa kussakin oli Intel Xeon Silver 4110 -suoritin Ubuntu-käyttöjärjestelmällä. Jotta ei rikottaisi palvelun käyttöehtoja, jotka koskevat API-kutsujen tekemistä, kokeet toistettiin yhdenmukaisesti häiriintymisbudjetilla nolla (vaikuttamaton lähde-teksti) viisi (maksimaalinen häiriintyminen). Tutkijat väittävät, että saadut tulokset voidaan ylittää, jos sallitaan suurempi määrä toistoa.

Tulokset adversariaalisten esimerkkien soveltamisesta Facebookin Fairseq EN-FR -malliin.

Tulokset adversariaalisten esimerkkien soveltamisesta Facebookin Fairseq -malliin.

Tulokset hyökkäyksistä IBM:n myrkyllisen sisällön luokittelijaa ja Google Perspectiven API:ta vastaan.

Tulokset hyökkäyksistä IBM:n myrkyllisen sisällön luokittelijaa ja Google Perspectiven API:ta vastaan.

Kaksi hyökkäystä Facebookin Fairseqiä vastaan: 'kohdattomalla' tavoitellaan häirintää, kun taas 'kohdattu' tavoittelee käännöksen merkityksen muuttamista.

Kaksi hyökkäystä Facebookin Fairseqiä vastaan: ‘kohdattomalla’ tavoitellaan häirintää, kun taas ‘kohdattu’ tavoittelee käännöksen merkityksen muuttamista.

Tutkijat testasivat järjestelmäänsä myös aiempien kehyksien vastaan, jotka eivät pystyneet tuottamaan “ihmisen luettavaa” häirintää samalla tavalla, ja löysivät järjestelmän olevan pääosin samaa tasoa kuin nämä, usein merkittävästi parempia, samalla säilyttäen valtavan etun, jonka muodostaa salamaisuus.

Kaikkien menetelmien, hyökkäysvektorien ja kohdistettujen kohteiden keskiarvo on noin 80 prosenttia, ja vain muutamia toistoa on suoritettu.

(PYPL )

Tutkijat toteavat tuloksista:

Luultavasti häiritsevin asia meidän havaitsemattomissa häiriintymisissämme on niiden laaja soveltuvuus: kaikki tekstipohjaiset NLP-järjestelmät, joita testasimme, ovat alttiita. Itse asiassa mikä tahansa koneoppimismalli, joka ottaa käyttäjän toimittaman tekstin syötteenä, on teoreettisesti altis tälle hyökkäykselle.

Hyökkäyksen vaikutukset voivat vaihdella sovelluksen mukaan ja mallin mukaan, mutta kaikki tekstipohjaiset mallit perustuvat koodattuun tekstiin, ja kaikki teksti on altis häiritsevälle koodaukselle, ellei koodausta rajoiteta asianmukaisesti.

Universal Optical Character Recognition?

Nämä hyökkäykset riippuvat siitä, mitä voidaan pitää Unicoden “haavoittuvuuksina”, ja ne voidaan kumoaa NLP-putkistossa, joka renderöi kaiken saapuvan tekstin ja käyttää optista merkintunnistusta puhdistusmenetelmänä. Tällöin sama semanttinen merkitys, joka on ihmisille lukijoiden nähtävillä, nämä häiritsevät hyökkäykset, siirretään NLP-järjestelmään.

Kuitenkin, kun tutkijat toteuttivat OCR-putkistoon testatakseen tämän teorian, he löysivät, että BLEU (Bilingual Evaluation Understudy) -pisteet laskivat perusarvon tarkin 6,2 prosentilla, ja ehdottavat, että parannetut OCR-tekniikat olisivat todennäköisesti tarpeen korjata tämän.

He ehdottavat myös, että BIDI-ohjausmerkit tulisi poistaa syötetekstistä oletusarvoisesti, epätavalliset homoglyfit tulisi kartoittaa ja indeksoida (jonka he kuvaavat “haasteelliseksi tehtäväksi”), ja tokenisaattorit ja muut syötteen mekanismit tulisi varustaa näkymättömillä merkeillä.

Tutkimusryhmä kehottaa NLP-alan tulevan tietoisemmaksi mahdollisuuksista adversariaalisille hyökkäyksille, jotka ovat tällä hetkellä suuri kiinnostuksen kohde tietokonegrafiikkaa koskevassa tutkimuksessa.

[Me] suosittelemme, että kaikki yritykset, jotka kehittävät ja ottavat käyttöön tekstipohjaisia NLP-järjestelmiä, toteuttavat sellaiset puolustukset, jos he haluavat sovelluksensa olevan kestäviä vastaan hyökkääjiä.

 

 

* Minun muunnoksen sisäisten viittauksien hyperlinkkeihin

18:08 14. joulukuuta 2021 – poistettu IBM:n toistuva maininta, siirretty automaattinen sisäinen linkki lainauksesta – MA

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai