AI-mallit ja alustat

TextFooler-algoritmi huijaa NLP-ai: n

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Natural language processing -algoritmit ja -järjestelmät ovat olleet vaikuttavia viime vuosina, mutta ne ovat edelleen haavoittuvia hyökkäykselle, jota kutsutaan “vastakkaiseksi esimerkiksi”. Vastakkaiset esimerkit ovat huolellisesti suunniteltuja lauseita, jotka voivat aiheuttaa NLP-järjestelmän käyttäytymisen odottamattomalla ja ei-toivottavalla tavalla. AI-ohjelmat voidaan saada käyttäytymään väärin näiden outojen esimerkkien avulla, ja tämän seurauksena AI-tutkijat yrittävät suunnitella keinoja, joilla voidaan suojautua vastakkaisen esimerkin vaikutuksia vastaan.

Äskettäin tutkijaryhmä Hong Kongin yliopistosta ja Singaporen tieteellisestä tutkimuslaitoksesta teki yhteistyötä luodakseen algoritmin, joka osoittaa vastakkaisen esimerkin vaaran. Wiredin mukaan tutkijaryhmä nimesi algoritmin TextFooleriksi, ja se toimii muuttamalla lauseen osia hienoisesti, vaikuttaen siihen, miten NLP-luokittelija tulkitsi lauseen. Esimerkiksi algoritmi muutti yhden lauseen toiseksi samankaltaiseksi lauseksi, ja lause syötettiin luokittelijaan, joka oli suunniteltu määrittämään, onko arvostelu negatiivinen vai positiivinen. Alkuperäinen lause oli:

“Hahmot, jotka on valittu mahdottomiin keksittyihin tilanteisiin, ovat täysin eristettyjä todellisuudesta.”

Se muutettiin seuraavaksi lauseksi:

“Hahmot, jotka on valittu mahdottomiin suunniteltuihin olosuhteisiin, ovat täysin eristettyjä todellisuudesta.”

Nämä hienoiset muutokset aiheuttivat, että tekstiluokittelija luokitteli arvostelun positiiviseksi sen sijaan, että se olisi ollut negatiivinen. Tutkijaryhmä testasi samaa lähestymistapaa (vaihtamalla tiettyjä sanoja synonyymejä) useilla eri tietojoukoilla ja tekstiluokittelualgoritmeilla. Tutkijaryhmä raportoi, että he pystyivät laskeamaan algoritmin luokittelun tarkin 10 prosenttiin, 90 prosentista. Tämä on huolestuttavaa, koska ihmiset, jotka lukevat näitä lauseita, tulkitsisivat niiden olevan samanmerkkisiä.

Nämä tulokset ovat huolestuttavia aikakaudella, jolloin NLP-algoritmit ja AI ovat yhä enemmän käytössä ja tärkeissä tehtävissä, kuten lääkintävaatimusten arvioinnissa tai oikeudellisten asiakirjojen analysoinnissa. On tuntematonta, kuinka suuri vaara vastakkaiset esimerkit ovat nykyisille algoritmeille. Tutkijaryhmät ympäri maailmaa yrittävät edelleen selvittää, kuinka suuren vaaran ne voivat aiheuttaa. Äskettäin Stanfordin Human-Centered AI -ryhmä julkaisi raportin, jossa todettiin, että vastakkaiset esimerkit voivat huijata AI-algoritmeja ja käyttää niitä veropetoksiin.

Tämän tutkimuksen rajoituksia on useita. Esimerkiksi Sameer Singh, UC Irvinen apulaisprofessori, toteaa, että vastakkainen menetelmä, jota käytettiin, oli tehokas, mutta se riippuu tietyn tason tiedosta AI:n arkkitehtuurista. AI:ta on tutkittava useita kertoja, kunnes voidaan löytää tehokas joukko sanoja, ja tällaiset toistuvat hyökkäykset voivat tulla havaituiksi turvallisuusohjelmilla. Singh ja hänen kollegansa ovat tehneet omaa tutkimusta aiheesta ja löytäneet, että edistyneet järjestelmät, kuten OpenAI-algoritmit, voivat tuottaa rasistista, vahingoittavaa tekstiä, kun niille annetaan tiettyjä lauseita.

Vastakkaiset esimerkit ovat myös potentiaalinen ongelma visuaalisten tietojen, kuten valokuvien tai videoiden, kanssa. Yksi kuuluisa esimerkki liittyy siihen, että tietyt hienoiset digitaaliset muutokset voidaan tehdä kissan valokuvassa, jolloin kuvaluokittelija tulkitsi sen olevan monitori tai pöytätietokone . Toisessa esimerkissä UC Berkeley -professori Dawn Songin tekemä tutkimus osoitti, että vastakkaiset esimerkit voidaan käyttää muuttamaan, miten tietokoneen näköjärjestelmät havaitsevat tienviittoja, mikä voi olla vaarallista itsenäisille ajoneuvoille.

Tutkimus, kuten Hong Kongin ja Singaporen tutkijaryhmän tekemä, voi auttaa AI-insinöörejä ymmärtämään, minkälaisia heikkouksia AI-algoritmeilla on, ja suunnittelemaan keinoja, joilla voidaan suojautua näitä heikkouksia vastaan. Esimerkiksi yhdistelmäluokittelijoita voidaan käyttää vähentämään riskiä, että vastakkainen esimerkki pystyy huijaamaan tietokoneen näköjärjestelmää. Tässä tekniikassa useita luokittelijoita käytetään, ja hienoisia muutoksia tehdään syötekuvaan. Useimmat luokittelijat tulkitsisivat yleensä kuvan todellisen sisällön osia, jotka sitten yhdistetään. Tuloksena on, että vaikka joitakin luokittelijoita voidaan huijata, useimmat eivät ole, ja kuva luokitellaan oikein.

Blogger ja ohjelmoija, jolla on erityisalat Machine Learning ja Deep Learning -aiheissa. Daniel toivoo pystyvänsä auttamaan muita käyttämään tekoälyn voimaa sosiaaliseen hyvään.