Kyberturvallisuus

Miksi Adversarial Image -hyökkäykset eivät ole vitsi

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kuvatunnistusjärjestelmiin kohdistuvien huolellisesti suunniteltujen adversarial-kuvien hyökkäykset on pidetty viihdyttävänä, mutta triviaalisena todistusaineistona viimeisen viiden vuoden ajan. Uusi australialainen tutkimus kuitenkin osoittaa, että erittäin suosittujen kuvatietokantojen käyttäminen kaupallisissa tekoälyprojekteissa voi luoda kestävän uuden turvallisuusongelman.

 

Oletetaan, että Adelaiden yliopiston akateemikkojen ryhmä on yrittänyt selittää jotain tärkeää tulevista tekoälypohjaisista kuvatunnistusjärjestelmistä.

Se olisi vaikeaa (ja erittäin kallista) korjata juuri nyt, ja se olisi omatuntoa vastaan kallista korjata, kun nykyiset kuvatunnistustutkimuksen trendit ovat kehittyneet kaupallisiin ja teollisiin käyttökohteisiin 5-10 vuoden kuluttua.

Ennen kuin perehdytään asiaan, katsotaan kukkaa, joka luokitellaan Barack Obamanaksi, yhdestä kuudesta videosta, jotka tiimi on julkaissut projektisivulla:

Lähde: https://www.youtube.com/watch?v=Klepca1Ny3c

Lähde: https://www.youtube.com/watch?v=Klepca1Ny3c

Yllä olevassa kuvassa kasvontunnistusjärjestelmä, joka selvästi osaa tunnistaa Barack Obaman, on huijattu 80-prosenttisesti uskomaan, että anonyymi mies, jolla on valmistettu, tulostettu adversarial-kuva kukasta, on myös Barack Obama. Järjestelmä ei edes välitä, että “väärennetty kasvo” on kohteessa rinnalla eikä olkapäillä.

Vaikka tutkijat ovat onnistuneet saamaan aikaan tällaista identiteetin sieppausta luomalla yhtenäisen kuvan (kukka) sen sijaan, että olisi käytetty pelkästään satunnaista hälyä, näyttää siltä, että tällaiset hölmö hyökkäykset ilmestyvät melko säännöllisesti tietokoneen näön turvallisuustutkimuksessa. Esimerkiksi ne outojen kuvioiden lasit, jotka pystyivät huijaamaan kasvontunnistuksen vuonna 2016, tai erityisesti valmistetut adversarial-kuvat, jotka yrittävät muuttaa tienviittoja.

Jos olet kiinnostunut, Convolutional Neural Network (CNN) -malli, jota hyökätään yllä olevassa esimerkissä, on VGGFace (VGG-16), joka on koulutettu Columbian yliopiston PubFig-tietokannalla. Tutkijoiden kehittämät muut hyökkäysmallit käyttivät eri resursseja eri yhdistelmissä.

Näppäimistö on uudelleenluokiteltu simpukaksi WideResNet50-mallissa ImageNetissä. Tutkijat ovat myös varmistaneet, että malli ei ole ennaltaehkäisevästi suunnattu simpukoihin. Katso koko video laajemmista ja lisädemonstraatioista osoitteessa https://www.youtube.com/watch?v=dhTTjjrxIcU

Näppäimistö on uudelleenluokiteltu simpukaksi WideResNet50-mallissa ImageNetissä. Tutkijat ovat myös varmistaneet, että malli ei ole ennaltaehkäisevästi suunnattu simpukoihin. Katso koko video laajemmista ja lisädemonstraatioista osoitteessa https://www.youtube.com/watch?v=dhTTjjrxIcU

Kuvatunnistus uutena hyökkäysvektorina

Tutkijoiden esittämät monien vaikuttavien hyökkäysten ei voida pitää yksittäisten tietokantojen tai tiettyjen koneoppimismallien arvosteluna, jotka käyttävät niitä. Ne eivät myöskään voida puolustautua helposti vaihtamalla tietokantoja tai malleja, kouluttamalla malleja uudelleen tai muilla “helppojen” korjausten avulla, joita koneoppimisen harjoittajat pitävät tällaisten temppujen satunnaisina esittelyinä.

Sen sijaan Adelaiden tiimin temput edustavat keskeistä heikkoutta koko nykyisen kuvatunnistus-tekolykehityksen arkkitehtuurissa; heikkoutta, joka voi altistaa monia tulevia kuvatunnistusjärjestelmiä helppojen manipulaatioiden kohteeksi ja asettaa myöhemmät puolustuskeinot epätasa-arvoiseen asemaan.

Kuvitellaan uusimmat adversarial-kuva -hyökkäykset (kuten yllä oleva kukka) lisättäviksi “zero-day -hyökkäyksiksi” tulevaisuuden turvallisuusjärjestelmiin, samoin kuin nykyiset vastamalware- ja virustorjuntakehykset päivittävät virusmäärityksiään joka päivä.

Uusien adversarial-kuvahyökkäysten mahdollisuudet olisivat loputtomat, koska järjestelmän perusrakenteessa ei ollut ennalta arvioituja alirakenteellisia ongelmia, kuten internetissä, Millennium Bugissa ja Pisan kaltevassa tornissa.

Miten siis asetamme näytämön tähän?

Hyökkäyksen datan hankkiminen

Adversarial-kuvat, kuten yllä oleva kukkaesimerkki, luodaan pääsystä kuvatietokantoihin, jotka kouluttavat tietokoneen malleja. Sinun ei tarvitse “etuoikeutettua” pääsyä koulutusdataan (tai mallirakenteisiin), koska suosituimmat tietokannat (ja monet koulutetut mallit) ovat laajasti saatavilla vahvassa ja jatkuvasti päivittyvässä torrent-kohtauksessa.

Esimerkiksi kuvatunnistuksen jättiläinen, ImageNet, on saatavilla torrentissa kaikissa sen monissa iteraatioissa, ohittaen sen tavanomaiset rajoitukset ja tarjoamalla tärkeitä toissijaisia elementtejä, kuten validointijoukkoja.

Lähde: https://academictorrents.com

Lähde: https://academictorrents.com

Jos sinulla on data, voit (kuten Adelaiden tutkijat huomauttavat) “kääntää” tehokkaasti minkä tahansa suositun tietokannan, kuten CityScapesin tai CIFARin.

PubFig-tietokannan tapauksessa, joka mahdollisti “Obama-kukan” aiemmassa esimerkissä, Columbian yliopisto on osoittanut kasvavan trendin tekijänoikeusongelmiin kuvatietokantojen uudelleenjakoamisessa ohjaamalla tutkijoita toistamaan tietokannan kautta kuratoituja linkkejä, sen sijaan, että se olisi suoraan saatavilla, ja toteaa ‘Tämä näyttää olevan tapa, jolla muutkin suuret verkkopohjaiset tietokannat kehittyvät’.

Useimmissa tapauksissa sitä ei kuitenkaan tarvitse tehdä: Kaggle arvioi, että kymmenen suosituinta kuvatietokantaa tietokoneen näössä ovat: CIFAR-10 ja CIFAR-100 (molemmat suoraan ladattavissa); CALTECH-101 ja 256 (molemmat saatavilla ja saatavilla torrenteina); MNIST (virallisesti saatavilla, myös torrenteina); ImageNet (ks. yllä); Pascal VOC (saatavilla, myös torrenteina); MS COCO (saatavilla ja torrenteina); Sports-1M (saatavilla); ja YouTube-8M (saatavilla).

Tämä saatavuus edustaa myös laajempaa saatavilla olevaa tietokoneen näön kuvatietokantoja, koska epäily on kuolema avoimessa kehityskulttuurissa.

Mikä tahansa, tiellä on ongelmia, kuten tietokantojen saatavuuden niukkuus, uusien tietokantojen kehittämisen korkeat kustannukset, vanhojen tietokantojen käytön ja siihen liittyvän sopeuttamisen taipumus, kaikki nämä lisäävät ongelmaa, josta uusi Adelaiden tutkimus kertoo.

Tavalliset kritiikit Adversarial Image -hyökkäysmenetelmistä

Useimmin ja jatkuvasti esitetty kritiikki koneoppimisen insinööreiltä Adversarial Image -hyökkäystekniikoiden tehokkuutta vastaan on, että hyökkäys on tietylle tietokannalle, tietylle mallille tai molemmille erityinen; että se ei ole “yleistettävissä” muihin järjestelmiin; ja siten edustaa vain vähäistä uhkaa.

Toiseksi yleisin valitus on, että Adversarial Image -hyökkäys on ‘valkoinen laatikko’, eli että siihen tarvitaan suora pääsy koulutusympäristöön tai dataan. Tämä on todella epätodennäköinen skenaario useimmissa tapauksissa – esimerkiksi, jos haluaisit hyödyntää Lontoon Metropolitan Police -viranomaisten kasvontunnistusjärjestelmiä, sinun pitäisi murtautua NEC:iin joko konsolilla tai kirveellä.

Suositeltujen tietokantojen pitkäaikainen “DNA”

Ensimmäiseen kritiikkiin viitaten, meidän tulisi ottaa huomioon, että vain muutamia tietokoneen näön tietokantoja hallitsee teollisuutta vuosi vuodelta (ts. ImageNet useille eri objekteille, CityScapes ajoneuvoille ja FFHQ kasvontunnistukselle); sekä se, että ne ovat yksinkertaisia merkittyjä kuvadataa, ovat “alusta-agnostisia” ja erittäin siirrettäviä.

Riippuen sen kyvyistä, mikä tahansa tietokoneen näön koulutusarkkitehtuuri löytää jotkut objekteille ja luokille ImageNet-tietokannassa olevat piirteet. Jotkut arkkitehtuurit saattavat löytää enemmän piirteitä kuin toiset, tai tehdä enemmän hyödyllisiä yhteyksiä kuin toiset, mutta kaikki löytävät vähintään korkeimman tason piirteet:

ImageNet-data, jossa on vähimmäismäärä oikein tunnistettuja - 'korkean tason' piirteitä.

ImageNet-data, jossa on vähimmäismäärä oikein tunnistettuja – ‘korkean tason’ piirteitä.

Nämä “korkean tason” piirteet erottavat ja “tunnistelevat” tietokannan ja ovat luotettavia “koukkuja”, joihin voidaan ripustaa pitkäaikainen Adversarial Image -hyökkäysmenetelmä, joka voi ylittää eri järjestelmiä ja kasvaa yhdessä “vanhan” tietokannan kanssa, kun sitä jatketaan uudessa tutkimuksessa ja tuotteissa.

Monimutkaisempi arkkitehtuuri tuottaa tarkemmin ja yksityiskohtaisemmin tunnistamisia, piirteitä ja luokkia:

Kuitenkin, mitä enemmän Adversarial-kuva -hyökkäysgeneraattori riippuu näistä alemmista piirteistä (ts. “Nuori valkoinen mies” sen sijaan, että “Kasvo”), sitä vähemmän se on tehokas ylittäessään eri arkkitehtuureja ja myöhempiä tietokantoja, joissa on erilaisia alkuperäisen tietokannan versioita – kuten alijoukkoa tai suodatettua joukkoa, jossa alkuperäisestä tietokannasta puuttuu monia kuvia:

Adversarial -hyökkäykset “nollattuihin”, esikoulutettuihin malleihin

Mitä tapahtuu, kun vain ladataan esikoulutettu malli, joka on alun perin koulutettu erittäin suositulla tietokannalla, ja annetaan sille täysin uusi data?

Malli on jo koulutettu (esim. ImageNetillä), ja kaikki, mitä on jäljellä, ovat painot, jotka saattavat vaatia viikkoja tai kuukausia kouluttamiseen ja ovat nyt valmiit auttamaan tunnistamaan samanlaisia objekteja kuin ne, jotka olivat alkuperäisessä (nyt poistetussa) datassa.

Alkuperäisen datan poistaminen koulutusarkkitehtuurista jättää mallin

Alkuperäisen datan poistaminen koulutusarkkitehtuurista jättää mallin “enemmistön” luokittelussa tapahtumaan siten, kuin se alun perin oppi, mikä aiheuttaa monien alkuperäisten “signaattorien” uudelleenmuodostumisen ja tekee ne jälleen alttiiksi samojen vanhojen Adversarial Image -hyökkäysmenetelmien kohteiksi.

Nuo painot ovat arvokkaita. Ilman dataa tai painoja sinulla on tyhjä arkkitehtuuri ilman dataa. Sinun on koulutettava se alusta alkaen, jolloin kuluu paljon aikaa ja laskentaresursseja, samoin kuin alkuperäiset tekijät (luultavasti tehokkaammalla laitteistolla ja suuremmalla budjetilla kuin sinulla on saatavilla).

Hankalat painot ovat kuitenkin melko hyvin muodostuneita ja kestäviä. Vaikka ne sopeutuvat jonkin verran koulutuksessa, ne tulevat käyttäytymään uudessa datassasi samalla tavalla kuin alkuperäisessä datassa, tuottaen signaattureita, joihin Adversarial-kuva -hyökkäysjärjestelmä voi kytkeytyä takaisin.

Pitkällä aikavälillä tämä myös säilyttää tietokoneen näön tietokantojen “DNA:ta”, jotka ovat yli 12 vuotta vanhoja ja voivat olla kulkeneet merkittävän evoluution avoimista lähdekoodiprojekteista kaupallisiin käyttökohteisiin – jopa siinä tapauksessa, että alkuperäinen koulutusdata on poistettu kokonaan projektin alussa. Jotkut näistä kaupallisista käyttökohteista eivät välttämättä tapahdu vielä useita vuosia.

Ei valkoista laatikkoa tarvita

Toiseen yleiseen kritiikkiin viitaten Adversarial-kuva -hyökkäysjärjestelmistä, uuden tutkimuksen kirjoittajat ovat havainneet, että heidän kykynsä huijata tunnistusjärjestelmiä valmistetuilla kukka-kuvilla on erittäin siirrettävissä useiden arkkitehtuuriensa kautta.

Vaikka he huomauttavat, että heidän “Universal NaTuralistic adversarial paTches” (TnT) -menetelmänsä on ensimmäinen, joka käyttää tunnistettavia kuvia (sen sijaan, että satunnaista hälyä) huijatakseen kuvatunnistusjärjestelmiä, kirjoittajat toteavat myös:

‘[TnTs] ovat tehokkaita useita valmiita luokittimia vastaan, mukaan lukien laajasti käytetty WideResNet50 Large-Scale Visual Recognition -tehtävässä ImageNet -tietokannassa ja VGG-face -malleissa kasvontunnistustehtävässä PubFig -tietokannassa sekä kohdennetuissa että kohdennetuissa hyökkäyksissä.

‘TnTs voivat omata: i) luonnollisen saavutettavuuden, jota voidaan käyttää Trojan -hyökkäysmenetelmissä; ja ii) yleistettävyyttä ja siirrettävyyttä adversarial-esimerkkeihin muihin verkkoihin.

‘Tämä herättää turvallisuus- ja turvallisuusuhkia jo käytössä olevista DNN:stä sekä tulevista DNN-käyttökohteista, joissa hyökkääjät voivat käyttää epäilyttäviä, luonnollisen näköisiä esineitä johtamaan neuroverkkojärjestelmiä harhaan ilman mallin vahingoittamista ja vaarantamatta havaitsemista.’

Kirjoittajat ehdottavat, että perinteiset vastatoimet, kuten verkon puhdistus, voivat teoriassa tarjota jonkinlaista puolustusta TnT-patcheja vastaan, mutta että ‘TnTs voivat silti ohittaa tämän SOTA-provable-puolustusmenetelmän useimmissa puolustusjärjestelmissä, joista useimmat saavuttavat 0%:n kestävyyden’.

Mahdollisia muita ratkaisuja ovat hajautettu koulutus, jossa osallistujien kuvien alkuperä on suojattu, ja uudet lähestymistavat, jotka voivat suoraan “salata” datan koulutuksen aikana, kuten äskettäin ehdotettiin Nanjingin ilmailu- ja avaruusteknillisen yliopiston tutkijoilla.

Jopa niissä tapauksissa olisi kuitenkin tärkeää kouluttaa aidoilla uusilla kuvadatoilla – nykyään kuvat ja niiden liittyvät annotaatiot suosituimmissa CV-tietokannoissa ovat niin vahvasti juurtuneita kehityskierroksissa ympäri maailmaa, että ne muistuttavat enemmän ohjelmistoa kuin dataa; ohjelmistoa, jota usein ei ole merkittävästi päivitetty vuosiin.

Johtopäätös

Adversarial-kuva -hyökkäykset ovat mahdollisia paitsi avoimien koneoppimismenetelmien myös kaupallisen tekoälykehityskulttuurin ansiosta, joka on motivoitunut uudelleenkäyttämään vakiintuneita tietokoneen näön tietokantoja useista syistä: ne ovat osoittaneet olevansa tehokkaita; ne ovat paljon halvempia kuin “alkaminen alusta”; ja ne ovat ylläpidettyjä ja päivitettyjä eturintamien älymien ja organisaatioiden toimesta akateemisissa ja teollisissa piireissä, joiden rahoitus- ja henkilöstöresurssit olisivat vaikeasti toistettavissa yhdellä yrityksellä.

Lisäksi monissa tapauksissa, joissa dataa ei ole alun perin (kuten CityScapesissa), kuvat on kerätty ennen viimeaikaisia kiistoja yksityisyyden ja datan keräämisen käytännöistä, jättäen nämä vanhemmat tietokannat tietynlaiseen puolittain lailliseen limboon, joka voi näyttää yrityksen näkökulmasta turvalliselta “turvapaikalta”.

 

TnT -hyökkäykset! Universal Naturalistic Adversarial Patches Against Deep Neural Network Systems on kirjoitettu yhteistyössä Bao Gia Doanin, Minhui Xuen, Ehsan Abbasnejadin ja Damith C. Ranasinghen kanssa Adelaiden yliopistosta yhdessä Shiqing Man kanssa Rutgersin yliopiston tietojenkäsittelytieteen osastolta.

 

 

1. joulukuuta 2021, 7:06, GMT+2 – korjattu kirjoitusvirhe.

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai