Andersonin kulma

Konenäön mallien varastaminen API-vastauksen kautta

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Uusi tutkimus Kanadasta tarjoaa mahdollisen menetelmän, jolla hyökkääjät voivat varastaa kalliiden koneälymallien tulokset, vaikka ainoa pääsy omistettuun järjestelmään on hyvin suojattuun API:hin (rajapinta tai protokolla, joka prosessoi käyttäjän kyselyt palvelimella ja palauttaa vain vastausvastauksen).

Tutkimusala katsoo yhä enemmän rahoittavansa kalliiden mallien koulutusta Machine Learning as a Service (MLaaS) -toteutuksilla, ja uusi työ osoittaa, että itseoppijaisten oppimismalleja (Self-Supervised Learning, SSL) on alttiimpia tällaiselle mallin salamiseksi, koska ne koulutetaan ilman käyttäjän merkitsemisiä etikettejä, mikä yksinkertaistaa niiden poistamisen, ja ne tarjoavat yleensä tuloksia, jotka sisältävät paljon hyödyllistä tietoa jollekulle, joka haluaa jäljitellä (piilotettua) alkuperäistä mallia.

“Mustan laatikon” testisimulaatioissa (joissa tutkijat antoivat itselleen vain saman pääsyn paikalliseen “uhri”-malliin kuin tyypillinen loppukäyttäjä olisi API:n kautta), tutkijat pystyivät jäljittelemään kohdemalleja suhteellisen vähäisillä resursseilla:

‘[Meidän] hyökkäykset voivat varastaa kopion uhri-mallista, joka saavuttaa merkittävän lopputuloksen vähemmässä kuin 1/5:ssä kyselyistä, joita käytettiin uhri-mallin kouluttamiseen. Uhri-malli, joka on koulutettu 1,2 miljoonalla etiketillä ImageNet-tietokannasta, saavuttaa 91,9 prosentin tarkin luokittelutarkkuuden Fashion-MNIST-luokittelutehtävässä, ja meidän suora ekstraktiohyökkäys InfoNCE-hävikillä varastaa kopion, joka saavuttaa 90,5 prosentin tarkin luokittelutarkkuuden 200 000 kyselyssä.

‘Vastaavasti, uhri-malli, joka on koulutettu 50 000 etiketillä CIFAR10-tietokannasta, saavuttaa 79,0 prosentin tarkin luokittelutarkkuuden CIFAR10-luokittelutehtävässä, ja meidän suora ekstraktiohyökkäys SoftNN-hävikillä varastaa kopion, joka saavuttaa 76,9 prosentin tarkin luokittelutarkkuuden 9 000 kyselyssä.’

Tutkijat käyttivät kolmea hyökkäysmenetelmää ja totesivat, että 'suora ekstraktio' oli tehokkain. Nämä mallit varastettiin paikallisesti uudelleenluodusta CIFAR10-uhri-encoderista 9 000 kyselyllä CIFAR10-testijoukosta. Lähde: https://arxiv.org/pdf/2205.07890.pdf

Tutkijat käyttivät kolmea hyökkäysmenetelmää ja totesivat, että ‘suora ekstraktio’ oli tehokkain. Nämä mallit varastettiin paikallisesti uudelleenluodusta CIFAR10-uhri-encoderista 9 000 kyselyllä CIFAR10-testijoukosta. Lähde: https://arxiv.org/pdf/2205.07890.pdf

Tutkijat huomauttavat myös, että menetelmät, jotka soveltuvat valvottujen mallien suojelemiseen hyökkäyksiltä, eivät sovellu hyvin malleihin, jotka on koulutettu valvomattomasti – vaikka tällaiset mallit edustavat osaa odotetuimmista ja juhlistetuimmista kuvansynteesin alan tuloksista.

Uusi tutkimus on otsikoitu Itseoppijaisten oppimismallien puolustaminen mallin ekstraktiota vastaan, ja se on peräisin Toronton yliopistosta ja Vector-instituutista tekoälystä.

Itsetietoisuus

Itseoppijaisten oppimismalleissa malli koulutetaan ilman etikettejä. Ilman etikettejä itseoppijaisten oppimismalli joutuu oppimaan assosiaatioita ja ryhmiä datan implisiittisestä rakenteesta, etsimään samankaltaisia datan piirteitä ja hitaasti kokoamaan nämä piirteet solmuiksi eli edustuksiksi.

Jos itseoppijaisten oppimismenettely on käytettävissä, se on erittäin tuottavaa, koska se ohittaa tarpeen kalliille (usein ulkoistetuille ja kiistanalaisille) etikettien luomiselle joukkorahoituksen avulla, ja perustelee datan itsestään.

Kolme itseoppijaista oppimismenetelmää, joita tutkimuksen tekijät tutkivat, ovat SimCLR, Siamese-verkko; SimSiam, toinen Siamese-verkko, joka keskittyy edustusten oppimiseen; ja Barlow Twins, itseoppijaisten oppimismenetelmä, joka saavutti huipputason ImageNet-luokittelijan suorituskyvyn julkaisunsa yhteydessä vuonna 2021.

Mallin ekstraktio etiketoitujen datojen kanssa (ts. malli, joka on koulutettu valvotulla oppimisella) on suhteellisen hyvin dokumentoitu tutkimusalue. Se on myös helpompi puolustaa, koska hyökkääjän on saatava etiketit uhri-mallista, jotta se voidaan uudelleenluoda.

Hyökkäysmalli valvotun oppimisen arkkitehtuuriin. Lähde: https://arxiv.org/pdf/1812.02766.pdf

Hyökkäysmalli valvotun oppimisen arkkitehtuuriin. Lähde: https://arxiv.org/pdf/1812.02766.pdf

Ilman valkoisen laatikon pääsyä tämä ei ole triviaali tehtävä, koska tyypillinen API-pyynnön vastaus tällaiselle mallille sisältää vähemmän tietoa kuin tyypillinen itseoppijaisten oppimismallien API.

Tutkimuspaperista*:

‘Aikaisemmat tutkimukset mallin ekstraktiosta keskittyivät valvottuun oppimiseen, jossa uhri-malli yleensä palauttaa etiketin tai muiden matala-ulotteisen tulokset, kuten luottamusluokat tai logiit.

‘Toisaalta itseoppijaisten koodaajat palauttavat korkean-ulotteisen edustuksen; de facto tuloste ResNet-50 Sim-CLR-mallille, joka on suosittu arkkitehtuuri näköalalla, on 2048-ulotteinen vektori.

‘Oletamme, että tämä huomattavasti suurempi tietovuo itseoppijaisten koodaajien kautta tekee niistä alttiimpia ekstraktiohyökkäyksille kuin valvottujen mallien koodaajat.’

Arkkitehtuuri ja data

Tutkijat testasivat kolmea lähestymistapaa itseoppijaisten oppimismallien ekstraktioon/inferenssiin: suoran ekstraktion, jossa API-vastaus vertaillaan uudelleenluodun koodaajan tulokseen sopivan hävikin avulla, kuten keskineliövirhe (MSE); projektiokepän uudelleenluominen, jossa kriittinen analyysi-toiminto, jota malli normaalisti hylkää ennen käyttöönottoa, kootaan uudelleen ja käytetään kopio-mallissa; ja projektiokepän käyttäminen, joka on mahdollista vain silloin, kun alkuperäiset kehittäjät ovat tehneet arkkitehtuurin saataville.

Menetelmä 1, suora ekstraktio, vertaa uhri-mallin tulosta paikallisen mallin tulokseen; menetelmä 2 sisältää projektiokepän uudelleenluomisen, jota käytetään alkuperäisessä koulutusarkkitehtuurissa (ja jota yleensä ei sisällytetä käyttöön otettuun malliin).

Menetelmä 1, suora ekstraktio, vertaa uhri-mallin tulosta paikallisen mallin tulokseen; menetelmä 2 sisältää projektiokepän uudelleenluomisen, jota käytetään alkuperäisessä koulutusarkkitehtuurissa (ja jota yleensä ei sisällytetä käyttöön otettuun malliin).

Tutkijat totesivat, että suora ekstraktio oli tehokkain menetelmä toimivan kopion saamiseksi kohdemallista, ja se on myös vaikein tunnistaa “hyökkäykseksi” (koska se käyttäytyy hyvin samalla tavalla kuin tyypillinen ja validi loppukäyttäjä).

Tutkijat kouluttivat uhri-malleja kolmella kuvatietokannalla: CIFAR10, ImageNet ja Stanfordin Street View House Numbers (SVHN). ImageNet koulutettiin ResNet50:llä, kun taas CIFAR10 ja SVHN koulutettiin ResNet18:lla ja ResNet24:llä vapaasti saatavilla olevan PyTorch-toteutuksen SimCLR:n avulla.

Mallien lopputuloksen (eli käyttöönotetun) suorituskyky testattiin CIFAR100, STL10, SVHN ja Fashion-MNIST -tehtävissä. Tutkijat kokeilivat myös enemmän “valkoisen laatikon” menetelmiä mallin omimiseksi, mutta kävi ilmi, että suora ekstraktio, jolla oli vähiten etuoikeuksia, antoi parhaat tulokset.

Arvioidakseen edustuksia, jotka jäljiteltiin ja uudelleenluotiin hyökkäyksissä, tutkijat lisäsivät lineaarisen ennustuskerroksen malliin, joka säätettiin koko etiketoituneen koulutusjoukon kanssa, kun taas loput verkon kerroksista olivat jäädytettyjä. Tällä tavoin ennustuskerroksen testitarkkuus voi toimia suorituskyvyn mittarina. Koska se ei vaikuta inferenssiprosessiin, se ei edusta “valkoisen laatikon” toimintoa.

Testikäyntien tulokset, jotka tehtiin mahdollisiksi (ei-vaikuttavalla) lineaarisen arvioinnin kerroksen avulla. Tarkkuusluokat lihavoituina.

Testikäyntien tulokset, jotka tehtiin mahdollisiksi (ei-vaikuttavalla) lineaarisen arvioinnin kerroksen avulla. Tarkkuusluokat lihavoituina.

Kommentoidessaan tuloksia tutkijat toteavat:

‘Havaitsemme, että suoran tulosten jäljittäminen antaa korkean suorituskyvyn lopputulostehtävissä, vaikka hyökkäys vaatii vain pienen osan (alle 15 prosenttia joissakin tapauksissa) kyselyjen määrästä, jota tarvitaan varastetun koodaajan kouluttamiseen alusta alkaen.’

Ja jatkavat:

‘[Se] on haasteellista puolustaa itseoppijaisten koodaajia, jotka on koulutettu itseoppijaisten oppimismenettelyllä, koska tuloste-edustukset vuotavat merkittävän määrän tietoa. Lupaavimmat puolustusmenetelmät ovat reaktiivisia menetelmiä, kuten vesileimaa, jotka voivat upottaa tiettyjä muutoksia korkean kapasiteetin koodaajiin.’

 

* Minun muunnos tutkimuksen sisäisistä viittauksista hyperlinkkeihin.

Julkaistu ensimmäisen kerran 18. toukokuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai