Andersons vinkel

Tyveri av maskinlæringsmodeller gjennom API-utdata

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Ny forskning fra Canada tilbyr en mulig metode for hvordan angripere kunne stjele resultater fra dyrebare maskinlæringsrammeverk, selv om den eneste tilgangen til et proprietært system er via en høyt sanert og tilsynelatende godt forsvar API (en grensesnitt eller protokoll som prosesserer brukerforespørsler på serversiden og returnerer bare utdataresponsen).

Som forskningssektoren ser mer og mer mot å moneterise dyrebare modelltrening gjennom Machine Learning as a Service (MLaaS)-implementeringer, foreslår den nye forskningen at Selv-Overvåkende Læring (SSL)-modeller er mer sårbare for denne typen modell-ekstraksjon, fordi de er trent uten brukeretiketter, forenkler ekstraksjonen og vanligvis returnerer resultater som inneholder mye nyttig informasjon for noen som ønsker å replikere den (skjulte) kildemodellen.

I ‘black box’-test-simuleringer (der forskerne ga seg selv ingen mer tilgang til en lokal ‘offer’-modell enn en typisk sluttbruker ville ha via en web-API), var forskerne i stand til å replikere mål-systemene med relativt lave ressurser:

‘[Våre] angrep kan stjele en kopi av offermodellen som oppnår betydelig nedstrøms-ytelse i færre enn 1/5 av forespørslene som ble brukt til å trene offeret. Mot en offermodell trent på 1,2 millioner ulabelte eksempler fra ImageNet, med en nøyaktighet på 91,9% på nedstrøms Fashion-MNIST-klassifiseringsoppgaven, vårt direkte ekstraksjonsangrep med InfoNCE-tap stjal en kopi av koderen som oppnår 90,5% nøyaktighet i 200 000 forespørsler.

‘Tilsvarende, mot en offer trent på 50 000 ulabelte eksempler fra CIFAR10, med en nøyaktighet på 79,0% på nedstrøms CIFAR10-klassifiseringsoppgaven, vårt direkte ekstraksjonsangrep med SoftNN-tap stjal en kopi som oppnår 76,9% nøyaktighet i 9 000 forespørsler.’

Forskerne brukte tre angrepsmetoder og fant at 'Direkte Ekstraksjon' var den mest effektive. Disse modellene ble stjålet fra en lokal gjenskapt CIFAR10-offer-koderer ved hjelp av 9 000 forespørsler fra CIFAR10-testsettet. Kilde: https://arxiv.org/pdf/2205.07890.pdf

Forskerne brukte tre angrepsmetoder og fant at ‘Direkte Ekstraksjon’ var den mest effektive. Disse modellene ble stjålet fra en lokal gjenskapt CIFAR10-offer-koderer ved hjelp av 9 000 forespørsler fra CIFAR10-testsettet. Kilde: https://arxiv.org/pdf/2205.07890.pdf

Forskerne bemerker også at metoder som er egnet til å beskytte overvåkede modeller mot angrep, ikke tilpasser seg godt til modeller trent på en uovervåket basis – selv om slike modeller representerer noen av de mest forventede og feirede fruktene av bilde-syntesesektoren.

Den nye artikkelen heter Om vanskeligheten ved å forsvare Selv-Overvåkende Læring mot Modell-Ekstraksjon, og kommer fra University of Toronto og Vector Institute for Artificial Intelligence.

Selv-Bevissthet

I Selv-Overvåkende Læring, blir en modell trent på ulabelt data. Uten etiketter, må en SSL-modell lære assosiasjoner og grupper fra den implisitte strukturen i dataene, søker liknende aspekter av data og gradvis samler disse aspektene inn i noder eller representasjoner.

Hvor en SSL-tilnærming er mulig, er den usedvanlig produktiv, fordi den unngår behovet for dyre (ofte outsourcet og kontroversielle) kategoriseringer av crowdworkers, og essensielt rasjonaliserer dataene autonomt.

De tre SSL-tilnærmingene som er vurdert av artikkelforfatterne, er SimCLR, en Siamese Network; SimSiam, en annen Siamese Network sentrert på representasjonslæring; og Barlow Twins, en SSL-tilnærming som oppnådde state-of-the-art ImageNet-klassifikatorprestasjon på dens utgivelse i 2021.

Modell-ekstraksjon for labelt data (dvs. en modell trent gjennom overvåket læring) er et relativt veldokumentert forskningsområde. Det er også lettere å forsvare mot, siden angriperen må få tak i etikettene fra offermodellen for å replikere den.

En 'knockoff-klassifikator'-angrepsmodell mot en overvåket læring-arkitektur. Kilde: https://arxiv.org/pdf/1812.02766.pdf

Fra en tidligere artikkel, en ‘knockoff-klassifikator’-angrepsmodell mot en overvåket læring-arkitektur. Kilde: https://arxiv.org/pdf/1812.02766.pdf

Uten hvit-boks-tilgang, er dette ikke en trivial oppgave, siden den typiske utdata fra en API-forespørsel til en slik modell inneholder mindre informasjon enn med en typisk SSL-API.

Fra artikkelen*:

‘Tidligere arbeid med modell-ekstraksjon fokuserte på det overvåkede læring (SL)-setting, der offermodellen vanligvis returnerer en etikett eller andre lav-dimensjonale utdata som tiltro- poeng eller logitt.

‘I motsetning, returnerer SSL-kodere høy-dimensjonale representasjoner; den de facto utdata for en ResNet-50 Sim-CLR-modell, en populær arkitektur i visjon, er en 2048-dimensjonal vektor.

‘Vi hypotetiserer at denne betydelig høyere informasjonslekkasjen fra kodere gjør dem mer sårbare for ekstraksjonsangrep enn SL-modeller.’

Arkitektur og Data

Forskerne testet tre tilnærminger til SSL-modell-inferens/ekstraksjon: Direkte Ekstraksjon, der API-utdata sammenlignes med en gjenskapt koders utdata via en passende tap-funksjon som middelverdi-feil (MSE); gjenskaping av prosjeksjons-hodet, der en kritisk analytisk funksjon av modellen, vanligvis kastet før deploy, gjenoppbygges og brukes i en replika-modell; og tilgang til prosjeksjons-hodet, som bare er mulig i tilfeller der de opprinnelige utviklerne har gjort arkitekturen tilgjengelig.

I metode #1, Direkte Ekstraksjon, sammenlignes utdata fra offermodellen med utdata fra en lokal modell; metode #2 innebærer å gjenskape prosjeksjons-hodet brukt i den opprinnelige trenings-arkitekturen (og vanligvis ikke inkludert i en deployet modell).

I metode #1, Direkte Ekstraksjon, sammenlignes utdata fra offermodellen med utdata fra en lokal modell; metode #2 innebærer å gjenskape prosjeksjons-hodet brukt i den opprinnelige trenings-arkitekturen (og vanligvis ikke inkludert i en deployet modell).

Forskerne fant at Direkte Ekstraksjon var den mest effektive metoden for å oppnå en fungerende replika av mål-modellen, og har den ekstra fordelen av å være den mest vanskelige å karakterisere som et ‘angrep’ (fordi det essensielt oppfører seg lite forskjellig fra en typisk og gyldig sluttbruker).

Forskerne trente offer-modeller på tre bilde-datasett: CIFAR10, ImageNet, og Stanford’s Street View House Numbers (SVHN). ImageNet ble trent på ResNet50, mens CIFAR10 og SVHN ble trent på ResNet18 og ResNet24 over en fritt tilgjengelig PyTorch-implementering av SimCLR.

Modellenes nedstrøms (dvs. deployet) ytelse ble testet mot CIFAR100, STL10, SVHN og Fashion-MNIST. Forskerne eksperimenterte også med mer ‘hvit-boks’-metoder for modell-tilpasning, selv om det viste seg at Direkte Ekstraksjon, den minst privilegerte tilnærmingen, ga de beste resultater.

For å evaluere representasjonene som ble inferert og replikert i angrepene, la forfatterne til en lineær prediksjonslag til modellen, som ble finjustert på det fullstendige merket treningssettet fra den påfølgende (nedstrøms) oppgaven, med resten av nettverkslagene frozen. På denne måten kan test-nøyaktigheten på prediksjonslaget fungere som en målestokk for ytelse. Ettersom det bidrar ingenting til inferens-prosessen, representerer dette ikke ‘hvit-boks’-funksjonalitet.

Resultater fra testkjøringer, muliggjort av den (ikke-bidragende) Lineær Evaluering-laget. Nøyaktighetspoeng i fet skrift.

Resultater fra testkjøringer, muliggjort av den (ikke-bidragende) Lineær Evaluering-laget. Nøyaktighetspoeng i fet skrift.

I kommentar til resultater, sier forskerne:

‘Vi finner at det direkte målet med å imitere offerets representasjoner gir høy ytelse på nedstrøms-oppgaver, til tross for at angrepet bare krever en brøkdel (mindre enn 15% i visse tilfeller) av antall forespørsler som ble brukt til å trene den stjålne koderen fra første sted.’

Og fortsetter:

‘[Det] er vanskelig å forsvare kodere trent med SSL siden utdata-representasjonene lekkere en betydelig mengde informasjon. De mest lovende forsvarsmetodene er reaktive metoder, som vannmerking, som kan innføre spesifikke forbedringer i høy-kapasitets-kodere.’

 

* Min konvertering av artikkelenes inline-citater til hyperlenker.

Først publisert 18. mai 2022.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai