Andersons vinkel

MLaaS: Förhindrande av API-drivet modellstöld med Variational Autoencoders

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Maskinlärning som en tjänst (MLaaS) kommersialiserar resultaten av dyra forsknings- och modellträningsinsatser via API:er som ger kunderna tillgång till insikter från systemet. Även om systemets resonemang oundvikligen avslöjas till viss del genom dessa transaktioner, är den grundläggande modellarkitekturen, de vikter som definierar modellens nytta och de specifika träningsdata som gjorde den användbar, svårt bevakade av flera skäl.

För det första är ramverket troligen utnyttjat ett antal fria eller öppen källkod (FOSS) kodrepositoryer, och potentiella rivaler kunde trivialt göra detsamma i syfte att uppnå samma mål; för det andra utgör de vikter som används av modellerna 95% eller mer av modellens förmåga att tolka träningsdata bättre än rivalmodeller, och utgör i stor utsträckning det centrala värdet av dyra investeringar, både i form av forskningstimmar och omfattande, välfinansierad modellträning på industrigrade GPU:er.

Det är också en potentiellt brännbar fråga om blandningen av proprietär och offentligt tillgänglig data bakom modellens träningsdataset: där data är “ursprungligt” arbete som erhållits genom dyra metoder, kan en API-användares förmåga att härleda datastrukturen eller innehållet genom API-tillåtna förfrågningar tillåta dem att i princip återskapa värdet av arbetet, antingen genom att förstå schemat för data (vilket möjliggör praktisk reproduktion) eller genom att reproducera de vikter som orkestrerar dataegenskaperna, vilket potentiellt tillåter reproduktion av en “tom” men effektiv arkitektur som kan fyllas med efterföljande material.

Data Tvätt

Dessutom “tvättar” den sätt som data abstraheras i den latenta utrymmet för maskinlärningsmodellen under träningsprocessen i princip data till generaliserade funktioner som gör det svårt för upphovsrättsinnehavare att förstå om deras ursprungliga arbete har assimilerats utan tillstånd i en modell.

Den nuvarande laissez faire-klimatet över hela världen när det gäller denna praxis kommer troligen att falla under allt hårdare reglering under de närmaste 5-10 åren. EU:s utkast till regler för AI innehåller redan bestämmelser om ursprung för data och en påstådd transparensram som skulle göra det svårt för datainsamlingföretag att kringgå domänregler om webbskrapning för forskningsändamål. Andra regeringar, inklusive USA, är nu engagerade i liknande regleringsramar på lång sikt.

Såsom maskinlärningsfältet utvecklas från en bevis på konceptkultur till en livskraftig kommersiell ekosystem, kan ML-modeller som visar sig ha kränkt restriktioner för data, även i tidigare iterationer av deras produkter, kan finna sig juridiskt utsatta.

Därför är risken för att härleda datakällor via API-samtal inte bara relaterad till industriell spionage via modellinversion och andra metoder, utan också till framväxande forensiska metoder för immateriell rättsskydd som kan påverka företag efter att den “vilda västern”-eran för maskinlärningsforskning har avslutats.

API-Driven Exfiltration som ett Medel för att Utveckla Adversarial Attack

Vissa maskinlärningsramverk uppdaterar kontinuerligt sin träningsdata och algoritmer, snarare än att härleda en definitiv, långsiktig enskild modell från ett stort korpus av historiska data (som med GPT-3, till exempel). Dessa inkluderar system relaterade till trafikinformation och andra sektorer där realtidsdata är avgörande för den pågående värdet av en ML-driven tjänst.

Om en modells logik eller data-viktning kan “kartläggas” genom systematiskt att fråga API:et, kan dessa faktorer potentiellt vändas mot systemet i form av adversarial attacker, där illvilligt konstruerad data kan lämnas i det vilda, i områden där målsystemet sannolikt kommer att plocka upp det; eller genom att infiltrera dataanskaffningsrutinerna med andra metoder.

Därför har åtgärder mot API-centrerad kartläggning också implikationer för säkerheten för maskinlärningsmodeller.

Förhindrande av API-Driven Exfiltration

Ett antal forskningsinitiativ har uppstått under de senaste åren för att tillhandahålla metoder som kan förhindra härledning av modellarkitektur och specifik källdata via API-samtal. Den senaste av dessa är beskriven i en preprint-samarbete mellan forskare från Indian Institute of Science i Bangalore och Nference, en AI-baserad programvaruplattform baserad i Cambridge, Massachusetts.

Med titeln Stateful Detection of Model Extraction Attacks, föreslår forskningen ett system som kallas VarDetect, för vilket preliminär kod har gjorts tillgänglig på GitHub.

Körande server-sidigt, övervakar VarDetect kontinuerligt användarfrågor till en API, sökande efter tre distinkta mönster av upprepad modell-extraktionsattack. Forskarna rapporterar att VarDetect är den första försvarsmechanismen av sitt slag som står emot alla tre. Dessutom kan den motverka motåtgärder från angripare som blir medvetna om en försvarsmechanism och som försöker besegra den genom att dölja attackmönstren med pauser eller öka volymen av förfrågningar för att dölja de förfrågningar som försöker bygga en karta av modellen.

VarDetect-arkitekturen. Källa: https://arxiv.org/pdf/2107.05166.pdf

VarDetect-arkitekturen. Källa: https://arxiv.org/pdf/2107.05166.pdf

VarDetect använder Variational Autoencoders (VAE) för att effektivt skapa en heuristisk utvärderingssond för inkommande förfrågningar. Till skillnad från tidigare metoder, är systemet tränat på proprietär data, vilket eliminerar behovet av tillgång till angriparens data, en svaghet i tidigare tillvägagångssätt, och en osannolik scenarie.

Den anpassade modellen som utvecklats för projektet är härledd från tre offentligt tillgängliga dataset eller tillvägagångssätt: arbetet som utvecklats 2016 av det schweiziska federala tekniska universitetet och Cornell Tech; genom att lägga till brus till “problemområdesdata”, som först demonstrerades i 2017 års PRADA-papper från Finland; och genom att crawla offentligt tillgängliga bilder, inspirerad av ActiveThief 2020 forskning från Indian Institute of Science.

En jämförelse av benigna och 'maligna' datasample över de fem dataset som används i VarDetect.

En jämförelse av benigna och ‘maligna’ datasample över de fem dataset som används i VarDetect.

Frekvensfördelningar som matchar egenskaper från det ombord dataset kommer att flaggas som extraktions-signaler.

Forskarna medger att vanliga förfrågningsmönster från benigna slutanvändare kan potentiellt utlösa falska positiva i systemet, vilket förhindrar normal användning. Därför kan sådana uppfattade “säkra” signaler sedan läggas till i VarDetect-dataset, och inkorporeras i algoritmen genom en rullande träningsplan, beroende på värdsystemets preferenser.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai