AI-modeller och plattformar

Avslöja integritetsbakdörrar: Hur förtränade modeller kan stjäla din data och vad du kan göra åt det

mm
Lägg till Unite.AI bland dina föredragna källor på Google

I en era där AI driver allt från virtuella assistenter till personliga rekommendationer, har förtränade modeller blivit en integrerad del av många applikationer. Förmågan att dela och finjustera dessa modeller har förvandlat AI-utvecklingen, möjliggjort snabb prototypning, främjat innovativt samarbete och gjort avancerad teknik mer tillgänglig för alla. Plattformar som Hugging Face har nästan 500 000 modeller från företag, forskare och användare, vilket stöder denna omfattande delning och förfining. Men när denna trend växer, medför den också nya säkerhetsutmaningar, särskilt i form av leverantörskedjeattacker. Att förstå dessa risker är avgörande för att säkerställa att den teknik vi förlitar oss på fortsätter att tjäna oss på ett säkert och ansvarsfullt sätt. I den här artikeln kommer vi att utforska den ökande hotbilden från leverantörskedjeattacker som kallas integritetsbakdörrar.

Navigering i AI-utvecklingens leverantörskedja

I den här artikeln använder vi termen “AI-utvecklingens leverantörskedja” för att beskriva hela processen för att utveckla, distribuera och använda AI-modeller. Detta inkluderar flera faser, såsom:

  1. Förtränad modellutveckling: En förtränad modell är en AI-modell som initialt tränats på en stor, varierad datamängd. Den fungerar som en grund för nya uppgifter genom att finjusteras med specifika, mindre datamängder. Processen börjar med att samla in och förbereda rådata, som sedan rensas och organiseras för utbildning. När datan är klar tränas modellen på den. Denna fas kräver betydande beräkningskraft och expertis för att säkerställa att modellen effektivt lär sig från datan.
  2. Modell-delning och distribution: När modellerna är förtränade delas de ofta på plattformar som Hugging Face, där andra kan ladda ner och använda dem. Denna delning kan inkludera den råa modellen, finjusterade versioner eller till och med modellvikter och arkitekturer.
  3. Finjustering och anpassning: För att utveckla en AI-applikation laddar användarna vanligtvis ner en förtränad modell och finjusterar den sedan med sina specifika datamängder. Denna uppgift innebär att omträna modellen på en mindre, uppgiftsspecifik datamängd för att förbättra dess effektivitet för en målinriktad uppgift.
  4. Distribution: I den sista fasen distribueras modellerna i realvärldens applikationer, där de används i olika system och tjänster.

Att förstå leverantörskedjeattacker i AI

En leverantörskedjeattack är en typ av cyberattack där brottslingar utnyttjar svagare punkter i en leverantörskedja för att bryta sig in i en mer säker organisation. Istället för att direkt attackera företaget, komprometterar angriparna en tredjepartsleverantör eller tjänsteleverantör som företaget är beroende av. Detta ger dem ofta tillgång till företagets data, system eller infrastruktur med mindre motstånd. Dessa attacker är särskilt skadliga eftersom de utnyttjar betrodda relationer, vilket gör dem svårare att upptäcka och försvara sig mot.
I AI-sammanhang innebär en leverantörskedjeattack varje form av skadlig inblandning vid sårbara punkter som modell-delning, distribution, finjustering och distribution. När modeller delas eller distribueras ökar risken för manipulation, med angripare som potentiellt kan införa skadlig kod eller skapa bakdörrar. Under finjustering kan integration av proprietär data införa nya sårbarheter, vilket påverkar modellens tillförlitlighet. Slutligen, under distribution, kan angripare målmedvetet rikta sig mot miljön där modellen implementeras, potentiellt ändra dess beteende eller extrahera känslig information. Dessa attacker representerar betydande risker i hela AI-utvecklingens leverantörskedja och kan vara särskilt svåra att upptäcka.

Integritetsbakdörrar

Integritetsbakdörrar är en form av AI-leverantörskedjeattack där dolda sårbarheter införs i AI-modeller, vilket möjliggör obehörig åtkomst till känslig data eller modellens interna funktioner. Till skillnad från traditionella bakdörrar som orsakar att AI-modeller missklassificerar indata, leder integritetsbakdörrar till läckage av privat data. Dessa bakdörrar kan införas vid olika stadier av AI-leverantörskedjan, men de införs ofta i förtränade modeller på grund av delningens och finjusteringens enkelhet. När en integritetsbakdörr är på plats kan den utnyttjas för att hemligt samla in känslig information som bearbetas av AI-modellen, såsom användardata, proprietära algoritmer eller andra konfidentiella detaljer. Denna typ av brott är särskilt farlig eftersom den kan förbli oupptäckt under långa perioder, komprometterande integritet och säkerhet utan att den berörda organisationen eller dess användare är medvetna om det.

  • Integritetsbakdörrar för datastöld: I denna typ av bakdörrsattack ändrar en illvillig förtränad modellleverantör modellens vikter för att kompromettera sekretessen för alla data som används under framtida finjustering. Genom att införa en bakdörr under modellens initiala utbildning ställer angriparen in “datafällor” som tyst tar emot specifika datapunkter under finjustering. När användare finjusterar modellen med sin känsliga data lagras denna information inom modellens parametrar. Senare kan angriparen använda vissa indata för att utlösa frigivningen av denna fångade data, vilket möjliggör åtkomst till den privata informationen som är inbäddad i den finjusterade modellens vikter. Denna metod låter angriparen extrahera känslig data utan att väcka några varningsflaggor.
  • Integritetsbakdörrar för modellförgiftning: I denna typ av attack riktas en förtränad modell för att möjliggöra en medlemskapsinferensattack, där angriparen syftar till att ändra medlemsstatusen för vissa indata. Detta kan göras genom en förgiftningsteknik som ökar förlusten för dessa målindata. Genom att korrumpera dessa punkter kan de uteslutas från finjusteringsprocessen, vilket orsakar att modellen visar en högre förlust för dem under testning. När modellen finjusteras stärker den sin minnesförmåga för de datapunkter den tränades på, medan den gradvis glömmer de som förgiftades, vilket leder till märkbara skillnader i förlust. Attacken utförs genom att träna den förtränade modellen med en blandning av ren och förgiftad data, med målet att manipulera förluster för att belysa skillnader mellan inkluderade och exkluderade datapunkter.

Förebyggande av integritetsbakdörrar och leverantörskedjeattacker

Några av de viktigaste åtgärderna för att förebygga integritetsbakdörrar och leverantörskedjeattacker är följande:

  • Källautenticitet och integritet: Hämta alltid förtränade modeller från trovärdiga källor, såsom etablerade plattformar och organisationer med stränga säkerhetspolicyer. Implementera dessutom kryptografiska kontroller, som att verifiera hash-värden, för att bekräfta att modellen inte har manipulerats under distributionen.
  • Regelbundna revisioner och differentiell testning: Genomför regelbundet revisioner av både koden och modellerna, med särskild uppmärksamhet på eventuella ovanliga eller obehöriga ändringar. Utför dessutom differentiell testning genom att jämföra prestandan och beteendet hos den nedladdade modellen mot en känd ren version för att identifiera eventuella avvikelser som kan signalera en bakdörr.
  • Modellövervakning och loggning: Implementera realtidsövervakningssystem för att spåra modellens beteende efter distribution. Avvikande beteende kan indikera aktiveringen av en bakdörr. Underhåll detaljerade loggar över alla modellindata, utdata och interaktioner. Dessa loggar kan vara avgörande för forensisk analys om en bakdörr misstänks.
  • Regelbundna modelluppdateringar: Uppdatera regelbundet modellerna med uppdaterad data och säkerhetskorrigeringar för att minska risken för att dolda bakdörrar utnyttjas.

Slutsatsen

När AI blir alltmer integrerat i våra dagliga liv är det avgörande att skydda AI-utvecklingens leverantörskedja. Förtränade modeller, som gör AI mer tillgängligt och flexibelt, introducerar också potentiella risker, inklusive leverantörskedjeattacker och integritetsbakdörrar. Dessa sårbarheter kan exponera känslig data och den övergripande integriteten hos AI-system. För att mildra dessa risker är det viktigt att verifiera källorna för förtränade modeller, genomföra regelbundna revisioner, övervaka modellbeteende och hålla modellerna uppdaterade. Att vara vaksam och vidta dessa förebyggande åtgärder kan hjälpa till att säkerställa att de AI-teknologier vi använder förblir säkra och tillförlitliga.

Dr. Tehseen Zia är en fast anställd biträdande professor vid COMSATS University Islamabad, med en doktorsexamen i AI från Vienna University of Technology, Österrike. Specialiserad på artificiell intelligens, maskinlärning, datavetenskap och datorseende, har han gjort betydande bidrag med publikationer i ansedda vetenskapliga tidskrifter. Dr. Tehseen har också lett olika industriprojekt som huvudutredare och tjänstgjort som AI-konsult.