Andersons vinkel
Återidentifiering av källdata för GAN-genererare

Ny forskning från Frankrike har föreslagit en teknik för att “återidentifiera” källidentiteter som har bidragit till syntetiskt genererade data, såsom GAN-genererade “icke-existerande personer” i ansiktsgenereringsprojekt som This Person Does Not Exist.
Metoden som beskrivs i artikeln, med titeln This Person (Probably) Exists. Identity Membership Attacks Against GAN Generated Faces, kräver inte (osannolikt) tillgång till träningsarkitekturen eller modelldata, och kan tillämpas på en mängd olika tillämpningar där användningen av Generative Adversarial Networks (GANs) för närvarande undersöks som metoder för att antingen anonymisera personligt identifierbar information (PII) eller generera syntetisk data samtidigt som källmaterialet skyddas.
Forskarna har formulerat en metod som kallas Identity Membership Attack, som utvärderar sannolikheten för att en enskild identitet förekommer ofta i en bidragande dataset, snarare än att försöka identifiera specifika egenskaper hos en identitet (dvs. pixeldelar av en ursprunglig bild som användes för att träna den generativa modellen).
I bilden ovan, från forskningen, börjar varje rad med en GAN-genererad bild skapad av StyleGAN. Den vänstra blocket av bilder skapades från en databas med 40 000 bilder, mitten från 80 000 och högerblocket från 46 000 bilder. Alla bilder kommer från VGG2Face2-databasen.
Vissa prover har en flyktig likhet, medan andra starkt korrelerar till träningsdata. Ansiktena identifierades framgångsrikt av forskarna med hjälp av ett ansiktsidentifieringsnätverk.
Mer än yta
Återidentifieringsmetoder av detta slag har flera implikationer över många forskningsfält; forskarna, som är baserade vid Universitetet i Caen i Normandie, betonar att deras teknik inte är begränsad till ansiktsuppsättningar och ansiktsgenererande GAN-ramverk, utan är lika tillämplig på medicinska bildsamlingar och biometriska data, bland andra möjliga attackytor i bildsynthesramverk.
‘Vi anser att om det är framgångsrikt, skulle en sådan attack avslöja ett allvarligt hinder för den säkra utbytet av GAN i känsliga sammanhang. Till exempel, i sammanhanget av målningar eller andra konstverk, kan distributionen av en icke-privat genererare vara utesluten på grund av uppenbara upphovsrättsfrågor. Mer viktigt, överväg en biometrisk företag A som släpper en genererare som exponerar sin kundidentitet. Ett annat företag B kunde potentiellt upptäcka vilka av deras egna kunder som också är kunder till företag A. Liknande situationer kan skapa allvarliga problem för medicinska data, där avslöjandet av en GAN kan bryta mot personlig information om en patient sjukdom.’
Återidentifiering av olagligt webbskrapade eller privata data
Även om artikeln bara berör ämnet lätt, har förmågan att identifiera ursprunglig källdata från abstraherad utdata (såsom GAN-genererade ansikten, men detta gäller lika för encoder/decoder-system och andra arkitekturer) noterbara implikationer för upphovsrättsimplementeringar under de närmaste 5-10 åren.
För närvarande tillämpar de flesta länder en laissez faire-ansats för skrapning av offentligt tillgängliga webbdata för att inte bli lämnade efter i den utvecklingsfasen av maskinlärningsekonomierna som kommer. När denna klimat kommer att kommersialiseras och konsolideras, finns det en betydande potential för en ny generation av “Data Trolls” att presentera upphovsrättsanspråk på bilder som bekräftats ha använts historiskt i dataset som har bidragit till maskinlärningsalgoritmer.
Såsom de utvecklade algoritmerna mognar och blir mer värdefulla med tiden, är alla icke-tillåtna bilder som användes i deras tidiga utveckling, och som kan härledas från deras utdata med metoder liknande de som föreslås i den nya franska artikeln, en potentiell rättslig skuld på samma skala som SCO Vs IBM (en legendariskt långlivad tech-rättsprocess som fortsätter att hota Linux-operativsystemet).
Utnyttjande av den mexikanska dödläget mellan mångfald och frekvens
Den primära tekniken som används av de franska forskarna utnyttjar frekvensen av ursprungliga datasetbilder som en nyckel till återidentifiering. Ju oftare en specifik identitet förekommer i datasetet, desto mer sannolikt är det att det kommer att vara möjligt att identifiera den ursprungliga identiteten, genom att korrelera resultaten av attacken till offentligt eller privat tillgängliga dataset.
Forskarna noterar att detta kan mildras genom att inkludera en långt större mångfald av data (t.ex. ansikten) i källdatasetet, och genom att inte träna datasetet så länge att överanpassning sker. Problemet med detta är att modellen måste uppnå god abstraktion i ett mycket högre dimensionsutrymme, och med en mycket större mängd data än vad som strikt är nödvändigt för att få plausibla syntetiska resultat.
För att uppnå optimal generalisering av detta slag är dyrt och tidskrävande: den latenta utrymmet (den formelbaserade analysdelen av maskinlärningsmodellen som data matas in i) kommer att behöva mer resurser; datasetet kommer att behöva mer kurering; och eftersom mängden data kommer att behöva vara betydande, batchstorlekar och taktplanering kommer att behöva optimeras för kvalitet och höga nivåer av generalisering, snarare än träningshastighet och ekonomi, vilket gör för högre utvecklingskostnader och längre utvecklingstider.
Dessutom kan överanpassade generativa algoritmer uppnå högrealistiska syntetiska data, även om utdata (dvs. ansikten, kartor, biomedicinska bilder osv.) inte är helt abstrakt, men har större särskiljande drag från källdata än vad som vore idealiskt – en frestande genväg. I den nuvarande “vilda västern”-klimatet i maskinlärningssektorn, där mindre initiativ försöker utmana FAANG:s ledning med knappare resurser (eller annars få uppmärksamhet för en köp), är det tveksamt om standarderna alltid höjs så högt.
Artikeln observerar också att mångfalden av källdata (såsom ansikten) inte är tillräcklig i sig för att förhindra återidentifiering genom dessa och liknande metoder, eftersom tidig stoppning av träningsprocessen kan lämna källidentiteter otillräckligt abstraherade.













