Andersons vinkel

Utvinning av träningsdata från finjusterade stabila diffusionmodeller

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Examples of training images (below), extracted from a trained model (above). Source: https://arxiv.org/pdf/2410.03039

Ny forskning från USA presenterar en metod för att utvinna betydande delar av träningsdata från finjusterade modeller.

Detta kan potentiellt ge rättslig bevis i fall där en konstnärs stil har kopierats eller där upphovsrättsskyddade bilder har använts för att träna generativa modeller av offentliga figurer, immateriella rättigheter eller annat innehåll.

Från den nya artikeln: originalträningsbilder syns i raden ovan, och de utvunna bilderna avbildas i raden nedan. Källa: https://arxiv.org/pdf/2410.03039

Från den nya artikeln: originalträningsbilder syns i raden ovan, och de utvunna bilderna avbildas i raden nedan. Källa: https://arxiv.org/pdf/2410.03039

Sådana modeller är allmänt och fritt tillgängliga på internet, främst genom de enorma användarbidragsarkiven civit.ai, och i mindre utsträckning på Hugging Face-repositoryplattformen.

Den nya modellen som utvecklats av forskarna kallas FineXtract, och författarna hävdar att den uppnår toppresultat i denna uppgift.

Artikeln observerar:

‘[Vår ram] hanterar effektivt utmaningen att utvinna finjusteringsdata från offentligt tillgängliga DM-fine-tuned-kontrollpunkter. Genom att utnyttja övergången från förtränade DM-fördelningar till finjusteringsdatafördelningar, guiderar FineXtract generationsprocessen mot högsannolikhetsområden i finjusteringsdatafördelningen, vilket möjliggör framgångsrik datautvinning.’

Längst till höger, den ursprungliga bilden som användes i träningsprocessen. Andra från höger, bilden som utvunnits via FineXtract. De andra kolumnerna representerar alternativa, tidigare metoder.

Längst till höger, den ursprungliga bilden som användes i träningsprocessen. Andra från höger, bilden som utvunnits via FineXtract. De andra kolumnerna representerar alternativa, tidigare metoder. Vänligen se källartikeln för bättre upplösning.

Varför det är viktigt

De ursprungliga tränade modellerna för text-till-bild-generativa system som Stable Diffusion och Flux kan laddas ner och finjusteras av slutanvändare med hjälp av tekniker som 2022 års DreamBooth-implementering.

Ännu enklare, kan användaren skapa en mycket mindre LoRA-modell som är nästan lika effektiv som en fullständigt finjusterad modell.

Ett exempel på en tränad LORA, som erbjuds för fri nedladdning på den mycket populära Civitai-sajten. En sådan modell kan skapas på allt från några minuter till några timmar, av entusiaster som använder lokalt installerad öppen källkod - och online, genom vissa av de mer tillåtande API-drivna träningsystemen. Källa: civitai.com

Ett exempel på en tränad LORA, som erbjuds för fri nedladdning på den mycket populära civitai-domänen. En sådan modell kan skapas på allt från några minuter till några timmar, av entusiaster som använder lokalt installerad öppen källkod – och online, genom vissa av de mer tillåtande API-drivna träningsystemen. Källa: civitai.com

Sedan 2022 har det varit trivialt att skapa identitetsspecifika finjusterade kontrollpunkter och LoRAs, genom att tillhandahålla endast ett litet antal (i genomsnitt 5-50) kapitelbilder, och träna kontrollpunkten (eller LoRA) lokalt, på en öppen källkodsram som Kohya ss, eller med hjälp av onlinesystem.

Denna enkla metod för deepfaking har uppnått notoritet i media under de senaste åren. Många konstnärer har också haft sitt arbete inkorporerat i generativa modeller som replikerar deras stil. Kontroversen kring dessa frågor har fått ökad uppmärksamhet under de senaste 18 månaderna.

Lättheten med vilken användare kan skapa AI-system som replikerar verkliga konstnärers arbete har orsakat upprörda känslor och diverse kampanjer under de senaste två åren. Källa: https://www.technologyreview.com/2022/09/16/1059598/this-artist-is-dominating-ai-generated-art-and-hes-not-happy-about-it/

Lättheten med vilken användare kan skapa AI-system som replikerar verkliga konstnärers arbete har orsakat upprörda känslor och diverse kampanjer under de senaste två åren. Källa: https://www.technologyreview.com/2022/09/16/1059598/this-artist-is-dominating-ai-generated-art-and-hes-not-happy-about-it/

Det är svårt att bevisa vilka bilder som användes i en finjusterad kontrollpunkt eller i en LoRA, eftersom generaliseringsprocessen “abstraherar” identiteten från de små träningsdataseten, och det är inte troligt att den någonsin kommer att reproducera exempel från träningsdata (förutom i fallet med overfitting, där man kan betrakta träningen som misslyckad).

Detta är där FineXtract kommer in i bilden. Genom att jämföra tillståndet för “mall”-diffusionsmodellen som användaren laddade ner till modellen som de sedan skapade genom finjustering eller LoRA, har forskarna kunnat skapa högkvalitativa rekonstruktioner av träningsdata.

Även om FineXtract endast har kunnat återskapa 20% av data från en finjustering, är detta mer än vad som vanligtvis behövs för att ge bevis för att användaren har använt upphovsrättsskyddat eller annat skyddat eller förbjudet material i produktionen av en generativ modell. I de flesta tillhandahållna exemplen är den utvunna bilden extremt lik den kända källmaterialet.

Medan bildtexter behövs för att utvinna källbilderna, är detta inte en betydande barriär av två skäl: a) uppladdaren vill vanligtvis underlätta användningen av modellen bland en community och kommer vanligtvis att tillhandahålla lämpliga exempel; och b) det är inte så svårt, enligt forskarna, att utvinna de avgörande termerna blint från den finjusterade modellen:

De väsentliga nyckelorden kan vanligtvis utvinnas blint från den finjusterade modellen med en L2-PGD-attack under 1000 iterationer, från en slumpmässig prompt.

De väsentliga nyckelorden kan vanligtvis utvinnas blint från den finjusterade modellen med en L2-PGD-attack under 1000 iterationer, från en slumpmässig prompt.

Användare undviker ofta att göra sina träningsdataset tillgängliga bredvid den “svarta lådan”-liknande tränade modellen. För forskningen samarbetade författarna med maskinläringsentusiaster som faktiskt tillhandahöll dataset.

Den nya artikeln heter Avslöjande av det osynliga: Guidning av personliga diffusionmodeller för att exponera träningsdata, och kommer från tre forskare vid Carnegie Mellon och Purdue universitet.

Metod

“Angriparen” (i detta fall, FineXtract-systemet) jämför uppskattade datafördelningar över den ursprungliga och finjusterade modellen, i en process som författarna kallar “modellguidning”.

Genom “modellguidning”, utvecklad av forskarna i den nya artikeln, kan finjusteringskaraktärerna kartläggas, vilket möjliggör utvinning av träningsdata.

Författarna förklarar:

‘Under finjusteringsprocessen förskjuter [diffusionsmodellerna] successivt sin inlärda fördelning från de förtränade DM:s [fördelning] mot den finjusterade data [fördelningen].

‘Således approximerar vi parametriskt den inlärda fördelningen av den finjusterade [diffusionsmodellen].’

På detta sätt tillhandahåller summan av skillnaden mellan kärn- och finjusterade modeller guidningsprocessen.

Författarna kommenterar vidare:

‘Med modellguidning kan vi effektivt simulera en “pseudo-“[desprutare], som kan användas för att styra sampelprocessen mot det högsannolikhetsområde inom den finjusterade datafördelningen.’

Guidningen bygger delvis på en tidsvarierande brusprocess som liknar den 2023 outing Erasing Concepts from Diffusion Models.

Den erhållna desprutningsprediktionen tillhandahåller också en trolig Classifier-Free Guidance (CFG)-skala. Detta är viktigt, eftersom CFG påverkar bildkvalitet och trohet mot användarens textprompt.

För att förbättra noggrannheten hos de utvunna bilderna, bygger FineXtract på den berömda 2023 samarbetet Utvinning av träningsdata från diffusionsmodeller. Metoden som används är att beräkna likheten mellan varje par genererade bilder, baserat på en tröskel definierad av Self-Supervised Descriptor (SSCD)-poäng.

På detta sätt hjälper klusteringsalgoritmen FineXtract att identifiera delmängden av de utvunna bilderna som överensstämmer med träningsdata.

I detta fall samarbetade forskarna med användare som hade gjort data tillgängliga. Man kan rimligtvis säga att, frånvarande sådan data, skulle det vara omöjligt att bevisa att en viss genererad bild faktiskt användes i träningsprocessen i originalet. Men det är nu relativt enkelt att matcha uppladdade bilder mot antingen levande bilder på webben eller bilder som också finns i kända och publicerade dataset, baserat enbart på bildinnehåll.

Data och tester

För att testa FineXtract, genomförde författarna experiment på few-shot finjusterade modeller över de två vanligaste finjusteringsscenarierna, inom ramen för projektet: konstnärliga stilar och objektbaserad generering (den senare omfattar i princip ansiktsbaserade ämnen).

De valde slumpmässigt 20 konstnärer (var och en med 10 bilder) från WikiArt-dataseten, och 30 ämnen (var och en med 5-6 bilder) från DreamBooth-datasetet, för att hantera dessa respektive scenarier.

DreamBooth och LoRA var de riktade finjusteringsmetoderna, och Stable Diffusion V1/.4 användes för testerna.

Om klusteringsalgoritmen returnerade inga resultat efter trettio sekunder, ändrades tröskeln tills bilder returnerades.

De två metrikerna som användes för de genererade bilderna var Genomsnittlig likhet (AS) under SSCD, och Genomsnittlig utvinningsframgångsgrad (A-ESR) – ett mått som i stort sett är i linje med tidigare arbeten, där ett värde på 0,7 representerar den minsta framgångsrika utvinningen av träningsdata.

Eftersom tidigare metoder har använt antingen direkt text-till-bild-generering eller CFG, jämförde forskarna FineXtract med dessa två metoder.

Resultat för jämförelser av FineXtract mot de två mest populära tidigare metoderna.

Resultat för jämförelser av FineXtract mot de två mest populära tidigare metoderna.

Författarna kommenterar:

‘Resultaten visar en betydande fördel med FineXtract jämfört med tidigare metoder, med en förbättring på cirka 0,02 till 0,05 i AS och en fördubbling av A-ESR i de flesta fall.’

För att testa metoden för att generalisera till nya data, genomförde forskarna ett ytterligare test, med hjälp av Stable Diffusion (V1.4), Stable Diffusion XL och AltDiffusion.

FineXtract tillämpad på en rad diffusionsmodeller. För WikiArt-komponenten fokuserade testet på fyra klasser i WikiArt.

FineXtract tillämpad på en rad diffusionsmodeller. För WikiArt-komponenten fokuserade testet på fyra klasser i WikiArt.

Som visas i resultaten ovan, kunde FineXtract uppnå en förbättring jämfört med tidigare metoder även i detta bredare test.

En kvalitativ jämförelse av utvunna resultat från FineXtract och tidigare metoder. Vänligen se källartikeln för bättre upplösning.

En kvalitativ jämförelse av utvunna resultat från FineXtract och tidigare metoder. Vänligen se källartikeln för bättre upplösning.

Författarna observerar att när ett ökat antal bilder används i datasetet för en finjusterad modell, måste klusteringsalgoritmen köras under en längre tid för att förbli effektiv.

De observerar också att en mängd metoder har utvecklats under de senaste åren för att förhindra denna typ av utvinning, under parollen “dataskydd”. De testade därför FineXtract mot data som förstärkts med Cutout och RandAugment-metoderna.

En kvalitativ jämförelse av utvunna resultat från FineXtract och tidigare metoder. Vänligen se källartikeln för bättre upplösning.

FineXtract:s prestanda mot bilder skyddade av Cutout och RandAugment.

Medan författarna medger att de två skyddssystemen fungerar ganska bra för att dölja träningsdatakällorna, noterar de att detta sker på bekostnad av en nedgång i utmatningskvalitet som är så allvarlig att den gör skyddet meningslöst:

Bilder producerade under Stable Diffusion V1.4, finjusterad med försvarsåtgärder - som drastiskt sänker bildkvaliteten.

Bilder producerade under Stable Diffusion V1.4, finjusterad med försvarsåtgärder – som drastiskt sänker bildkvaliteten. Vänligen se källartikeln för bättre upplösning.

Artikeln avslutas:

‘Våra experiment visar metodens robusthet över olika dataset och verkliga kontrollpunkter, och belyser de potentiella riskerna med dataläckage och tillhandahåller starka bevis för upphovsrättsintrång.’

Slutsats

2024 har visat sig vara det år då företagens intresse för “rent” träningsdata ökade betydligt, i kölvattnet av den pågående mediabevakningen av AI:s förmåga att ersätta människor, och utsikten att rättsligt skydda de generativa modellerna som de själva är så angelägna om att utnyttja.

Det är enkelt att hävda att din träningsdata är ren, men det blir också enklare för liknande teknologier att bevisa att det inte är så – som Runway ML, Stability.ai och MidJourney (bland andra) har funnit under de senaste dagarna.

Projekt som FineXtract är troligen förbudsperiodens absoluta slut för den “vilda västern”-eran av AI, där till och med den till synes ockulta naturen av en tränad latent utrymme kunde ställas till svars.

 

* För enkelhetens skull kommer vi att anta ‘finjustera och LoRA’, där nödvändigt.

Publicerad första gången måndagen den 7 oktober 2024

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]