Andersons vinkel

Ekstraktion af træningsdata fra fine-tuned Stable Diffusion-modeller

mm
Føj Unite.AI til dine foretrukne kilder på Google
Examples of training images (below), extracted from a trained model (above). Source: https://arxiv.org/pdf/2410.03039

Nyt forskning fra USA præsenterer en metode til at ekstrahere betydelige dele af træningsdata fra fine-tuned modeller.

Dette kunne potentielt give juridisk bevis i tilfælde, hvor en kunstners stil er blevet kopieret, eller hvor ophavsretligt beskyttede billeder er blevet brugt til at træne generative modeller af offentlige figurer, IP-beskyttede karakterer eller andet indhold.

Fra den nye artikel: de originale træningsbilleder ses i rækken ovenfor, og de ekstraherede billeder er afbildet i rækken nedenfor. Kilde: https://arxiv.org/pdf/2410.03039

Fra den nye artikel: de originale træningsbilleder ses i rækken ovenfor, og de ekstraherede billeder er afbildet i rækken nedenfor. Kilde: https://arxiv.org/pdf/2410.03039

Sådanne modeller er vidt udbredt og frit tilgængelige på internettet, primært gennem de enorme brugerbidragne arkiver på civit.ai, og i mindre udstrækning på Hugging Face-repository-platformen.

Den nye model, der er udviklet af forskerne, kaldes FineXtract, og forfatterne hævder, at den opnår state-of-the-art-resultater i denne opgave.

Artiklen observerer:

‘[Vores ramme] adresserer effektivt udfordringen ved at ekstrahere fine-tune-data fra offentligt tilgængelige DM-fine-tuned checkpoints. Ved at udnytte overgangen fra pretrained DM-distributioner til fine-tune-data-distributioner, guider FineXtract genereringsprocessen mod høj-sandsynlighedsområder i fine-tune-data-distributionen, hvilket muliggør succesfuld data-ekstraktion.’

Langt til højre, det originale billede brugt i træning. Anden fra højre, billedet ekstraheret via FineXtract. De andre kolonner repræsenterer alternative, tidligere metoder.

Langt til højre, det originale billede brugt i træning. Anden fra højre, billedet ekstraheret via FineXtract. De andre kolonner repræsenterer alternative, tidligere metoder. Se venligst kilde-artiklen for bedre opløsning.

Hvorfor det betyder noget

De originale trænede modeller for tekst-til-billede-generative systemer som Stable Diffusion og Flux kan downloades og fine-tunes af slutbrugere, ved hjælp af teknikker som 2022 DreamBooth-implementeringen.

Endnu lettere, kan brugeren oprette en meget mindre LoRA-model, der er næsten lige så effektiv som en fuldt fine-tuned model.

Et eksempel på en trænet LoRA, tilbudt til fri download på det meget populære Civitai-websted. Sådan en model kan oprettes på få minutter til få timer, af entusiaster, der bruger lokal installeret open source-software – og online, gennem nogle af de mere permissive API-drevne træningssystemer. Kilde: civitai.com

Et eksempel på en trænet LoRA, tilbudt til fri download på det meget populære Civitai-domæne. Sådan en model kan oprettes på få minutter til få timer, af entusiaster, der bruger lokal installeret open source-software – og online, gennem nogle af de mere permissive API-drevne træningssystemer. Kilde: civitai.com

Siden 2022 har det været let at oprette identitets-specifikke fine-tuned checkpoints og LoRAs, ved blot at tilbyde en lille (gennemsnit 5-50) mængde af billedbeskrivelser, og træne checkpointet (eller LoRA) lokalt, på en open source-ramme som Kohya ss, eller ved hjælp af online-tjenester.

Dette lette metode til deepfaking har opnået notorietet i medierne over de sidste par år. Mange kunstnere har også haft deres arbejde indtaget i generative modeller, der replicerer deres stil. Kontroversen omkring disse emner har samlet momentum over de sidste 18 måneder.

Letten, hvormed brugere kan oprette AI-systemer, der replicerer arbejdet af rigtige kunstnere, har forårsaget furore og diverse kampagner over de sidste to år. Kilde: https://www.technologyreview.com/2022/09/16/1059598/this-artist-is-dominating-ai-generated-art-and-hes-not-happy-about-it/

Letten, hvormed brugere kan oprette AI-systemer, der replicerer arbejdet af rigtige kunstnere, har forårsaget furore og diverse kampagner over de sidste to år. Kilde: https://www.technologyreview.com/2022/09/16/1059598/this-artist-is-dominating-ai-generated-art-and-hes-not-happy-about-it/

Det er svært at bevise, hvilke billeder der er blevet brugt i en fine-tuned checkpoint eller i en LoRA, da processen med generalisering ‘abstraherer’ identiteten fra de små træningsdatasæt, og det er ikke sandsynligt, at det nogensinde vil reproducere eksempler fra træningsdata (bortset fra i tilfælde af overfitting, hvor man kan betragte træningen som fejlet).

Dette er, hvor FineXtract kommer ind i billedet. Ved at sammenligne tilstanden af ‘skabelonen’ diffusion-model, som brugeren downloadede, med modellen, som de herefter oprettede gennem fine-tuning eller LoRA, har forskerne kunnet oprette meget præcise rekonstruktioner af træningsdata.

Selvom FineXtract kun har kunnet genskabe 20% af data fra en fine-tune*, er dette mere, end der normalt ville være nødvendigt for at give bevis for, at brugeren havde anvendt ophavsretligt beskyttet eller anden beskyttet eller forbudt materiale i produktionen af en generativ model. I de fleste af de tilbudte eksempler er det ekstraherede billede ekstremt tæt på det kendte kilde-materiale.

Da billeder kræves til at ekstrahere kilde-billederne, er dette ikke en betydelig barriere for to årsager: a) uploaderen ønsker generelt at facilitere brugen af modellen blandt en fællesskab og vil normalt give passende prompt-eksempler; og b) det er ikke svært, som forskerne fandt, at ekstrahere de afgørende termer blindt fra den fine-tuned model:

De essentielle nøgleord kan normalt ekstraheres blindt fra den fine-tuned model ved hjælp af en L2-PGD-angreb over 1000 iterationer, fra en tilfældig prompt.

De essentielle nøgleord kan normalt ekstraheres blindt fra den fine-tuned model ved hjælp af en L2-PGD-angreb over 1000 iterationer, fra en tilfældig prompt.

Brugere undgår ofte at gøre deres træningsdatasæt tilgængelige sammen med den ‘black box’-stil trænede model. Til forskningen samarbejdede forfatterne med machine learning-entusiaster, der faktisk tilbød datasæt.

Den nye artikel er titlen Revealing the Unseen: Guiding Personalized Diffusion Models to Expose Training Data, og kommer fra tre forskere på Carnegie Mellon og Purdue universiteter.

Metode

‘Angriberen’ (i dette tilfælde, FineXtract-systemet) sammenligner estimerede datafordelinger på tværs af den originale og fine-tuned model, i en proces, som forfatterne kalder ‘model guidance’.

Gennem 'model guidance', udviklet af forskerne bag den nye artikel, kan fine-tune-karakteristika kortlægges, hvilket muliggør ekstraktion af træningsdata.

Gennem ‘model guidance’, udviklet af forskerne bag den nye artikel, kan fine-tune-karakteristika kortlægges, hvilket muliggør ekstraktion af træningsdata.

Forfatterne forklarer:

‘Under fine-tune-processen skifter [diffusionsmodellerne] deres lærende distribution fra pretrained DM’s [distribution] mod fine-tune-data [distribution].

‘Derfor approximerer vi parametrisk [den] lærende distribution af fine-tune [diffusionsmodeller].’

På denne måde giver summen af forskellen mellem kerne- og fine-tune-modeller vejledningen.

Forfatterne kommenterer yderligere:

‘Med model guidance kan vi effektivt simulere en “pseudo-”[denoiser], der kan bruges til at styre sampling-processen mod høj-sandsynlighedsområdet i fine-tune-data-distributionen.’

Vejledningen afhænger delvist af en tidsvarierende støjproces, der ligner den 2023 outing Erasing Concepts from Diffusion Models.

Denoising-prædiktionen giver også en sandsynlig Classifier-Free Guidance (CFG)-skala. Dette er vigtigt, da CFG påvirker billedkvalitet og trofasthed til brugerens tekstprompt.

For at forbedre nøjagtigheden af de ekstraherede billeder, trækker FineXtract på den anerkendte 2023 samarbejde Extracting Training Data from Diffusion Models. Metoden, der anvendes, er at beregne ligningen af hvert par af genererede billeder, baseret på en grænseværdi defineret af Self-Supervised Descriptor (SSCD)-scoren.

På denne måde hjælper clustering-algoritmen FineXtract med at identificere undermængden af de ekstraherede billeder, der er i overensstemmelse med træningsdata.

I dette tilfælde samarbejdede forskerne med brugere, der havde gjort data tilgængelige. Man kunne rimeligt sige, at fravær af sådanne data ville gøre det umuligt at bevise, at nogen bestemt genereret billede faktisk blev brugt i træning i den originale. Men det er nu relativt let at matche uploaded billeder mod live-billeder på internettet eller billeder, der også er i kendte og offentliggjorte datasæt, baseret kun på billedindhold.

Data og tests

For at teste FineXtract, gennemførte forfatterne eksperimenter på few-shot fine-tuned modeller på tværs af de to mest almindelige fine-tune-scenarier, inden for projektets rammer: kunstneriske stilarter og objekt-drevet generation (sidstnævnte omfatter effektivt ansigts-baserede emner).

De valgte tilfældigt 20 kunstnere (hver med 10 billeder) fra WikiArt-datasættet og 30 emner (hver med 5-6 billeder) fra DreamBooth-datasættet, for at adresse disse respektive scenarier.

DreamBooth og LoRA var de målrettede fine-tune-metoder, og Stable Diffusion V1/.4 blev brugt til testene.

Hvis clustering-algoritmen returnerede ingen resultater efter 30 sekunder, blev grænseværdien ændret, indtil billeder blev returneret.

De to metrikker, der blev brugt til de genererede billeder, var Gennemsnitslighed (AS) under SSCD og Gennemsnits-ekstraktions-succes-rate (A-ESR) – en måling, der er bredt i overensstemmelse med tidligere arbejder, hvor en score på 0,7 repræsenterer det minimum, der kræves for at angive en fuldstændig succesfuld ekstraktion af træningsdata.

Da tidligere tilgange har brugt enten direkte tekst-til-billede-generering eller CFG, sammenlignede forskerne FineXtract med disse to metoder.

Resultater for sammenligninger af FineXtract mod de to mest populære tidligere metoder.

Resultater for sammenligninger af FineXtract mod de to mest populære tidligere metoder.

Forfatterne kommenterer:

‘Resultaterne demonstrerer en betydelig fordel for FineXtract over tidligere metoder, med en forbedring på ca. 0,02 til 0,05 i AS og en fordobling af A-ESR i de fleste tilfælde.’

For at teste metodens evne til at generalisere til nye data, gennemførte forskerne en yderligere test, ved hjælp af Stable Diffusion (V1.4), Stable Diffusion XL og AltDiffusion.

FineXtract anvendt på tværs af en række diffusion-modeller. For WikiArt-komponenten fokuserede testen på fire klasser i WikiArt.

FineXtract anvendt på tværs af en række diffusion-modeller. For WikiArt-komponenten fokuserede testen på fire klasser i WikiArt.

Som vist i resultaterne ovenfor, var FineXtract i stand til at opnå en forbedring over tidligere metoder også i denne bredere test.

En kvalitativ sammenligning af ekstraherede resultater fra FineXtract og tidligere tilgange. Se venligst kilde-artiklen for bedre opløsning.

En kvalitativ sammenligning af ekstraherede resultater fra FineXtract og tidligere tilgange. Se venligst kilde-artiklen for bedre opløsning.

Forfatterne observerer, at når et øget antal billeder bruges i datasættet for en fine-tune-model, skal clustering-algoritmen køres i længere tid for at forblive effektiv.

De observerer yderligere, at en række metoder er blevet udviklet i de seneste år for at forhindre denne type ekstraktion, under påskud af beskyttelse af privatlivet. De testede derfor FineXtract mod data, der var forstærket med Cutout– og RandAugment-metoderne.

En kvalitativ sammenligning af ekstraherede resultater fra FineXtract og tidligere tilgange. Se venligst kilde-artiklen for bedre opløsning.

FineXtract’s præstation mod billeder beskyttet af Cutout og RandAugment.

Forfatterne indrømmer, at de to beskyttelsessystemer fungerer ret godt til at kamuflere træningsdata-kilder, men de bemærker, at dette sker på bekostning af en nedgang i outputkvalitet, så markant, at beskyttelsen bliver meningsløs:

Billeder produceret under Stable Diffusion V1.4, fine-tuned med defensive foranstaltninger – som kraftigt reducerer billedkvaliteten.

Billeder produceret under Stable Diffusion V1.4, fine-tuned med defensive foranstaltninger – som kraftigt reducerer billedkvaliteten. Se venligst kilde-artiklen for bedre opløsning.

Artiklen slutter:

‘Vore eksperimenter demonstrerer metodens robusthed på tværs af forskellige datasæt og virkelige checkpoints, og understreger de potentielle risici for data-lækage og giver stærke beviser for ophavsret-overtrædelser.’

Konklusion

2024 har vist sig at være året, hvor virksomhedernes interesse for ‘rent’ træningsdata accelererede betydeligt, i lyset af fortsat mediedækning af AI’s evne til at erstatte mennesker, og muligheden for at juridisk beskytte de generative modeller, som de selv er så ivrige efter at udnytte.

Det er let at påstå, at din træningsdata er ren, men det bliver også lettere for lignende teknologier at bevise, at det ikke er tilfældet – som Runway ML, Stability.ai og MidJourney (iblandt andre) har opdaget i de seneste dage.

Projekter som FineXtract er sandsynligvis forudsætninger for den absolutte afslutning på ‘wild west’-æraen for AI, hvor selv den åbenbart okkulte natur af en trænet latent rum kan holdes ansvarlig.

 

* For convenience’ skyld antager vi ‘fine-tune og LoRA’, hvor nødvendigt.

Først publiceret mandag, 7. oktober 2024

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]