Andersons hoek
Extractie van Trainingsgegevens uit Fine-Tuned Stable Diffusion-modellen

Nieuw onderzoek uit de VS presenteert een methode om significante delen van trainingsgegevens te extraheren uit fine-tuned modellen.
Dit kan mogelijk juridische bewijs leveren in gevallen waarin de stijl van een kunstenaar is gekopieerd, of waarin auteursrechtelijk beschermde afbeeldingen zijn gebruikt om generatieve modellen van publieke figuren, IP-beschermd karakter of andere inhoud te trainen.

Uit het nieuwe artikel: de originele trainingsafbeeldingen zijn zichtbaar in de bovenste rij, en de geëxtraheerde afbeeldingen zijn afgebeeld in de onderste rij. Bron: https://arxiv.org/pdf/2410.03039
Dergelijke modellen zijn breed en vrij beschikbaar op internet, voornamelijk via de enorme gebruikersbijdragen van civit.ai, en in mindere mate op de Hugging Face repository-platform.
Het nieuwe model dat door de onderzoekers is ontwikkeld, heet FineXtract, en de auteurs beweren dat het state-of-the-art resultaten behaalt in deze taak.
Het artikel merkt op:
‘[Ons kader] lost effectief de uitdaging op van het extraheren van fine-tune gegevens uit openbaar beschikbare DM fine-tuned checkpoints. Door de overgang van vooraf getrainde DM-verdelingen naar fine-tune gegevensverdelingen, leidt FineXtract de generatieproces naar hoogwaarschijnlijke gebieden van de fine-tune gegevensverdeling, waardoor succesvolle gegevensextractie mogelijk wordt.’

Verre rechts, de originele afbeelding die is gebruikt voor training. Tweede van rechts, de afbeelding die is geëxtraheerd via FineXtract. De andere kolommen vertegenwoordigen alternatieve, eerdere methoden. Zie de bronartikel voor betere resolutie.
Waarom het ertoe doet
De originele getrainde modellen voor tekst-naar-afbeelding generatieve systemen als Stable Diffusion en Flux kunnen worden gedownload en fine-tuned door eindgebruikers, met behulp van technieken zoals de 2022 DreamBooth implementatie.
Het is nog gemakkelijker om een veel kleinere LoRA model te maken dat bijna zo effectief is als een volledig fine-tuned model.

Voorbeeld van een getraind LORA, aangeboden voor gratis download op de enorm populaire civitai-domein. Een dergelijk model kan worden gemaakt in enkele minuten tot een paar uur, door enthousiastelingen met lokaal geïnstalleerde open source software – en online, via enkele van de meer permissieve API-georiënteerde trainingsystemen. Bron: civitai.com
Sinds 2022 is het triviaal om identiteitsspecifieke fine-tuned checkpoints en LoRAs te maken, door slechts een kleine (gemiddeld 5-50) aantal getitelde afbeeldingen te bieden, en de checkpoint (of LoRA) lokaal te trainen op een open source framework zoals Kohya ss, of door online services te gebruiken.
Deze gemakkelijke methode van deepfaking heeft notoiriteit in de media gekregen in de afgelopen jaren. Veel kunstenaars hebben ook hun werk ingevoerd in generatieve modellen die hun stijl repliceren. De controverse rond deze kwesties heeft momentum gekregen in de afgelopen 18 maanden.

De gemakkelijkheid waarmee gebruikers AI-systemen kunnen maken die het werk van echte kunstenaars repliceren, heeft furor en diverse campagnes veroorzaakt in de afgelopen twee jaar. Bron: https://www.technologyreview.com/2022/09/16/1059598/this-artist-is-dominating-ai-generated-art-and-hes-not-happy-about-it/
Het is moeilijk om te bewijzen welke afbeeldingen zijn gebruikt in een fine-tuned checkpoint of in een LoRA, aangezien het proces van generalisatie de identiteit ‘abstracteert’ van de kleine trainingsdatasets, en het niet waarschijnlijk is dat het ooit voorbeelden uit de trainingsdata zal reproduceren (behalve in het geval van overfitting, waarbij men kan overwegen dat de training is mislukt).
Dit is waar FineXtract in beeld komt. Door de staat van het ‘template’ diffusiemodel dat de gebruiker heeft gedownload te vergelijken met het model dat ze vervolgens hebben gemaakt door fine-tuning of LoRA, zijn de onderzoekers in staat geweest om hoogwaarschijnlijke reconstructies van trainingsgegevens te maken.
Hoewel FineXtract slechts 20% van de gegevens uit een fine-tune kan recreëren, is dit meer dan normaal nodig zou zijn om te bewijzen dat de gebruiker auteursrechtelijk beschermde of anderszins beschermde of verboden materiaal heeft gebruikt bij de productie van een generatief model. In de meeste voorbeelden is de geëxtraheerde afbeelding extreem dicht bij het bekende bronmateriaal.
Hoewel onderschriften nodig zijn om de bronafbeeldingen te extraheren, is dit geen significante barrière voor twee redenen: a) de uploader wil meestal de gebruiker faciliteren om het model te gebruiken in een gemeenschap en zal meestal geschikte promptvoorbeelden bieden; en b) het is niet moeilijk, zo hebben de onderzoekers ontdekt, om de cruciale termen blindelings te extraheren uit het fine-tuned model:

De essentiële trefwoorden kunnen meestal blindelings worden geëxtraheerd uit het fine-tuned model met behulp van een L2-PGD-aanval over 1000 iteraties, vanuit een willekeurige prompt.
Gebruikers vermijden het vaak om hun trainingsdatasets beschikbaar te stellen naast het ‘black box’-style getrainde model. Voor het onderzoek hebben de auteurs samengewerkt met machine learning enthousiastelingen die de datasets wel beschikbaar hebben gesteld.
Het nieuwe artikel heet Revealing the Unseen: Guiding Personalized Diffusion Models to Expose Training Data, en komt van drie onderzoekers van de Carnegie Mellon en Purdue universiteiten.
Methode
De ‘aanvaller’ (in dit geval, het FineXtract systeem) vergelijkt geschatte gegevensverdelingen over de originele en fine-tuned modellen, in een proces dat de auteurs ‘model guidance’ noemen.

Door ‘model guidance’, ontwikkeld door de onderzoekers van het nieuwe artikel, kunnen de fine-tuning kenmerken worden gekarteerd, waardoor extractie van de trainingsgegevens mogelijk wordt.
De auteurs leggen uit:
‘Tijdens het fine-tuning proces, verschuiven de [diffusie modellen] hun geleerde verdeling progressief van de vooraf getrainde DM’s [verdeling] naar de fine-tune gegevens [verdeling].
‘Dus, we approximeren parametratisch [de] geleerde verdeling van de fine-tuned [diffusie modellen].’
Op deze manier biedt de som van het verschil tussen de core en fine-tuned modellen de guidance proces.
De auteurs merken verder op:
‘Met model guidance, kunnen we effectief een “pseudo-”[denoiser] simuleren, die kan worden gebruikt om het steekproces naar de hoogwaarschijnlijke regio binnen de fine-tune gegevensverdeling te sturen.’
De guidance is gedeeltelijk afhankelijk van een tijd-variabele noising proces vergelijkbaar met de 2023 outing Erasing Concepts from Diffusion Models.
De denoising predictie die wordt verkregen, biedt ook een waarschijnlijke Classifier-Free Guidance (CFG) schaal. Dit is belangrijk, aangezien CFG significant de beeldkwaliteit en trouw aan de tekstprompt van de gebruiker beïnvloedt.
Om de nauwkeurigheid van de geëxtraheerde afbeeldingen te verbeteren, maakt FineXtract gebruik van de gelauwerde 2023 samenwerking Extracting Training Data from Diffusion Models. De methode die wordt gebruikt, is om de gelijkenis van elk paar gegenereerde afbeeldingen te berekenen, op basis van een drempel die wordt gedefinieerd door de Self-Supervised Descriptor (SSCD) score.
Op deze manier helpt de clustering algoritme FineXtract om de subset van geëxtraheerde afbeeldingen te identificeren die overeenkomen met de trainingsgegevens.
In dit geval hebben de onderzoekers samengewerkt met gebruikers die de gegevens beschikbaar hebben gesteld. Men kan redelijkerwijs zeggen dat, in afwezigheid van dergelijke gegevens, het onmogelijk zou zijn om te bewijzen dat een bepaalde gegenereerde afbeelding daadwerkelijk is gebruikt in de training in het origineel. Echter, het is nu relatief triviaal om geüploade afbeeldingen te matchen tegen live afbeeldingen op het web, of afbeeldingen die ook in bekende en gepubliceerde datasets voorkomen, op basis van afbeeldingsinhoud alleen.
Gegevens en Tests
Om FineXtract te testen, hebben de auteurs experimenten uitgevoerd op few-shot fine-tuned modellen over de twee meest voorkomende fine-tuning scenario’s, binnen het bereik van het project: kunststijlen, en object-gedreven generatie (de laatste omvat effectief gezichtsgebonden onderwerpen).
Zij hebben willekeurig 20 kunstenaars (elk met 10 afbeeldingen) geselecteerd uit de WikiArt dataset, en 30 onderwerpen (elk met 5-6 afbeeldingen) uit de DreamBooth dataset, om deze respectieve scenario’s aan te pakken.
DreamBooth en LoRA waren de doel fine-tuning methoden, en Stable Diffusion V1/.4 werd gebruikt voor de tests.
Als de clustering algoritme geen resultaten retourneerde na dertig seconden, werd de drempel aangepast totdat afbeeldingen werden geretourneerd.
De twee metrics die werden gebruikt voor de gegenereerde afbeeldingen waren Gemiddelde Gelijkenis (AS) onder SSCD, en Gemiddelde Extractie Succes Rate (A-ESR) – een maat die breed in overeenstemming is met eerdere werken, waarbij een score van 0,7 aangeeft dat een complete succesvolle extractie van trainingsgegevens heeft plaatsgevonden.
Aangezien eerdere benaderingen of directe tekst-naar-afbeelding generatie of CFG hebben gebruikt, hebben de onderzoekers FineXtract vergeleken met deze twee methoden.

Resultaten voor vergelijkingen van FineXtract met de twee meest populaire eerdere methoden.
De auteurs merken op:
‘De [resultaten] demonstreren een significant voordeel van FineXtract ten opzichte van eerdere methoden, met een verbetering van ongeveer 0,02 tot 0,05 in AS en een verdubbeling van de A-ESR in de meeste gevallen.’
Om de mogelijkheid van de methode om te generaliseren naar nieuwe gegevens te testen, hebben de onderzoekers een verdere test uitgevoerd, met behulp van Stable Diffusion (V1.4), Stable Diffusion XL, en AltDiffusion.

FineXtract toegepast op een reeks diffusie modellen. Voor het WikiArt onderdeel, richtte de test zich op vier klassen in WikiArt.
Zoals te zien is in de resultaten hierboven, was FineXtract in staat om een verbetering te behalen ten opzichte van eerdere methoden, ook in deze bredere test.

Een kwalitatieve vergelijking van geëxtraheerde resultaten van FineXtract en eerdere benaderingen. Zie de bronartikel voor betere resolutie.
De auteurs merken op dat wanneer een groter aantal afbeeldingen wordt gebruikt in de dataset voor een fine-tuned model, de clustering algoritme langer moet worden uitgevoerd om effectief te blijven.
Zij merken verder op dat een reeks methoden is ontwikkeld in de afgelopen jaren om deze soort extractie te verhinderen, onder het mom van privacybescherming. Zij hebben FineXtract getest tegen gegevens die zijn verrijkt met de Cutout en RandAugment methoden.

FineXtract’s prestaties tegen afbeeldingen die zijn beschermd door Cutout en RandAugment.
Hoewel de auteurs toegeven dat de twee beschermingssystemen goed presteren in het verhullen van de trainingsgegevensbronnen, merken zij op dat dit ten koste gaat van een daling in uitvoerkwaliteit die zo ernstig is dat het de bescherming zinloos maakt:

Afbeeldingen die zijn gegenereerd onder Stable Diffusion V1.4, fine-tuned met defensieve maatregelen – die de beeldkwaliteit drastisch verlagen. Zie de bronartikel voor betere resolutie.
Het artikel concludeert:
‘Onze experimenten demonstreren de robuustheid van de methode over verschillende datasets en real-world checkpoints, en benadrukken het potentieel voor gegevenslekkage en bieden sterke bewijs voor auteursrechtenschendingen.’
Conclusie
2024 is het jaar gebleken dat het bedrijfsleven zijn interesse in ‘schone’ trainingsgegevens aanzienlijk heeft verhoogd, gezien de voortdurende media-aandacht voor de neiging van AI om mensen te vervangen, en het vooruitzicht van het juridisch beschermen van de generatieve modellen die zij zo graag willen exploiteren.
Het is gemakkelijk om te beweren dat uw trainingsgegevens schoon zijn, maar het wordt ook gemakkelijker voor soortgelijke technologieën om te bewijzen dat dit niet het geval is – zoals Runway ML, Stability.ai en MidJourney (onder anderen) onlangs hebben ontdekt in recente dagen.
Projecten zoals FineXtract zijn mogelijk voorboden van het absolute einde van de ‘wilde westen’ periode van AI, waarin zelfs de ogenschijnlijk occulte aard van een getraind latent ruimte kan worden aangepakt.
* Voor het gemak zullen we ‘fine-tune en LoRA’ aannemen, waar nodig.
First published Monday, 7 oktober 2024












