Andersons hoek

‘Beschermde’ Afbeeldingen Zijn Gemakkelijker, Niet Moeilijker, Om Te Stelen Met AI

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
A shadowy man steals into an art gallery as the guard sleeps. Krita/Flux-1 Dev + Firefly

Nieuw onderzoek suggereert dat watermarking-tools die bedoeld zijn om AI-afbeeldingsbewerkingen te blokkeren, kunnen terugvuren. In plaats van modellen zoals Stable Diffusion te stoppen, kunnen sommige beschermingen de AI juist helpen om bewerkingen nauwkeuriger uit te voeren, waardoor ongewenste manipulaties gemakkelijker worden.

 

Er is een opvallende en robuuste tak in de computer vision-literatuur die zich richt op het beschermen van gecopyrighte afbeeldingen tegen het trainen in AI-modellen of het gebruik in directe afbeelding-naar-afbeelding AI-processen. Systemen van deze soort zijn over het algemeen gericht op Latent Diffusion Models (LDM’s) zoals Stable Diffusion en Flux, die gebruikmaken van ruisgebaseerde procedures om beelden te coderen en decoderen.

Door adversarial ruis in te voegen in anders normale afbeeldingen, kan het mogelijk zijn om afbeeldingsdetectoren te laten afbeeldingsinhoud incorrect raden en afbeeldingsgenererende systemen te hinderen om gecopyrighteerd materiaal te exploiteren:

Uit het MIT-paper 'Raising the Cost of Malicious AI-Powered Image Editing', voorbeelden van een bronafbeelding die is 'geïmmuniseerd' tegen manipulatie (onderste rij). Bron: https://arxiv.org/pdf/2302.06588

Uit het MIT-paper ‘Raising the Cost of Malicious AI-Powered Image Editing’, voorbeelden van een bronafbeelding die is ‘geïmmuniseerd’ tegen manipulatie (onderste rij). Bron: https://arxiv.org/pdf/2302.06588

Sinds een tegenreactie van kunstenaars tegen de liberale gebruik van web-geplukte afbeeldingen (inclusief gecopyrighte afbeeldingen) door Stable Diffusion in 2023, heeft de onderzoekssector meerdere variaties op hetzelfde thema geproduceerd – het idee dat afbeeldingen onzichtbaar ‘vergiftigd’ kunnen worden tegen het trainen in AI-systemen of het zuigen in generatieve AI-pijplijnen, zonder de kwaliteit van de afbeelding te schaden voor de gemiddelde kijker.

In alle gevallen is er een directe correlatie tussen de intensiteit van de opgelegde perturbatie, de mate waarin de afbeelding vervolgens wordt beschermd en de mate waarin de afbeelding er niet helemaal zo goed uitziet als zou moeten:

Hoewel de kwaliteit van het onderzoeks-PDF het probleem niet volledig illustreert, offeren grotere hoeveelheden adversarial perturbatie kwaliteit op voor beveiliging. Hier zien we de reeks van kwaliteitsverstoringen in het Fawkes-project van 2020, geleid door de Universiteit van Chicago. Bron: https://arxiv.org/pdf/2002.08327

Hoewel de kwaliteit van het onderzoeks-PDF het probleem niet volledig illustreert, offeren grotere hoeveelheden adversarial perturbatie kwaliteit op voor beveiliging. Hier zien we de reeks van kwaliteitsverstoringen in het Fawkes-project van 2020, geleid door de Universiteit van Chicago. Bron: https://arxiv.org/pdf/2002.08327

Van bijzonder belang voor kunstenaars die hun stijlen willen beschermen tegen ongeautoriseerde toe-eigening is de capaciteit van dergelijke systemen om niet alleen identiteit en andere informatie te verhullen, maar om een AI-trainingsproces te ‘overtuigen’ dat het iets anders ziet dan het werkelijk ziet, zodat verbindingen niet worden gevormd tussen semantische en visuele domeinen voor ‘beschermde’ trainingsgegevens (d.w.z. een prompt zoals ‘In de stijl van Paul Klee’).

Mist en Glaze zijn twee populaire injectiemethoden die in staat zijn om pogingen om gecopyrighte stijlen in AI-workflows en trainingsroutines te voorkomen of in ieder geval ernstig te hinderen. Bron: https://arxiv.org/pdf/2506.04394

Mist en Glaze zijn twee populaire injectiemethoden die in staat zijn om pogingen om gecopyrighte stijlen in AI-workflows en trainingsroutines te voorkomen of in ieder geval ernstig te hinderen. Bron: https://arxiv.org/pdf/2506.04394

Eigen Doel

Nu heeft nieuw onderzoek uit de VS aangetoond dat perturbaties niet alleen kunnen falen om een afbeelding te beschermen, maar dat het toevoegen van perturbaties de exploitatie van de afbeelding in alle AI-processen waarvoor de perturbatie bedoeld is om te immuniseren, kan verbeteren.

Het paper stelt:

‘In onze experimenten met verschillende perturbatie-gebaseerde beveiligingsmethoden in meerdere domeinen (natuurlijke scène-afbeeldingen en kunstwerken) en bewerkingsTaken (afbeelding-naar-afbeelding-generatie en stijl-bewerking), ontdekken we dat een dergelijke beveiliging deze doelstelling niet volledig bereikt.

‘In de meeste scenario’s genereert de diffusie-gebaseerde bewerking van beschermde afbeeldingen een wenselijke uitvoer-afbeelding die nauwkeurig overeenkomt met de leidende prompt.

‘Onze bevindingen suggereren dat het toevoegen van ruis aan afbeeldingen paradoxale wijze de associatie van de afbeelding met gegeven tekstprompts tijdens het generatieproces kan verhogen, wat leidt tot ongewenste gevolgen zoals beter resulterende bewerkingen.

‘Daarom betogen we dat perturbatie-gebaseerde methoden mogelijk geen voldoende oplossing bieden voor robuuste beveiliging van afbeeldingen tegen diffusie-gebaseerde bewerking.’

In tests werden de beschermde afbeeldingen blootgesteld aan twee vertrouwde AI-bewerkingsscenario’s: rechtstreekse afbeelding-naar-afbeelding-generatie en stijl-overdracht. Deze processen weerspiegelen de gebruikelijke manieren waarop AI-modellen mogelijk beschermde inhoud kunnen exploiteren, hetzij door de afbeelding rechtstreeks te wijzigen, hetzij door de stijleigenschappen ervan over te nemen voor gebruik elders.

De beschermde afbeeldingen, afkomstig uit standaardbronnen van fotografie en kunst, werden door deze pijplijnen geleid om te zien of de toegevoegde perturbaties de bewerkingen konden blokkeren of verslechteren.

In plaats daarvan leek de aanwezigheid van beveiliging vaak de alignering van het model met de prompts te verhogen, waardoor schone, nauwkeurige uitvoer werd gegenereerd waar enige falen werd verwacht.

De auteurs adviseren in feite dat deze populaire beveiligingsmethode een vals gevoel van veiligheid kan bieden en dat dergelijke perturbatie-gebaseerde immunisatiebenaderingen grondig moeten worden getest tegen de methoden van de auteurs.

Methode

De auteurs voerden experimenten uit met drie beveiligingsmethoden die zorgvuldig ontworpen adversarial perturbaties toepassen: PhotoGuard; Mist; en Glaze.

Glaze, een van de kaders die door de auteurs zijn getest. Glaze-beveiligingsvoorbeelden voor drie kunstenaars. De eerste twee kolommen tonen de oorspronkelijke kunstwerken. De derde kolom toont nabootsingsresultaten zonder beveiliging. De vierde kolom toont stijl-overdrachtresultaten die voor cloak-optimalisatie zijn gebruikt, samen met de doelstijl. De vijfde en zesde kolommen tonen nabootsingsresultaten met cloaking toegepast bij perturbatieniveaus p = 0,05 en p = 0,1. Alle resultaten gebruiken Stable Diffusion-modellen. https://arxiv.org/pdf/2302.04222

Glaze, een van de kaders die door de auteurs zijn getest, met Glaze-beveiligingsvoorbeelden voor drie kunstenaars. De eerste twee kolommen tonen de oorspronkelijke kunstwerken; de derde kolom toont nabootsingsresultaten zonder beveiliging; de vierde kolom toont stijl-overdrachtresultaten die voor cloak-optimalisatie zijn gebruikt, samen met de doelstijl. De vijfde en zesde kolommen tonen nabootsingsresultaten met cloaking toegepast bij perturbatieniveaus p = 0,05 en p = 0,1. Alle resultaten gebruiken Stable Diffusion-modellen. https://arxiv.org/pdf/2302.04222

PhotoGuard werd toegepast op natuurlijke scène-afbeeldingen, terwijl Mist en Glaze werden gebruikt op kunstwerken (d.w.z. ‘artistiek-geïnspireerde’ domeinen).

Tests omvatten zowel natuurlijke als artistieke afbeeldingen om mogelijke echte-wereld-gebruik weer te geven. De effectiviteit van elke methode werd beoordeeld door te controleren of een AI-model nog steeds realistische en prompt-relevante bewerkingen kon produceren wanneer het werkte met beschermde afbeeldingen; als de resulterende afbeeldingen overtuigend en prompt-relevant leken, werd de beveiliging geacht te hebben gefaald om de bewerking te blokkeren.

Stable Diffusion v1.5 werd gebruikt als de vooraf getrainde afbeeldingsgenerator voor de bewerkingsTaken van de onderzoekers. Vijf zaden werden geselecteerd om reproduceerbaarheid te garanderen: 9222, 999, 123, 66 en 42. Alle andere generatie-instellingen, zoals guidance-schaal, sterkte en totale stappen, volgden de standaardwaarden die in de PhotoGuard-experimenten werden gebruikt.

PhotoGuard werd getest op natuurlijke scène-afbeeldingen met behulp van de Flickr8k-dataset, die meer dan 8.000 afbeeldingen bevat die zijn gekoppeld aan maximaal vijf onderschriften elk.

Tegenovergestelde Gedachten

Twee sets van gewijzigde onderschriften werden gemaakt van de eerste onderschrift van elke afbeelding met behulp van Claude Sonnet 3.5. Een set bevatte prompts die contextueel dichtbij lagen bij de oorspronkelijke onderschriften; de andere set bevatte prompts die contextueel ver lagen.

Als voorbeeld, van de oorspronkelijke onderschrift ‘Een jong meisje in een roze jurk die een houten hut binnengaat’, zou een dichtbij prompt ‘Een jongen in een blauw shirt die een bakstenen huis binnengaat’ zijn. In tegenstelling daarmee zou een ver prompt ‘Twee katten die op een bank liggen’ zijn.

Dichtbij prompts werden geconstrueerd door zelfstandige naamwoorden en bijvoeglijke naamwoorden te vervangen door semantisch vergelijkbare termen; verre prompts werden gegenereerd door de model aan te geven om onderschriften te maken die contextueel zeer verschillend waren.

Alle gegenereerde onderschriften werden handmatig gecontroleerd op kwaliteit en semantische relevantie. Google’s Universal Sentence Encoder werd gebruikt om semantische overeenkomstscores te berekenen tussen de oorspronkelijke en gewijzigde onderschriften:

Uit het aanvullende materiaal, semantische overeenkomstverdelingen voor de gewijzigde onderschriften die in de Flickr8k-tests werden gebruikt. De grafiek links toont de overeenkomstscores voor de dichtbij gewijzigde onderschriften, gemiddeld rond de 0,6. De grafiek rechts toont de uitgebreid gewijzigde onderschriften, gemiddeld rond de 0,1, wat een grotere semantische afstand van de oorspronkelijke onderschriften weerspiegelt. Waarden werden berekend met Google's Universal Sentence Encoder. Bron: https://sigport.org/sites/default/files/docs/IncompleteProtection_SM_0.pdf

Uit het aanvullende materiaal, semantische overeenkomstverdelingen voor de gewijzigde onderschriften die in de Flickr8k-tests werden gebruikt. De grafiek links toont de overeenkomstscores voor de dichtbij gewijzigde onderschriften, gemiddeld rond de 0,6. De grafiek rechts toont de uitgebreid gewijzigde onderschriften, gemiddeld rond de 0,1, wat een grotere semantische afstand van de oorspronkelijke onderschriften weerspiegelt. Waarden werden berekend met Google’s Universal Sentence Encoder. Bron: https://sigport.org/sites/default/files/docs/IncompleteProtection_SM_0.pdf

Elke afbeelding, samen met de beschermde versie, werd bewerkt met zowel de dichtbij als de verre prompts. De Blind/Referenceless Image Spatial Quality Evaluator (BRISQUE) werd gebruikt om de beeldkwaliteit te beoordelen:

Afbeelding-naar-afbeelding-generatie-resultaten op natuurlijke foto's die zijn beschermd door PhotoGuard. Ondanks de aanwezigheid van perturbaties, volgde Stable Diffusion v1.5 zowel kleine als grote semantische veranderingen in de bewerkingsprompts succesvol, waardoor realistische uitvoer werd gegenereerd die overeenkwam met de nieuwe instructies.

Afbeelding-naar-afbeelding-generatie-resultaten op natuurlijke foto’s die zijn beschermd door PhotoGuard. Ondanks de aanwezigheid van perturbaties, volgde Stable Diffusion v1.5 zowel kleine als grote semantische veranderingen in de bewerkingsprompts succesvol, waardoor realistische uitvoer werd gegenereerd die overeenkwam met de nieuwe instructies.

De gegenereerde afbeeldingen scoorden 17,88 op BRISQUE, met 17,82 voor dichtbij prompts en 17,94 voor verre prompts, terwijl de oorspronkelijke afbeeldingen 22,27 scoorden. Dit toont aan dat de bewerkte afbeeldingen qua kwaliteit dicht bij de oorspronkelijke afbeeldingen bleven.

Metrieken

Om te beoordelen hoe goed de beveiligingen de AI-bewerkingen verstoorden, maten de onderzoekers hoe goed de eindafbeeldingen overeenkwamen met de instructies die ze kregen, met behulp van scoresystemen die de afbeeldingsinhoud vergeleken met de tekstprompt, om te zien hoe goed ze overeenkwamen.

Hiertoe gebruikt de CLIP-S-metriek een model dat zowel afbeeldingen als tekst kan begrijpen om te controleren hoe vergelijkbaar ze zijn, terwijl PAC-S++ extra samples creëert die door AI zijn gemaakt om de vergelijking meer in overeenstemming te brengen met een menselijke schatting.

Deze Afbeelding-tekst-overeenkomst (ITA)-scores geven aan hoe nauwkeurig de AI de instructies volgde bij het bewerken van een beschermde afbeelding: als een beschermde afbeelding nog steeds een hoog overeenkomende uitvoer opleverde, betekent dit dat de beveiliging gefaald heeft om de bewerking te blokkeren.

Effect van beveiliging op de Flickr8k-dataset over vijf zaden, met zowel dichtbij als verre prompts. Afbeelding-tekst-overeenkomst werd gemeten met CLIP-S- en PAC-S++-scores.

Effect van beveiliging op de Flickr8k-dataset over vijf zaden, met zowel dichtbij als verre prompts. Afbeelding-tekst-overeenkomst werd gemeten met CLIP-S- en PAC-S++-scores.

De onderzoekers vergeleken hoe goed de AI de prompts volgde bij het bewerken van beschermde afbeeldingen versus onbeschermde afbeeldingen. Ze keken eerst naar het verschil tussen de twee, genaamd de Daadwerkelijke Verandering. Vervolgens werd het verschil geschaald om een Percentage Verandering te creëren, waardoor het gemakkelijker werd om resultaten over meerdere tests te vergelijken.

Dit proces onthulde of de beveiligingen het voor de AI moeilijker of gemakkelijker maakten om de prompts te volgen. De tests werden vijf keer herhaald met behulp van verschillende willekeurige zaden, waarbij zowel kleine als grote veranderingen in de oorspronkelijke onderschriften werden omvat.

Kunstenaanval

Voor de tests op natuurlijke foto’s werd de Flickr1024-dataset gebruikt, die meer dan duizend hoge-kwaliteit afbeeldingen bevat. Elke afbeelding werd bewerkt met prompts die de volgende patroon volgden: ‘Verander de stijl naar [V]’, waar [V] een van de zeven beroemde kunststijlen vertegenwoordigde: Kubisme; Post-Impressionisme; Impressionisme; Surrealisme; Barok; Fauvisme; en Renaissance.

Het proces omvatte het toepassen van PhotoGuard op de oorspronkelijke afbeeldingen, het genereren van beschermde versies en vervolgens het doorvoeren van zowel beschermde als onbeschermde afbeeldingen door dezelfde reeks stijl-overdracht-bewerkingen:

Oorspronkelijke en beschermde versies van een natuurlijke scène-afbeelding, elk bewerkt om Kubisme, Surrealisme en Fauvisme-stijlen toe te passen.

Oorspronkelijke en beschermde versies van een natuurlijke scène-afbeelding, elk bewerkt om Kubisme, Surrealisme en Fauvisme-stijlen toe te passen.

Om beveiligingsmethoden op kunstwerken te testen, werd stijl-overdracht uitgevoerd op afbeeldingen uit de WikiArt-dataset, die een breed scala aan artistieke stijlen verzamelt. De bewerkingsprompts volgden hetzelfde formaat als voorheen, waarbij de AI werd geïnstrueerd om de stijl te veranderen in een willekeurig geselecteerde, niet-gerelateerde stijl uit de WikiArt-labels.

Beide Glaze- en Mist-beveiligingsmethoden werden toegepast op de afbeeldingen voordat de bewerkingen werden uitgevoerd, waardoor de onderzoekers konden observeren hoe goed elke verdediging de stijl-overdrachtresultaten kon blokkeren of verstoren:

Voorbeelden van hoe beveiligingsmethoden de stijl-overdracht op kunstwerken beïnvloeden. De oorspronkelijke Barok-afbeelding wordt getoond naast versies die zijn beschermd door Mist en Glaze. Na het toepassen van Kubisme-stijl-overdracht kunnen de verschillen worden gezien in hoe elke beveiliging het eindresultaat verandert.

Voorbeelden van hoe beveiligingsmethoden de stijl-overdracht op kunstwerken beïnvloeden. De oorspronkelijke Barok-afbeelding wordt getoond naast versies die zijn beschermd door Mist en Glaze. Na het toepassen van Kubisme-stijl-overdracht kunnen de verschillen worden gezien in hoe elke beveiliging het eindresultaat verandert.

De onderzoekers testten de vergelijkingen ook kwantitatief:

Veranderingen in afbeelding-tekst-overeenkomst-scores na stijl-overdracht-bewerkingen.

Veranderingen in afbeelding-tekst-overeenkomst-scores na stijl-overdracht-bewerkingen.

Van deze resultaten merken de auteurs op:

‘De resultaten benadrukken een significante beperking van adversarial perturbaties voor beveiliging. In plaats van de alignering te verhinderen, verhogen adversarial perturbaties vaak de responsiviteit van het generatieve model voor prompts, waardoor exploiters ongewild in staat worden gesteld om uitvoer te produceren die meer in overeenstemming is met hun doelstellingen. Een dergelijke beveiliging is niet storend voor het afbeeldingsbewerkingsproces en kan mogelijk niet voorkomen dat kwaadwillige agenten ongeautoriseerd materiaal kopiëren.

‘De onbedoelde gevolgen van het gebruik van adversarial perturbaties onthullen kwetsbaarheden in bestaande methoden en benadrukken de dringende behoefte aan meer effectieve beveiligingstechnieken.’

De auteurs leggen uit dat de onverwachte resultaten kunnen worden toegeschreven aan de manier waarop diffusiemodellen werken: LDM’s bewerken afbeeldingen door ze eerst om te zetten in een gecomprimeerde versie genaamd een latent; ruis wordt vervolgens toegevoegd aan deze latent via veel stappen, totdat de gegevens bijna willekeurig worden.

Het model keert dit proces om tijdens de generatie, waarbij de ruis stap voor stap wordt verwijderd. Op elk stadium van deze omkering helpt de tekstprompt bij het bepalen van hoe de ruis moet worden schoongemaakt, waardoor de afbeelding geleidelijk wordt gevormd om overeen te komen met de prompt:

Vergelijking tussen generaties van een onbeschermde afbeelding en een PhotoGuard-beschermde afbeelding, met tussenliggende latente staten omgezet in afbeeldingen voor visualisatie.

Vergelijking tussen generaties van een onbeschermde afbeelding en een PhotoGuard-beschermde afbeelding, met tussenliggende latente staten omgezet in afbeeldingen voor visualisatie.

Beveiligingsmethoden voegen kleine hoeveelheden extra ruis toe aan de oorspronkelijke afbeelding voordat deze het proces ingaat. Hoewel deze perturbaties klein zijn aan het begin, accumuleren ze wanneer het model zijn eigen lagen ruis toevoegt.

Dit opbouwen laat meer delen van de afbeelding ‘onzeker’ wanneer het model begint met het verwijderen van ruis. Met grotere onzekerheid leunt het model zwaarder op de tekstprompt om de ontbrekende details in te vullen, waardoor de prompt nog meer invloed krijgt dan het normaal zou hebben.

In feite maken de beveiligingen het voor de AI gemakkelijker om de afbeelding te herschappen om overeen te komen met de prompt, in plaats van moeilijker.

Tenslotte voerden de auteurs een test uit waarbij ze gemaakte perturbaties uit het Raising the Cost of Malicious AI-Powered Image Editing paper vervingen door pure Gaussische ruis.

De resultaten volgden hetzelfde patroon dat eerder werd waargenomen: over alle tests bleven de Percentage Verandering-waarden positief. Zelfs deze willekeurige, ongestructureerde ruis leidde tot een sterkere alignering tussen de gegenereerde afbeeldingen en de prompts.

Effect van gesimuleerde beveiliging met Gaussische ruis op de Flickr8k-dataset.

Effect van gesimuleerde beveiliging met Gaussische ruis op de Flickr8k-dataset.

Dit ondersteunde de onderliggende verklaring dat elke toegevoegde ruis, ongeacht de ontwerp, meer onzekerheid creëert voor het model tijdens de generatie, waardoor de tekstprompt meer controle over de eindafbeelding kan uitoefenen.

Conclusie

De onderzoekssector heeft adversarial perturbatie aan het LDM-copyright-probleem nagejaagd voor bijna even lang als LDM’s bestaan; maar geen robuuste oplossingen zijn uit het buitengewone aantal papers die over dit onderwerp zijn gepubliceerd, naar voren gekomen.

Of de opgelegde verstoringen de kwaliteit van de afbeelding excessief verlagen, of de patronen niet bestand zijn tegen manipulatie en transformatieprocessen.

Maar het is een moeilijke droom om te verlaten, aangezien het alternatief zou lijken te zijn derde-partij-monitoren en herkomst-kaders zoals het door Adobe geleide C2PA-scheme, dat een keten van bewaring voor afbeeldingen van de camera-sensor tot en met probeert te behouden, maar dat geen innate verbinding heeft met de weergegeven inhoud.

In elk geval, als adversarial perturbatie het probleem eigenlijk erger maakt, zoals het nieuwe paper aangeeft dat het in veel gevallen kan zijn, vraagt men zich af of de zoektocht naar copyrightbeveiliging via dergelijke middelen onder ‘alchemie’ valt.

 

Voor het eerst gepubliceerd op maandag 9 juni 2025

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai