Andersons vinkel

’Beskyttede’ billeder er nemmere, ikke sværere, at stjæle med AI

mm
Føj Unite.AI til dine foretrukne kilder på Google
A shadowy man steals into an art gallery as the guard sleeps. Krita/Flux-1 Dev + Firefly

Nyt forskning antyder, at vandmærkningsværktøjer, der er designet til at blokere AI-billedredigering, kan have den modsatte effekt. I stedet for at stoppe modeller som Stable Diffusion fra at foretage ændringer, kan visse beskyttelser faktisk hjælpe AI’en med at følge redigeringsprompts mere nøjagtigt, hvilket gør uønskede manipulationer endnu lettere.

 

Der er en bemærkelsesværdig og robust tråd i computer vision-litteraturen, der er dedikeret til at beskytte ophavsretsbilleder mod at blive trænet i AI-modeller eller brugt i direkte billed-til-billed AI-processer. Systemer af denne type er generelt rettet mod Latent Diffusionsmodeller (LDM’er) som Stable Diffusion og Flux, der bruger støj-baserede procedurer til at kodificere og dekodificere billeder.

Ved at indsætte adversarial støj i ellers normale billeder, kan det være muligt at få billed-detektorer til at gætte billedindhold forkert og hindre billed-genereringsprocesser i at udnytte ophavsretsbilleder:

Fra MIT-papiret 'Raising the Cost of Malicious AI-Powered Image Editing', eksempler på et kildebillede 'immuniseret' mod manipulation (nederste række). Kilde: https://arxiv.org/pdf/2302.06588

Fra MIT-papiret ‘Raising the Cost of Malicious AI-Powered Image Editing’, eksempler på et kildebillede ‘immuniseret’ mod manipulation (nederste række). Kilde: https://arxiv.org/pdf/2302.06588

Siden en backlash fra kunstnere mod Stable Diffusions liberale brug af web-skrapede billeder (herunder ophavsretsbilleder) i 2023, har forskningsscenen produceret multiple variationer over det samme tema – idéen om, at billeder kan være usynligt ‘forgiftet’ mod at blive trænet i AI-systemer eller sugt ind i generative AI-rørledninger, uden at påvirke billedkvaliteten for den gennemsnitlige bruger.

I alle tilfælde er der en direkte korrelation mellem styrken af den påførte perturbation, udstrækningen af hvilken billedet herefter er beskyttet, og udstrækningen af hvilken billedet ikke ser helt så godt ud, som det burde:

Selvom kvaliteten af forsknings-PDF'en ikke helt illustrerer problemet, ofrer større mængder af adversarial perturbation kvalitet for sikkerhed. Her ser vi spændet af kvalitetsforstyrrelser i 2020-projektet 'Fawkes' ledet af University of Chicago. Kilde: https://arxiv.org/pdf/2002.08327

Selvom kvaliteten af forsknings-PDF’en ikke helt illustrerer problemet, ofrer større mængder af adversarial perturbation kvalitet for sikkerhed. Her ser vi spændet af kvalitetsforstyrrelser i 2020-projektet ‘Fawkes’ ledet af University of Chicago. Kilde: https://arxiv.org/pdf/2002.08327

Især for kunstnere, der søger at beskytte deres stilarter mod uautoriseret tilpasning, er kapaciteten af sådanne systemer ikke kun til at forklæde identitet og anden information, men også til at ‘overbevise’ en AI-træningsproces om, at det ser noget andet end det faktisk gør, sådan at forbindelser ikke dannes mellem semantiske og visuelle domæner for ‘beskyttet’ træningsdata (dvs. en prompt som ‘I stilen af Paul Klee’).

Mist og Glaze er to populære injektionsmetoder, der kan forhindre eller i hvert fald alvorligt hæmme forsøg på at bruge ophavsretsbilleder i AI-arbejdsgange og træningsrutiner. Kilde: https://arxiv.org/pdf/2506.04394

Mist og Glaze er to populære injektionsmetoder, der kan forhindre eller i hvert fald alvorligt hæmme forsøg på at bruge ophavsretsbilleder i AI-arbejdsgange og træningsrutiner. Kilde: https://arxiv.org/pdf/2506.04394

Egen Mål

Nu har ny forskning fra USA fundet ud af, at ikke kun kan perturbationer ikke beskytte et billede, men at tilføjelse af perturbation kan faktisk forbedre billedets udnytbarhed i alle AI-processer, som perturbationen er designet til at immunisere imod.

Papiret fastslår:

‘I vores eksperimenter med forskellige perturbation-baserede billedbeskyttelsesmetoder på tværs af multiple domæner (natur-scene-billeder og kunstværker) og redigeringssopgaver (billed-til-billed-generering og stil-redigering), opdager vi, at sådan beskyttelse ikke opnår dette mål fuldt ud.

‘I de fleste scenarier genererer diffusion-baseret redigering af beskyttede billeder et ønskværdigt output-billede, der følger vejledningsprompts meget nøjagtigt.

‘Vore fund antyder, at tilføjelse af støj til billeder kan paradoksalt øge deres association med givne tekstprompts under genereringsprocessen, hvilket fører til uventede konsekvenser som better resultater.

‘Derfor argumenterer vi for, at perturbation-baserede metoder måske ikke giver en tilstrækkelig løsning for robust billedbeskyttelse mod diffusion-baseret redigering.’

I tests blev de beskyttede billeder udsat for to velkendte AI-redigerings-scenarier: direkte billed-til-billed-generering og stil-overførsel. Disse processer afspejler de almindelige måder, hvorpå AI-modeller kan udnytte beskyttet indhold, enten ved direkte at ændre et billede eller ved at låne dets stilistiske træk til brug andre steder.

De beskyttede billeder, der blev hentet fra standardkilder af fotografi og kunstværker, blev kørt gennem disse rørledninger for at se, om de tilføjede perturbationer kunne blokere eller forringe redigeringerne.

I stedet syntes tilstedeværelsen af beskyttelse ofte at skærpe modellens alignment med prompts, producerende rene, nøjagtige outputs, hvor nogen fejl var forventet.

Forfatterne råder i effekt, at denne meget populære metode til beskyttelse kan give en falsk fornemmelse af sikkerhed, og at enhver sådan perturbation-baseret immuniseringstilgang bør testes grundigt mod forfatternes egne metoder.

Metode

Forfatterne kørte eksperimenter med tre beskyttelsesmetoder, der anvender omhyggeligt designede adversarial perturbationer: PhotoGuard; Mist; og Glaze.

Glaze, en af de rammer, der blev testet af forfatterne. Glaze-beskyttelseseksempler for tre kunstnere. De første to kolonner viser de originale kunstværker. Den tredje kolonne viser mimicry-resultater uden beskyttelse. Den fjerde kolonne viser stil-overførte versioner, der blev brugt til kappe-optimering, sammen med målstilnavnet. Den femte og sjette kolonne viser mimicry-resultater med kappe anvendt ved perturbationsniveauer p = 0,05 og p = 0,1. Alle resultater bruger Stable Diffusion-modeller. https://arxiv.org/pdf/2302.04222

Glaze, en af de rammer, der blev testet af forfatterne, viser Glaze-beskyttelseseksempler for tre kunstnere. De første to kolonner viser de originale kunstværker; den tredje kolonne viser mimicry-resultater uden beskyttelse; den fjerde viser stil-overførte versioner, der blev brugt til kappe-optimering, sammen med målstilnavnet. Den femte og sjette kolonne viser mimicry-resultater med kappe anvendt ved perturbationsniveauer p = 0,05 og p = 0,1. Alle resultater bruger Stable Diffusion-modeller. https://arxiv.org/pdf/2302.04222

PhotoGuard blev anvendt på natur-scene-billeder, mens Mist og Glaze blev brugt på kunstværker (dvs. ‘kunstnerisk-stilede’ domæner).

Tests dækkede både natur-scene-billeder og kunstværker for at reflektere mulige virkelige anvendelser. Effektiviteten af hver metode blev vurderet ved at kontrollere, om en AI-model stadig kunne producere realistiske og prompt-relevante redigeringer, når den arbejdede med beskyttede billeder; hvis de resulterende billeder så ud som troværdige og matchede prompts, blev beskyttelsen vurderet til at have fejlet i at blokere redigeringen.

Stable Diffusion v1.5 blev brugt som den fortrænede billedgenerator for forfatternes redigeringssopgaver. Fem frø blev valgt for at sikre reproducerbarhed: 9222, 999, 123, 66 og 42. Alle andre generationsindstillinger, såsom vejledningsskala, styrke og samlede skridt, fulgte standardværdierne, der blev brugt i PhotoGuard-eksperimenterne.

PhotoGuard blev testet på natur-scene-billeder ved hjælp af Flickr8k-datasettet, der indeholder over 8.000 billeder parret med op til fem undertekster hver.

Modstridende Tanker

To sæt af modificerede undertekster blev oprettet fra den første undertekst af hvert billede med hjælp af Claude Sonnet 3.5. Et sæt indeholdt prompts, der var kontekstligt tæt på de originale undertekster; det andet sæt indeholdt prompts, der var kontekstligt fjerne.

For eksempel, fra den originale undertekst ‘En ung pige i en pink kjole går ind i en træhytte’, ville en tæt prompt være ‘En ung dreng i en blå skjorte går ind i en murstenshus’. Til gengæld ville en fjern prompt være ‘To katte ligger på en sofa’.

Tætte prompts blev konstrueret ved at erstatte navneord og tillægsord med semantisk lignende termer; fjerne prompts blev genereret ved at instruere modellen til at oprette undertekster, der var kontekstligt meget forskellige.

Alle genererede undertekster blev manuelt kontrolleret for kvalitet og semantisk relevans. Google’s Universal Sentence Encoder blev brugt til at beregne semantiske ligningskorer mellem de originale og modificerede undertekster:

Fra supplementmateriale, semantiske ligningsfordelinger for de modificerede undertekster, der blev brugt i Flickr8k-tests. Grafen til venstre viser ligningskorerne for tæt modificerede undertekster, der i gennemsnit er omkring 0,6. Grafen til højre viser de omfattende modificerede undertekster, der i gennemsnit er omkring 0,1, hvilket afspejler en større semantisk afstand fra de originale undertekster. Værdierne blev beregnet ved hjælp af Google's Universal Sentence Encoder. Kilde: https://sigport.org/sites/default/files/docs/IncompleteProtection_SM_0.pdf

Fra supplementmateriale, semantiske ligningsfordelinger for de modificerede undertekster, der blev brugt i Flickr8k-tests. Grafen til venstre viser ligningskorerne for tæt modificerede undertekster, der i gennemsnit er omkring 0,6. Grafen til højre viser de omfattende modificerede undertekster, der i gennemsnit er omkring 0,1, hvilket afspejler en større semantisk afstand fra de originale undertekster. Værdierne blev beregnet ved hjælp af Google’s Universal Sentence Encoder. Kilde: https://sigport.org/sites/default/files/docs/IncompleteProtection_SM_0.pdf

Hvert billede, sammen med dets beskyttede version, blev redigeret ved hjælp af både de tætte og fjerne prompts. Den blinde/referenceløse billedrumlige kvalitetsvurdering (BRISQUE) blev brugt til at vurdere billedkvalitet:

Billed-til-billed-genereringsresultater på naturfotografier beskyttet af PhotoGuard. Trods tilstedeværelsen af perturbationer, fulgte Stable Diffusion v1.5 både små og store semantiske ændringer i redigeringsprompts, producerende realistiske outputs, der matchede de nye instruktioner.

Billed-til-billed-genereringsresultater på naturfotografier beskyttet af PhotoGuard. Trods tilstedeværelsen af perturbationer, fulgte Stable Diffusion v1.5 både små og store semantiske ændringer i redigeringsprompts, producerende realistiske outputs, der matchede de nye instruktioner.

De genererede billeder fik en score på 17,88 på BRISQUE, med 17,82 for tætte prompts og 17,94 for fjerne prompts, mens de originale billeder fik en score på 22,27. Dette viser, at de redigerede billeder forblev tæt på de originale i kvalitet.

Metrikker

For at vurdere, hvor godt beskyttelserne forstyrrede AI-redigering, målte forskerne, hvor nøjagtigt de endelige billeder matchede instruktionerne, de fik, ved hjælp af vurderingssystemer, der sammenlignede billedindholdet med tekstprompten for at se, hvor godt de alignerede:

Til dette formål brugte CLIP-S-metrikken en model, der kan forstå både billeder og tekst for at kontrollere, hvor lignende de er, mens PAC-S++ tilføjede ekstra samples, der blev skabt af AI for at alignere sammenligningen mere nøjagtigt med en menneskelig vurdering.

Disse billed-til-tekst-alignment (ITA)-korer angiver, hvor nøjagtigt AI’en følger instruktionerne, når den ændrer et beskyttet billede: hvis et beskyttet billede stadig resulterer i et højt aligneret output, betyder det, at beskyttelsen er vurderet til at have fejlet i at blokere redigeringen.

Effekten af beskyttelse på Flickr8k-datasettet over fem frø, ved hjælp af både tætte og fjerne prompts. Billed-til-tekst-alignment blev målt ved hjælp af CLIP-S- og PAC-S++-korer.

Effekten af beskyttelse på Flickr8k-datasettet over fem frø, ved hjælp af både tætte og fjerne prompts. Billed-til-tekst-alignment blev målt ved hjælp af CLIP-S- og PAC-S++-korer.

Forskere sammenlignede, hvor godt AI’en følger prompts, når den redigerer beskyttede billeder versus ubeskyttede billeder. De så først på forskellen mellem de to, kaldet den faktiske ændring. Så blev forskellen skaleret for at skabe en procentvis ændring, hvilket gjorde det lettere at sammenligne resultater på tværs af mange tests.

Dette afslørede, om beskyttelserne gjorde det sværere eller lettere for AI’en at matche prompts. Testene blev gentaget fem gange ved hjælp af forskellige tilfældige frø, dækkende både små og store ændringer af de originale undertekster.

Kunstangreb

For testerne på naturfotografier blev Flickr1024-datasettet brugt, der indeholder over 1.000 højkvalitetsbilleder. Hvert billede blev redigeret med prompts, der fulgte mønsteret: ‘ændr stilen til [V]’, hvor [V] repræsenterede en af syv berømte kunststilarter: Kubisme; Post-Impressionisme; Impressionisme; Surrealisme; Barok; Fauvisme; og Renæssance.

Processen involverede at anvende PhotoGuard på de originale billeder, generere beskyttede versioner og derefter køre både beskyttede og ubeskyttede billeder gennem samme sæt af stil-overførselsredigeringer:

Originale og beskyttede versioner af et natur-scene-billede, hver redigeret for at anvende Kubisme, Surrealisme og Fauvisme-stilarter.

Originale og beskyttede versioner af et natur-scene-billede, hver redigeret for at anvende Kubisme, Surrealisme og Fauvisme-stilarter.

For at teste beskyttelsesmetoder på kunstværker blev stil-overførsel udført på billeder fra WikiArt-datasettet, der kuraterer et bredt udvalg af kunststilarter. Redigeringsprompts følte samme format som før, instruerende AI’en til at ændre stilen til en tilfældigt valgt, ikke-relateret stil fra WikiArt-mærkerne.

Both Glaze og Mist-beskyttelsesmetoder blev anvendt på billederne før redigeringerne, hvilket tillod forskerne at observere, hvor godt hver forsvar kunne blokere eller forstyrre stil-overførselsresultaterne:

Eksempler på, hvordan beskyttelsesmetoder påvirker stil-overførsel på kunstværker. Det originale Barok-billede vises sammen med versioner beskyttet af Mist og Glaze. Efter at have anvendt Kubisme-stil-overførsel kan forskellene i, hvordan hver beskyttelse ændrer den endelige output, ses.

Eksempler på, hvordan beskyttelsesmetoder påvirker stil-overførsel på kunstværker. Det originale Barok-billede vises sammen med versioner beskyttet af Mist og Glaze. Efter at have anvendt Kubisme-stil-overførsel kan forskellene i, hvordan hver beskyttelse ændrer den endelige output, ses.

Forskere testede sammenligningerne kvantitativt også:

Ændringer i billed-til-tekst-alignment-korer efter stil-overførselsredigeringer.

Ændringer i billed-til-tekst-alignment-korer efter stil-overførselsredigeringer.

Af disse resultater kommenterede forfatterne:

‘Resultaterne fremhæver en betydelig begrænsning af adversarial perturbationer til beskyttelse. I stedet for at forhindre alignment, forstærker adversarial perturbationer ofte den generative models respons på prompts, utilsigtet ENABLEende udnyttere til at producere outputs, der alignerer mere nøjagtigt med deres mål. En sådan beskyttelse er ikke disruptiv for billedredigeringsprocessen og kan måske ikke forhindre ondsindede agenter i at kopiere ikke-autoriseret materiale.

‘De uventede konsekvenser af at bruge adversarial perturbationer afslører sårbarheder i eksisterende metoder og understreger det presserende behov for mere effektive beskyttelsesmetoder.’

Forfatterne forklarer, at de uventede resultater kan spores tilbage til, hvordan diffusion-modeller fungerer: LDM’er redigerer billeder ved først at konvertere dem til en komprimeret version kaldet en latent; støj tilføjes derefter til denne latent gennem mange skridt, indtil data bliver næsten tilfældigt.

Modellen omvender denne proces under generation, fjerner støjen skridt for skridt. Ved hvert trin i denne omvending hjælper tekstprompten med at guide, hvordan støjen skal fjernes, gradvist formende billedet til at matche prompten:

Sammenligning mellem generationer fra et ubeskyttet billede og et PhotoGuard-beskyttet billede, med mellemliggende latente tilstande konverteret tilbage til billeder for visualisering.

Sammenligning mellem generationer fra et ubeskyttet billede og et PhotoGuard-beskyttet billede, med mellemliggende latente tilstande konverteret tilbage til billeder for visualisering.

Beskyttelsesmetoder tilføjer små mængder af ekstra støj til det originale billede, før det indgår i denne proces. Selvom disse perturbationer er små til at starte med, akkumulerer de, da modellen tilføjer sine egne lag af støj.

Dette bygge op efterlader flere dele af billedet ‘usikre’, når modellen begynder at fjerne støj. Med større usikkerhed læner modellen mere tungt på tekstprompten for at udfylde de manglende detaljer, hvilket giver prompten endnu mere indflydelse, end den ellers ville have.

I virkeligheden gør beskyttelserne det lettere for AI’en til at omforme billedet til at matche prompten, snarere end sværere.

Til sidst udførte forfatterne en test, der erstattede tilrettelagte perturbationer fra Raising the Cost of Malicious AI-Powered Image Editing papiret med ren Gaussisk støj.

Resultaterne fulgte samme mønster, der tidligere var observeret: på tværs af alle tests forblev procentvis ændringsværdierne positive. Selv denne tilfældige, ustrukturerede støj førte til stærkere alignment mellem de genererede billeder og prompts.

Effekten af simuleret beskyttelse ved hjælp af Gaussisk støj på Flickr8k-datasettet.

Effekten af simuleret beskyttelse ved hjælp af Gaussisk støj på Flickr8k-datasettet.

Dette understøttede den underliggende forklaring, at enhver tilføjet støj, uanset dets design, skaber større usikkerhed for modellen under generation, hvilket giver tekstprompten mulighed for at udøve endnu mere kontrol over det endelige billede.

Konklusion

Forsknings-scenen har været ved at presse adversarial perturbation på LDM-ophavsretsspørgsmålet, lige så længe LDM’er har eksisteret; men ingen robuste løsninger er dukket op fra det ekstraordinære antal artikler, der er offentliggjort på dette spor.

Enten er de påførte forstyrrelser for kraftige og sænker billedkvaliteten for meget, eller også er mønstrene ikke robuste over for manipulation og transformative processer.

Men det er en hård drøm at opgive, da alternativet ville synes at være tredjeparts-overvågning og proveniens-rammer som det Adobe-ledede C2PA-scheme, der søger at opretholde en kæde af ejerskab for billeder fra kamera-sensoren og frem, men som ikke har nogen indre forbindelse med det afbillede indhold.

I ethvert tilfælde, hvis adversarial perturbation faktisk gør problemet værre, som det nye papir antyder kan være sandt i mange tilfælde, så undrer man sig over, om søgen efter ophavsretsskydd via sådanne midler falder under ‘alkymi’.

 

Først offentliggjort mandag, 9. juni 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai