Andersons vinkel
Censurering af AI-modeller fungerer ikke godt, viser studie

Forsøg på at censurere AI-billedgenereringsmodeller ved at slette forbudt indhold (såsom pornografi, vold eller ophavsretligt beskyttede stilarter) fra de trænede modeller, er ikke effektive: en ny studie finder, at nuværende konceptsletningsmetoder tillader “forbudt” attributter at løbe over i ikke-relaterede billeder, og de kan heller ikke forhindre, at nært-relaterede versioner af det såkaldt “slettede” indhold fortsat vises.
Hvis selskaber, der producerer grundlæggende AI-modeller, ikke kan forhindre, at deres modeller misbruges til at producere forkert eller ulovligt materiale, risikerer de at blive sagsøgt og/eller lukket ned. Omvendt er leverandører, der kun giver adgang til deres modeller gennem en API, som Adobe’s Firefly generative motor, i en position, hvor de ikke behøver at bekymre sig om, hvad deres modeller kan producere, da både brugerens prompt og den resulterende output inspiceres og renseres:

Adobe’s Firefly-system, der bruges i værktøjer som Photoshop, afviser nogle gange en generativ anmodning med det samme ved at blokere prompten, før noget er produceret. Andre gange genererer den billedet, men blokerer derefter resultatet efter gennemsyn. Denne type midlertidig afvisning kan også ske i ChatGPT, når modellen starter en respons, men afbryder den, efter at have genkendt en politikovertrædelse – og nogle gange kan man kortvarigt se det afbrudte billede under denne proces.
API-filtre af denne type kan dog normalt neutraliseres af brugere på lokalt installeret modeller, herunder vision-sprog-modeller (VLM’er), som brugeren måske ønsker at tilpasse gennem lokal træning på brugerdefineret data.
Det er i de fleste tilfælde let at deaktivere disse operationer, hvilket typisk indebærer at kommentere en funktionkald ud i Python (selvom hacks af denne type normalt skal gentages eller genopfindes efter framework-opdateringer).
Set fra et forretningsperspektiv er det svært at forstå, hvordan dette kan være et problem, da en API-tilgang maksimerer virksomhedens kontrol over brugerens arbejdsgang. Set fra brugerens perspektiv er både omkostningerne ved API-kun-modeller og risikoen for fejl eller overdreven censur dog sandsynligvis tilstrækkeligt til at få dem til at downloade og tilpasse lokale installationer af åbne kildealternativer – i hvert fald, hvor FOSS-licensen er gunstig.
Den sidste betydende model, der blev udgivet uden nogen forsøg på at indbygge selv-censur, var Stable Diffusion V1.5, næsten tre år siden. Senere førte afsløringen af, at dens træningskorpus indeholdt CSAM-data, til øgende krav om at forbyde dens tilgængelighed, og dens fjernelse fra Hugging Face-repositoriet i 2024.
Klip det ud!
Kynikere mener, at et selskabs interesse i at censurere lokalt installerbare generative AI-modeller udelukkende skyldes bekymring om juridisk eksponering, hvis deres rammer bliver offentliggjort for at facilitere ulovligt eller forkert indhold.
Det er sandt, at nogle ‘lokalt-venlige’ åbne kilde-modeller ikke er så svære at decensurere (såsom Stable Diffusion 1.5 og DeepSeek R1).
Modsat dette var udgivelsen af Black Forest Lab’s Flux Kontext model-serie kendetegnet ved selskabets bemærkelsesværdige engagement i at bowdlerisere hele Kontext-serien. Dette blev opnået både gennem omhyggelig datakurering og gennem målrettet fine-tuning efter træning, designet til at fjerne enhver resterende tendens til NSFW eller forbudt indhold.
Dette er, hvor fokus har været i forskningsscenen de seneste 2-3 år: med fokus på efterfølgende korrektion af modeller med under-kurateret data. Tilbud af denne type inkluderer Unified Concept Editing in Diffusion Models (UCE); Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models (RECE); Mass Concept Erasure in Diffusion Models (MACE); og concept-Semi-Permeable structure is injected as a Membrane (SPM):

Den 2024-papir ‘Unified Concept Editing in Diffusion Models’ tilbød lukkede-form-redigeringer af opmærksomheds-vægte, der muliggjorde effektiv redigering af multiple koncepter i tekst-til-billede-modeller. Men holder metoden stand til kritik?
Selvom dette er en effektiv tilgang (hyperskala-samlinger som LAION er langt for store til at kurateres manuelt), er det ikke nødvendigvis en effektiv en: ifølge en ny amerikansk studie, fungerer ingen af de ovennævnte redigeringsprocedurer – som repræsenterer den nuværende tilstand i post-træning AI-model-modifikation – særlig godt.
Forfatterne fandt, at disse Koncept-Sletnings-Teknikker (CET’er) normalt kan omgås let, og at selv hvor de er effektive, har de betydelige bivirkninger:

Effekter af koncept-sletning på tekst-til-billede-modeller. Hver kolonne viser en prompt og det koncept, der er markeret til sletning, sammen med genererede outputs før og efter redigering. Hierarkier viser forælder-barn-relationer mellem koncepter. Eksemplerne fremhæver almindelige bivirkninger, herunder manglende sletning af under-koncepter, undertrykkelse af nærliggende koncepter, undgåelse gennem omskrivning og overførsel af slettede attributter til ikke-relaterede objekter. Kilde: https://arxiv.org/pdf/2508.15124
Forfatterne fandt, at de førende nuværende koncept-sletnings-teknikker ikke kan blokere sammensatte prompts (for eksempel, rød bil eller lille træ-møbel); ofte lader under-klasser glide igennem, selv efter at have slettet en over-kategori (såsom bil eller bus, der fortsat vises efter fjernelse af køretøj); og introducerer nye problemer, såsom attribut-lækage (hvor, for eksempel, sletning af blå sofa kunne få modellen til at generere ikke-relaterede objekter, såsom blå stol).
I over 80% af testtilfælde, slettede fjernelse af et bredt koncept, såsom køretøj, ikke modellens evne til at generere mere specifikke køretøj-eksempler, såsom biler eller busser.
Redigering, observerer artiklen, forårsager også, at opmærksomheds-kort (de dele af modellen, der bestemmer, hvor modellen skal fokusere i billedet) spredes, og svækker output-kvaliteten.
Interessant nok finder artiklen, at sletning af relaterede trænede koncepter én ad gangen fungerer bedre end at forsøge at fjerne dem alle på én gang – selvom det ikke fjerner alle svaghederne ved de studerede redigeringsmetoder:

Sammenligning af progressive og samtidige sletningsstrategier. Når alle varianter af ‘teddy-bjørn’ slettes samtidigt, fortsætter modellen med at generere bjørn-lignende objekter. Sletning af varianterne skridt for skridt er mere effektiv, og får modellen til at undertrykke målkonceptet mere pålideligt.
Selvom forskerne i øjeblikket ikke kan tilbyde nogen løsning på de problemer, som artiklen fremhæver, har de udviklet en ny dataset og benchmark, der kan hjælpe senere forskningsprojekter med at forstå, om deres egne ‘censurerede’ modeller fungerer, som forventet.
Artiklen fastslår:
‘Tidligere evalueringer har udelukkende afhængigt af en lille samling af mål- og bevare-klasser; for eksempel, når konceptet “køretøj” slettes, testes kun modellens evne til at generere køretøjer. Vi demonstrerer, at denne tilgang er fundamentalt utilstrækkelig, og at koncept-sletningsevaluering bør være mere omfattende for at omfatte alle relaterede under-koncepter, såsom “rød bil”.
‘Ved at introducere en divers dataset med sammensatte variationer og systematisk analysere effekter, såsom påvirkning af nærliggende koncepter, koncept-undgåelse og attribut-lækage, afslører vi betydelige begrænsninger og bivirkninger ved eksisterende CET’er.
‘Vores benchmark er model-agnostisk og let integrerbar og er ideelt egnet til at hjælpe med udviklingen af nye Koncept-Sletnings-Teknikker (CET’er).’

Selvom CET’er sletter målkonceptet ‘fugl’, fejler de på den sammensatte variant ‘rød fugl’ (top). Efter sletning af ‘blå sofa’ mister alle metoder også evnen til at generere en blå stol (bunden). Succesfulde resultater er markeret med et grønt tik-symbol, og fejl med et rødt ‘X’-symbol.
Studiet giver en interessant indsigt i, hvor meget koncepter, der er trænet ind i en modells latent rum, og hvor meget entanglement ikke vil tillade nogen form for definitiv og virkelig diskret koncept-sletning.
Den nye artikel hedder Side Effects of Erasing Concepts from Diffusion Models og kommer fra fire forskere fra University of Maryland.
Metode og Data
Forfatterne mener, at tidligere arbejder, der påstår at slette koncepter fra diffusion-modeller, ikke beviser påstanden tilstrækkeligt, og fastslår*:
‘Påstande om sletning kræver mere robust og omfattende evaluering. For eksempel, hvis konceptet, der skal slettes, er “køretøj”, skal under-koncepter, såsom “bil” og sammensatte koncepter, såsom “rød bil” eller “lille bil”, også slettes.
‘Dog er dette aspekt af koncept-hierarki og sammensætlighed ikke overvejet i eksisterende evalueringsskemaer, da de kun fokuserer på nøjagtigheden af det enkelte slettede koncept. [Forfatterne af EraseBench] vurderer, hvordan CET’er påvirker visuelt lignende og omskrevne koncepter (såsom “kat” og “killling”)[;] dog gør de ikke en udtømmende undersøgelse af hierarkiet og sammensætligheden af koncepter.’
For at give benchmark-data til fremtidige projekter oprettede forfatterne Side Effect Evaluation (SEE)-datasettet – en stor samling af tekst-prompts designet til at teste, hvor godt koncept-sletningsmetoder fungerer.
Promptene følger en simpel skabelon, hvor et objekt beskrives med attributter af størrelse, farve og materiale – for eksempel, et billede af en lille rød træ-bil.
Objekterne blev hentet fra MS-COCO-datasettet og organiseret i en hierarki af over-klasser, såsom køretøj, og under-klasser, såsom bil eller bus, med deres attribut-sammensætninger, der danner blad-noderne (det mest specifikke niveau i hierarkiet). Denne struktur gør det muligt at teste sletning på forskellige semantiske niveauer, fra brede kategorier til specifikke varianter.
Til at understøtte automatiseret evaluering blev hver prompt parret med et ja/nej-spørgsmål, såsom Er der en bil i billedet?, og også brugt som en klasse-mærke for billed-klassificeringsmodeller:

Prompt-kombinationer i SEE-datasettet genereret ved at variere størrelse-, farve- og materiale-attributter.
Til at måle, hvor godt hver koncept-sletningsmetode fungerede, udviklede forfatterne to scoringsmetoder: mål-nøjagtighed, der sporer, hvor ofte slettede koncepter stadig vises i de genererede billeder; og bevare-nøjagtighed, der sporer, om modellen fortsat kan generere materiale, der ikke skulle slettes.
Balancen mellem de to score skal afsløre, om metoden med held fjerner det forbudte koncept uden at skade modellens bredere output.
Forfatterne vurderede koncept-sletning over tre fejlmodi: først, en måling af, om fjernelse af et koncept, såsom køretøj, forstyrrer nærliggende eller ikke-relaterede koncepter, baseret på semantisk og attribut-lignende lignende; anden, en test for, om sletning kan omgås ved at prompte under-koncepter, såsom rød bil, efter at have slettet køretøj.
Til sidst blev der gennemført en kontrol for attribut-lækage, hvor attributter forbundet med slettede koncepter vises i andre dele af billedet (for eksempel, sletning af sofa kunne få en anden genstand, såsom en potteplante, til at arve dens farve eller materiale). Den endelige dataset indeholder 5056 sammensatte prompts
Tests
De tidligere rammer, der blev testet, var dem, der tidligere var nævnt – UCE, RECE, MACE og SPM. Forskerne antog standardindstillinger fra de oprindelige projekter og tilpassede alle modellerne på en NVIDIA RTX 6000 GPU med 48GB VRAM.
Stable Diffusion 1.4, en af de mest varige modeller i litteraturen, blev brugt til alle testene – måske ikke mindst, fordi de tidligste SD-modeller havde lidt eller ingen konceptuel begrænsning, og som sådan tilbyder en blank skive i denne forskningskontekst.
Hver af de 5056 prompts fra SEE-datasettet blev kørt gennem både den uredigerede og den redigerede version af modellen, genererende fire billeder per prompt ved hjælp af faste tilfældige seeds, hvilket muliggjorde test af, om sletningseffekterne forblev konsistente på tværs af multiple outputs. Hver redigeret model producerede i alt 20.224 billeder.
Tilstedeværelsen af bevarede koncepter blev vurderet i overensstemmelse med tidligere metoder for tekst-til-billede-sletningsprocedurer, ved hjælp af VQA-modellerne BLIP, QWEN 2.5 VL og Florence-2base.
Påvirkning af nærliggende koncepter
Den første test målte, om sletning af et koncept utilsigtet påvirkede nærliggende koncepter. For eksempel, efter at have fjernet bil, skulle modellen stoppe med at generere rød bil eller stor bil, men stadig være i stand til at generere relaterede koncepter, såsom bus eller lastbil, og ikke-relaterede, såsom gafl.
Analysen anvendte CLIP-indlejring-lignende og attribut-baseret redigering-afstand til at estimere, hvor tæt hvert koncept var på det slettede mål, hvilket muliggjorde en kvantificering af, hvor langt forstyrrelsen spredte sig:

Kombinerede resultater for mål-nøjagtighed (venstre) og bevare-nøjagtighed (højre) plotteret mod semantisk lignende (top) og sammensætnings-afstand (bunden). En ideal koncept-sletningsmetode ville vise lav mål-nøjagtighed og høj bevare-nøjagtighed på tværs af alle afstande; men resultaterne viser, at nuværende teknikker ikke kan generalisere renligt, med nærliggende koncepter, der enten ikke er tilstrækkeligt slettede eller urent forstyrrede.
Af disse resultater kommenterer forfatterne:
‘Alle CET’er fortsætter med at generere sammensatte eller semantisk fjerntliggende varianter af målet, på trods af sletningen, hvilket ideelt set ikke burde ske. Det er tydeligt, at UCE konsekvent opnår højere nøjagtighed end andre CET-metoder på [bevare-sættet], hvilket indikerer minimal utilsigtet påvirkning af semantisk relaterede koncepter.
‘I modsætning hertil opnår SPM den laveste nøjagtighed, hvilket tyder på, at dens redigeringsstrategi er mere modtagelig for koncept-lignende.’
Blandt de fire metoder, der blev testet, var RECE den mest effektive til at blokere målkonceptet. Dog, som vist i billedet ovenfor, fejlede alle metoderne med at undertrykke sammensatte varianter. Efter at have fjernet fugl, producerede modellen stadig billeder af en rød fugl, hvilket tyder på, at konceptet stadig var delvist intakt.
Fjernelse af blå sofa forhindrede også modellen i at generere en blå stol, hvilket indikerer skade på nærliggende koncepter.
RECE håndterede sammensatte varianter bedre end de andre, mens UCE gjorde en bedre job med at bevare relaterede koncepter.
Sletnings-invasion
Sletnings-undgåelses-testen vurderede, om modellerne stadig kunne generere under-klasser efter, at deres over-klassen var blevet fjernet. For eksempel, hvis køretøj var fjernet, testede testen, om modellen stadig kunne producere outputs, såsom cykel eller rød bil.
Promptene var rettet mod både direkte under-klasser og sammensatte varianter for at bestemme, om koncept-sletningsoperationen havde fjernet hele hierarkiet eller kunne omgås gennem mere specifikke beskrivelser:

Omringelse af slettede over-klasser gennem deres under-klasser og sammensatte varianter på Stable Diffusion v1.4, med højere nøjagtighed, der indikerer større undgåelse.
Den uredigerede model beholdt høj nøjagtighed på tværs af alle over-klasser, hvilket bekræftede, at den ikke havde fjernet nogen målkoncepter. Blandt CET’erne viste MACE den laveste undgåelse, og opnåede den laveste under-klassen-nøjagtighed i mere end halvdelen af de testede kategorier. RECE opførte sig også godt, især i tilbehør, sports og elektronik-grupperne.
I modsætning hertil viste UCE og SPM højere under-klassen-nøjagtighed, hvilket indikerer, at slettede koncepter let kunne omgås gennem relaterede eller indlejrede prompts.
Forfatterne bemærker:
‘[Alle] CET’er undertrykker med held det overordnede koncept (“mad”). Men når de promptes med attribut-baserede børn af mad-hierarkiet (f.eks. en stor pizza”), genererer alle metoder madvarer.
‘Lignende i kategori køretøj, genererer alle modeller cykler, på trods af at have fjernet “køretøj”.’
Attribut-lækage
Den tredje test, attribut-lækage, kontrollerede, om attributter forbundet med et slettede koncept vises i andre dele af billedet.
For eksempel, efter at have fjernet sofa, skulle modellen hverken generere en sofa eller anvende dens typiske attributter (såsom farve eller materiale) på ikke-relaterede objekter i samme prompt. Dette blev målt ved at prompte modellen med parrede objekter og undersøge, om de slettede attributter utilsigtet vises i bevarede koncepter:

Opmærksomheds-kort for attribut-token efter koncept-sletning. Venstre: Når ‘bænk’ fjernes, skifter token ‘træ’ til fuglen i stedet, hvilket resulterer i træ-fugle. Højre: Fjernelse af ‘sofa’ kan ikke undertrykke sofa-generering, mens token ‘stor’ er forkert tildelt doughnut.
RECE var den mest effektive til at slette mål-attributter, men introducerede også den mest attribut-lækage i bevarede prompts, overgående selv den uredigerede model. UCE lakkede mindre end andre metoder.
Resultaterne, foreslår forfatterne, indikerer nødvendigheden for en indre kompromis, hvor stærkere sletning øger risikoen for misrettet attribut-overførsel.
Konklusion
Det latente rum i en model fylder ikke op på en ordentlig måde under træning, med afledte koncepter, der deponeres pænt på hylder eller i arkivskabe; snarere er de trænede indlejninger både indhold og deres beholdere: ikke adskilt af nogen skarpe grænser, men snarere blander sig ind i hinanden på en måde, der gør fjernelse problematisk – som at forsøge at trække et pund kød ud uden nogen blodtab.
I intelligente og udviklende systemer er grundlæggende begivenheder – såsom at brænde fingre og derefter behandle ild med respekt – forbundet med de associationer, de senere danner, hvilket gør det vanskeligt at producere en model, der kan have været efterladt med konsekvenserne af et centralt, potentelt ‘forbudt’ koncept, men mangler dette koncept i sig selv.
* Min konvertering af forfatternes inline-citation til hyperlinks.
Først udgivet fredag, 22. august 2025












