Andersons vinkel
Censurering av AI-modeller fungerar inte bra, visar studie

Försök att censurera AI‑bildgeneratorer genom att radera förbjudet innehåll (såsom pornografi, våld eller upphovsrättsskyddade stilar) från de tränade modellerna misslyckas: en ny studie visar att nuvarande koncept‑raderingsmetoder tillåter att ”förbjudna” attribut läcker in i orelaterade bilder, och dessutom misslyckas de med att hindra nära besläktade versioner av det påstådda ”raderade” innehållet från att dyka upp.
Om företag som producerar grundläggande AI‑modeller inte kan förhindra att de missbrukas för att skapa oönskat eller olagligt material riskerar de att bli åtalade och/eller stängda ner. Omvänt befinner leverantörer som endast gör sina modeller tillgängliga genom ett API, som med Adobes Firefly-generativa motor, sig i en position där de inte behöver oroa sig för vad deras modeller kan skapa, eftersom både användarens prompt och det resulterande resultatet inspekteras och saneras:

Adobes Firefly‑system, som används i verktyg som Photoshop, vägrar ibland en generativ begäran omedelbart genom att blockera prompten innan något skapas. Andra gånger genererar det bilden men blockerar sedan resultatet efter granskning. Denna typ av avslag mitt i processen kan också ske i ChatGPT, när modellen påbörjar ett svar men avbryter det efter att ha upptäckt ett policybrott – och ibland kan man kortvarigt se den avbrutna bilden under processen.
Dock kan filter av den här typen som är API‑baserade vanligtvis neutraliseras av användare på lokalt installerade modeller, inklusive vision‑language‑modeller (VLM) som användaren kan vilja anpassa genom lokal träning på egen data.
I de flesta fall är det trivialt att inaktivera sådana operationer, det räcker med att kommentera ut ett funktionsanrop i Python (även om sådana hack vanligtvis måste upprepas eller uppfinna på nytt efter ramverksuppdateringar).
Ur ett affärsperspektiv är det svårt att förstå hur detta skulle kunna vara ett problem, eftersom ett API‑tillvägagångssätt maximerar företagets kontroll över användarens arbetsflöde. Ur användarens perspektiv kan dock både kostnaden för enbart API‑modeller och risken för felaktig eller överdriven censur sannolikt driva dem till att ladda ner och anpassa lokala installationer av öppna källkods‑alternativ – åtminstone där FOSS‑licensen är fördelaktig.
Den senaste betydande modellen som släpptes utan något försök att inpränta själv‑censur var Stable Diffusion V1.5, för nästan tre år sedan. Senare avslöjades att dess träningskorpusar innehöll CSAM‑data, vilket ledde till ökande krav på att förbjuda dess tillgänglighet, och dess borttagning från Hugging Face‑arkivet 2024.
Klipp bort det!
Cyniker hävdar att ett företags intresse av att censurera lokalt installerbara generativa AI‑modeller enbart grundas på oro om juridiskt ansvar, om deras ramverk blir offentliga för att underlätta olagligt eller oönskat innehåll.
Faktiskt är vissa ‘lokal‑vänliga’ öppna källkodsmodeller inte så svåra att avcensurera (såsom Stable Diffusion 1.5 och DeepSeek R1).
I kontrast till detta var den senaste lanseringen av Black Forest Labs Flux Kontext‑modellsserie kännetecknad av företagets anmärkningsvärda åtagande att censurera hela Kontext‑sortimentet. Detta uppnåddes både genom noggrann datakuration och genom riktad finjustering efter träning, avsedd att ta bort eventuella kvarvarande tendenser mot NSFW‑ eller förbjudet innehåll.
Det är här forskningsfältets tyngdpunkt har legat under de senaste 2–3 åren: på att i efterhand korrigera modeller vars träningsdata inte har granskats och valts ut tillräckligt noggrant. Exempel på sådana metoder är Enhetlig begreppsredigering i diffusionsmodeller (UCE); Tillförlitlig och effektiv borttagning av begrepp i text-till-bild-diffusionsmodeller (RECE); Borttagning av många begrepp i diffusionsmodeller (MACE); samt En semipermeabel struktur för begrepp införs som ett membran (SPM):

Den 2024‑åriga artikeln ‘Unified Concept Editing in Diffusion Models’ erbjöd slutna formredigeringar av uppmärksamhetsvikter, vilket möjliggör effektiv redigering av flera koncept i text‑till‑bild‑modeller. Men håller metoden måttet? Källa: https://arxiv.org/pdf/2308.14761
Även om detta är ett effektivt tillvägagångssätt (hyperskala‑samlingar såsom LAION är alltför stora för manuell kurering), är det inte nödvändigtvis ett verkningsfullt: enligt en ny amerikansk studie fungerar ingen av de ovan nämnda redigeringsprocedurerna – som representerar state‑of‑the‑art inom efter‑träning‑modifiering av AI‑modeller – särskilt bra.
Författarna fann att dessa Concept Erasure Techniques (CETs) vanligtvis kan kringgås enkelt, och att även när de är effektiva har de betydande bieffekter:

Effekter av konceptradering på text‑till‑bild‑modeller. Varje kolumn visar en prompt och det koncept som markerats för radering, tillsammans med genererade resultat före och efter redigering. Hierarkier indikerar förälder‑barn‑relationer mellan koncept. Exemplen belyser vanliga bieffekter, inklusive misslyckande att radera barnkoncept, undertryckning av närliggande koncept, undvikande genom omformulering och överföring av raderade attribut till orelaterade objekt. Källa: https://arxiv.org/pdf/2508.15124
Författarna fann att de ledande nuvarande konceptraderingsmetoderna misslyckas med att blockera kompositionella prompts (t.ex. röd bil eller liten trädgårdsmöbel); ofta låter underklasser glida igenom även efter att en föräldrakategori raderats (såsom bil eller buss som fortsätter att dyka upp efter att fordon tagits bort); och introducerar nya problem som attributläckage (där exempelvis radering av blå soffa kan få modellen att generera orelaterade objekt som blå stol).
I över 80 % av testfallen stoppade raderingen av ett brett koncept som fordon inte modellen från att generera mer specifika fordons-instanser såsom bilar eller bussar.
Redigering, observerar artikeln, får också uppmärksamhetskartor (de delar av modellen som bestämmer var fokus ska ligga i bilden) att spridas, vilket försvagar utdatakvaliteten.
Intressant nog finner artikeln att radering av relaterade tränade koncept ett i taget fungerar bättre än att försöka ta bort dem alla på en gång – även om det inte eliminerar alla brister i de studerade redigeringsmetoderna:

Jämförelse av progressiva och samtidiga raderingsstrategier. När alla varianter av ‘teddy bear’ raderas samtidigt fortsätter modellen att generera björnliknande objekt. Att radera varianterna steg för steg är mer effektivt och får modellen att undertrycka målkonceptet mer pålitligt.
Även om forskarna för närvarande inte kan erbjuda någon lösning på de problem som artikeln beskriver, har de utvecklat en ny dataset och benchmark som kan hjälpa framtida forskningsprojekt att förstå huruvida deras egna ‘censurerade’ modeller fungerar som förväntat.
Artikeln konstaterar:
‘Tidigare utvärderingar har förlitat sig enbart på en liten uppsättning mål‑ och bevaringsklasser; till exempel, när man raderar “bil” testas endast modellens förmåga att generera bilar. Vi visar att detta tillvägagångssätt är fundamentalt otillräckligt och att utvärdering av konceptradering bör vara mer omfattande för att omfatta alla relaterade underkoncept såsom “röd bil”.’
‘Genom att introducera en mångsidig dataset med kompositionella variationer och systematiskt analysera effekter såsom påverkan på närliggande koncept, konceptundvikande och attributläckage, avslöjar vi betydande begränsningar och bieffekter av befintliga CETs.’
‘Vår benchmark är modellagnostisk, lätt integrerbar och är idealisk för att stödja utvecklingen av nya Concept Erasure Techniques (CETs).’

Även om CETs raderar målkonceptet ‘bird’, misslyckas de med den kompositionella varianten ‘red bird’ (ovan). Efter att ha raderat ‘blue couch’ förlorar alla metoder även förmågan att generera en blå stol (nedan). Lyckade resultat markeras med en grön bock, och misslyckanden med ett rött ‘X’-symbol.
Studien ger en intressant insikt i hur starkt koncepten som tränats in i en modells latent space är sammanflätade, och i vilken grad entanglement inte enkelt tillåter någon form av definitiv och verkligt diskret konceptradering.
Den nya artikeln heter Side Effects of Erasing Concepts from Diffusion Models och kommer från fyra forskare vid University of Maryland.
Metod och data
Författarna menar att tidigare verk som påstår sig radera koncept från diffusion‑modeller inte bevisar påståendet tillräckligt, och konstaterar*:
‘Påståenden om radering kräver en mer robust och omfattande utvärdering. Till exempel, om konceptet som ska raderas är ‘vehicle’, bör underkoncept som ‘car’ och kompositionella koncept som ‘red car’ eller ‘small car’ också raderas.
‘Ändå beaktas inte detta aspekt av koncepthierarki och kompositionalitet i befintliga utvärderingsprotokoll, eftersom de endast fokuserar på noggrannheten för det enskilda raderade konceptet. [The authors of EraseBench] bedömer hur CETs påverkar visuellt liknande och parafraserade koncept (såsom ‘cat’ och ‘kitten’)[;] men de undersöker inte uttömmande hierarkin och kompositionaliteten hos koncepten.’
För att tillhandahålla benchmarkdata för framtida projekt skapade författarna Side Effect Evaluation (SEE)-datasetet – en stor samling textpromptar avsedda att testa hur väl metoder för konceptradering fungerar.
Promptarna följer en enkel mall där ett objekt beskrivs med attributen storlek, färg och material – till exempel, en bild av en liten röd trärabattbil.
Objekt hämtades från MS-COCO-datasetet och organiserades i en hierarki av superklasser såsom vehicle samt underklasser såsom car eller bus, där deras attributkombinationer bildar lövknutarna (den mest specifika nivån i hierarkin). Denna struktur möjliggör test av radering på olika semantiska nivåer, från breda kategorier till specifika varianter.
För att stödja automatiserad utvärdering paras varje prompt med en ja‑eller‑nej‑fråga, såsom Finns det en bil i bilden?, och används även som en klassetikett för bildklassificeringsmodeller:

Promptkombinationer i SEE-datasetet genererade genom att variera attributen storlek, färg och material.
För att mäta hur väl varje metod för konceptradering presterar utvecklade författarna två poängsättningsmetoder: Målnoggrannhet, som spårar hur ofta raderade koncept fortfarande förekommer i de genererade bilderna; och Bevarandnoggrannhet, som spårar om modellen fortsätter att generera material som inte skulle ha raderats.
Balansen mellan de två poängen är avsedd att visa om metoden framgångsrikt tar bort det förbjudna konceptet utan att skada modellens bredare output.
Författarna utvärderade konceptradering över tre felmoder: först ett mått på huruvida borttagning av ett koncept såsom car stör närliggande eller orelaterade koncept, baserat på semantisk och attributlikhet; för det andra ett test på huruvida radering kan kringgås genom att prompta underkoncept såsom red car efter att ha raderat vehicle.
Slutligen genomfördes en kontroll för attributläckage, där egenskaper kopplade till raderade koncept dyker upp i orelaterade objekt (till exempel kan borttagning av couch få ett annat objekt, såsom en potted plant, att ärva dess färg eller material). Det slutgiltiga datasetet innehåller 5056 kompositionella promptar.
Tester
De tidigare testade ramverken var de som listades tidigare – UCE, RECE, MACE och SPM. Forskarna använde standardinställningarna från de ursprungliga projekten och finjusterade alla modeller på ett NVIDIA RTX 6000‑GPU med 48 GB VRAM.
Stable Diffusion 1.4, en av de mest bestående modellerna i litteraturen, användes för alla tester – kanske inte minst eftersom de tidigaste SD-modellerna hade liten eller ingen konceptuell begränsning och därmed erbjuder en ren tavla i detta specifika forskningssammanhang.
Varje av de 5056 promptarna från SEE-datasetet kördes genom både den oredigerade och den redigerade versionen av modellen, vilket genererade fyra bilder per prompt med fasta random seeds, vilket möjliggjorde test av huruvida raderingseffekterna förblev konsistenta över flera utdata. Varje redigerad modell producerade totalt 20 224 bilder.
Förekomsten av bevarade koncept utvärderades enligt tidigare metoder för text‑till‑bild‑raderingsprocedurer, med hjälp av VQA-modellerna BLIP, QWEN 2.5 VL och Florence-2base.
Påverkan på närliggande koncept
Det första testet mätte huruvida radering av ett koncept oavsiktligt påverkade närliggande koncept. Till exempel, efter att ha tagit bort car bör modellen sluta generera red car eller large car, men fortfarande kunna generera relaterade koncept såsom bus eller truck, samt orelaterade som fork.
Analysen använde CLIP-inbäddningslikhet och attributbaserat redigeringsavstånd för att uppskatta hur nära varje koncept var det raderade målet, vilket gjorde det möjligt för studien att kvantifiera hur långt störningen spred sig:

Kombinerade resultat för målprecision (vänster) och bevarad precision (höger) plottade mot semantisk likhet (upp) och kompositionell avstånd (ned). En idealisk metod för konceptradering skulle visa låg målprecision och hög bevarad precision över alla avstånd; men resultaten visar att nuvarande tekniker misslyckas med att generalisera rent, där närmare koncept antingen raderas otillräckligt eller störs oproportionerligt.
Av dessa resultat kommenterar författarna:
‘Alla CET:er fortsätter att generera kompositionella eller semantiskt avlägsna varianter av målet trots raderingen, vilket idealt sett inte bör ske. Det är tydligt att UCE konsekvent uppnår högre precision än andra CET-metoder på [preserve set], vilket indikerar minimal oavsiktlig påverkan på semantiskt relaterade koncept.’
‘I kontrast uppnår SPM den lägsta precisionen, vilket tyder på att dess redigeringsstrategi är mer mottaglig för konceptlikhet.’
Bland de fyra testade metoderna var RECE mest effektiv för att blockera målkonceptet. Men, som visas i bildens vänstra sida ovan, misslyckades alla metoder med att undertrycka kompositionella varianter. Efter att ha raderat bird producerade modellen fortfarande bilder av en röd fågel, vilket tyder på att konceptet förblev delvis intakt.
Att ta bort blue couch hindrade också modellen från att generera en blue chair, vilket indikerar skada på närliggande koncept.
RECE hanterade kompositionella varianter bättre än de andra, medan UCE gjorde ett bättre jobb med att bevara relaterade koncept.
Raderingsintrång
Raderingsundvikandetestet utvärderade om modeller fortfarande kunde generera underklasskoncept efter att deras överklass hade raderats. Till exempel, om vehicle togs bort, kontrollerade testet om modellen fortfarande kunde producera resultat såsom bicycle eller red car.
Promptarna riktade sig både mot direkta underklasser och kompositionella varianter för att avgöra om konceptraderingsoperationen verkligen hade tagit bort hela hierarkin eller kunde kringgås genom mer specifika beskrivningar:

På Stable Diffusion v1.4, kringgående av raderade superklasser genom deras underklasser och kompositionella varianter, där högre precision indikerar större undvikande.
Den oredigerade modellen behöll hög precision över alla superklasser, vilket bekräftar att den inte hade tagit bort några målkoncept. Bland CET:erna visade MACE minst undvikande, med den lägsta underklassprecisionen i mer än hälften av de testade kategorierna. RECE presterade också bra, särskilt i accessory, sports och electronic-grupperna.
I kontrast visade UCE och SPM högre underklassprecision, vilket indikerar att raderade koncept lättare kunde kringgås genom relaterade eller nästlade promptar.
Författarna noterar:
‘[All] CET:er undertrycker framgångsrikt mål-superklasskonceptet (“food”). Men när man promptas med attributbaserade barn till mat-hierarkin (t.ex. en stor pizza”), genererar alla metoder matvaror.
‘Liknande i vehicle kategori, alla modeller genererar cyklar, trots att “vehicle” raderats.’.
Attributläckage
Det tredje testet, attributläckage, kontrollerade om egenskaper kopplade till ett raderat koncept dök upp i andra delar av bilden.
Till exempel, efter att ha raderat couch bör modellen varken generera en soffa eller applicera dess typiska attribut (såsom färg eller material) på orelaterade objekt i samma prompt. Detta mättes genom att prompta modellen med parade objekt och undersöka om de raderade attributen felaktigt dök upp i bevarade koncept:

Uppmärksamhetskartor för attributtoken efter konceptradering. Vänster: När ‘bench’ raderas, flyttas token ‘wooden’ till fågeln istället, vilket resulterar i trädiga fåglar. Höger: Radering av ‘couch’ misslyckas med att undertrycka soffgenerering, medan token ‘large’ felaktigt tilldelas munk.
RECE var den mest effektiva för att radera målattribut, men introducerade också den största attributläckaget i bevarade prompts, vilket överträffade även den oredigerade modellen. UCE läckte mindre än andra metoder.
Resultaten, föreslår författarna, indikerar behovet av en inneboende avvägning, där starkare radering ökar risken för felriktad attributöverföring.
Slutsats
Modellens latenta rum fylls inte på ett ordnat sätt under träning, med avledda koncept prydligt placerade på hyllor eller i arkivskåp; snarare är de tränade inbäddningarna både innehållet och deras behållare: de är inte separerade av några tydliga gränser, utan smälter samman på ett sätt som gör borttagning problematisk – som att försöka extrahera ett pund kött utan någon blodförlust.
I intelligenta och utvecklande system är grundläggande händelser – såsom att bränna sig på fingrarna och därefter behandla eld med respekt – inbäddade i de beteenden och associationer de senare bildar, vilket gör det svårt att skapa en modell som kan ha behållit korollarerna till ett centralt, potentiellt ‘förbjudet’ koncept, men saknar själva konceptet.
* Min konvertering av författarnas inline-citation till hyperlänkar.
Först publicerad fredag 22 augusti 2025












