Andersons vinkel

Riskerna med “vibe”-baserad bildannotering

mm
Lägg till Unite.AI bland dina föredragna källor på Google
A patron in the museum of banned artifacts. SDXL; Flux; Flux.1 Kontext; Firefly.

Även om de bara betalas ett par dollar (eller ingenting alls), kan de okända personer som utvärderar bilder för “skadligt” innehåll förändra ditt liv med de val de gör. Nu verkar en ny stor artikel från Google föreslå att dessa annotatorer skapar sina egna regler för vad som är eller inte är “skadligt” eller stötande – oavsett hur bisarra eller personliga deras reaktioner på en bild kan vara. Vad kan gå fel?

 

Åsikt Den här veckan presenterade ett nytt samarbete mellan Google Research och Google Mind en artikel med inte mindre än 13 medförfattare som utforskar om “instinktiva känslor” hos bildannotatorer bör beaktas när människor bedömer bilder för algoritmer, även om deras reaktioner inte överensstämmer med etablerade bedömningsstandarder.

Detta är viktigt för dig, eftersom det som bedömare och annotatorer finner stötande enligt konsensus kommer att tendera att bli inskrivet i automatiska censur- och modereringssystem, och i kriterierna för “obskont” eller “oacceptabelt” material, i lagstiftning som den nya NSFW-brandväggen* i Storbritannien (en version av vilken kommer till Australien snart), och i innehållsbedömningssystem på sociala medieplattformar, bland andra miljöer.

Ju bredare kriterierna för stötande innehåll är, desto bredare blir den potentiella censuren.

Vibe-censur

Det är inte den enda ståndpunkten den nya artikeln har att erbjuda; den visar också att människor som bedömer bilder ofta är mer censurbenägna mot vad de tror kan stöta andra människor förutom sig själva; och att lågkvalitetsbilder ofta väcker säkerhetsbekymmer, trots att bildkvalitet inte har något att göra med bildinnehåll.

Vid artikeln slutsats betonar den dessa två resultaten, som om artikelns centrala ståndpunkt hade misslyckats, men forskarna var tvungna att publicera ändå.

Även om detta inte är en ovanlig situation, ger artikeln, vid noggrann läsning, en mer illavarslande underström: att annoteringspraxis kan överväga att anta vad jag bara kan beskriva som vibe-annotering:

‘Våra resultat visar att befintliga ramverk måste ta hänsyn till subjektiva och kontextuella dimensioner, såsom emotionella reaktioner, implicita bedömningar och kulturella tolkningar av skada. Annotatorernas frekventa användning av emotionell språk och deras avvikelse från fördefinierade skadelabeler betonar luckor i nuvarande utvärderingspraxis.

‘Att utöka annoteringsriktlinjerna till att omfatta illustrativa exempel på olika kulturella och emotionella tolkningar kan hjälpa till att åtgärda dessa luckor.’

Den knapphändigt illustrerade nya artikeln inleds med exempel som är otvetydiga och sympatiska för den genomsnittlige läsaren, även om det faktiska kärnmaterialet är långt mer tvetydigt och inbjuder till många fler frågor. Här, under varje bild, ser vi annotatorernas emotionella reaktioner angivna för respektive bild. Källa: https://arxiv.org/pdf/2507.16033

Den knapphändigt illustrerade nya artikeln inleds med exempel som är otvetydiga och sympatiska för den genomsnittlige läsaren, även om det faktiska kärnmaterialet inbjuder till många fler frågor. Här, under varje bild, ser vi annotatorernas emotionella reaktioner angivna för respektive bild. Källa: https://arxiv.org/pdf/2507.16033

Till en början låter detta som ett förslag att utöka och bättre kvantifiera vad som utgör “skada” i en bild – ett berömvärt företag; men artikeln upprepar flera gånger att detta varken är önskvärt eller (nödvändigtvis) genomförbart:

‘Våra resultat visar att befintliga ramverk måste ta hänsyn till subjektiva och kontextuella dimensioner, såsom emotionella reaktioner, implicita bedömningar och kulturella tolkningar av skada. Annotatorernas frekventa användning av emotionell språk och deras avvikelse från fördefinierade skadelabeler betonar luckor i nuvarande utvärderingspraxis.

‘Att utöka annoteringsriktlinjerna till att omfatta illustrativa exempel på olika kulturella och emotionella tolkningar kan hjälpa till att åtgärda dessa luckor […]

‘[…] Processen varigenom annotatorer resonerar om tvetydiga bilder ofta reflekterar deras personliga, kulturella och emotionella perspektiv, som är svåra att skapa ramverk för eller standardisera.’

Det är svårt att se hur ‘Att utöka annoteringsriktlinjerna till att omfatta illustrativa exempel på olika kulturella och emotionella tolkningar’ kan passa in i ett rationellt bedömningssystem; författarna kämpar för att förtydliga denna punkt, eller för att formulera en distinkt teori, attackerar materialet många gånger, men lyckas aldrig bemästra det. I detta avseende verkar artikelns centrala tema själv vara “vibe”-genererat, även om det behandlar otouchbara psykologier.

Rent uttryckt verkar det för mig som att utöka annoteringspipelinen till att omfatta kriterier av detta slag potentiellt tillåter “avbokning” eller förvrängning av allt material (eller en klass av ämnen) som en annotator kan reagera starkt på.

Binär bedömning

I vilken utsträckning bilder och text kan orsaka skada är svårt att kvantifiera, inte minst för att högkultur ofta skär över “låg” kultur (till exempel med konst och romaner), vilket leder till de tidigaste “vibe”-baserade censurkriterierna: att även om obscen material undgår exakt definition, kommer du att veta det när du ser det.

Under den nya artikeln omfattande och utforskande diskussion om empati och kvalitativ nyans, verkar arbetet tyst attackera auktoriteten hos de centraliserade, standardiserade taxonomierna (“våld”, “nakenhet”, “hat”, etc.) som låter plattformar implementera och skala moderering med acceptabla felmarginaler (vanligtvis).

Argumentet som framkommer är att endast decentraliserad, subjektiv, kontextmedveten mänsklig återkoppling kan ordentligt bedöma GenAI-utdata.

Detta är dock uppenbarligen inte skalbart, eftersom du inte kan köra en triljardbildsfilterpipeline på “vibbar” och livserfarenhet. Man måste kvantifiera skada till olika egenskaper; ange en gräns för omfattningen av det resulterande filter-systemet; och vänta på nya direktiv i “gränsfall” (liksom kränkta parter ibland måste vänta på införandet av nya lagar som hanterar deras specifika omständigheter).

I stället presenterar den nya artikeln ett tyst mandat för en automatiserad modereringspipeline som utökar sin omfattning automatiskt, och felar så långt på försiktighetens sida att till och med den mest specifika och icke-repeterbara reaktionen från en annotator kunde bestraffa en bild som inte har stört någon annan.

Moralisk expansion

Även om artikeln lutar mot utforskning snarare än att ta en fast ståndpunkt, inkorporerar den element av vetenskaplig metod: författarna utvecklade ett ramverk för att identifiera (om än inte strikt mäta) en bredare spektrum av annotatorsreaktioner på bilder, och för att undersöka hur dessa reaktioner varierar över kön och andra demografiska faktorer.

Förutom testernas analys av skadefokus†, analyserade processen “moraliskt resonemang” i testdeltagarnas bifogade kommentarer, som ombads att annotera en modifierad testdataset som innehöll bilder och associerade texter.

Denna “moralisk sentiment-automat” var utformad för att fånga de moraliska värdena Omsorg, Jämlikhet, Proportionalitet, Lojalitet, Auktoritet och Renhet, som definierats i Moraliska grunder-teorin – en psykologisk teori som, på grund av sin flytande och utvecklande natur, är motsatt skapandet av de konkreta definitioner som krävs för storskaliga mänskliga bedömningssystem.

Informeras av denna teori, kategoriserades ytterligare dimensioner av säkerhet av författarna, inklusive rädsla, ilska, sorg, avsmak, förvirring och otäckhet.

Författarna utvecklar om den första av dessa, rädsla:

‘Många annotatorer använde termer som “skrämmande” (t.ex. för förvridna ansikten eller bilder som föreslog våld som en pistol riktad mot ett barn), “störande” (t.ex. “Absolut vidrigt att se någon bli påkörd, mycket störande och störande”, eller “Störande och ser ut som blod” för röd färg), eller “oroande” (t.ex. “Bildens distorsioner… Jag finner det motbjudande eftersom det verkar som att pojken leker på fel sida av rälsen”).

‘[Den grafiska figuren nedan] kvantifierar “rädsla” som den mest frekvent nämnda emotionen (233 nämnanden medan nästan hälften av dessa nämnanden är associerade med våldsamt innehåll, innehållet som anses inte vara skadligt väckte också den näst högsta nämnandet av rädsla).’

Fördelning av emotionella termer över skadekategorier, med stapelhöjder som indikerar proportioner av kommentarer, räkningar som visas inom staplarna och totala kommentarräkningar som visas ovan varje kategori.

Fördelning av emotionella termer över skadekategorier, med stapelhöjder som indikerar proportioner av kommentarer, räkningar som visas inom staplarna och totala kommentarräkningar som visas ovan varje kategori.

Vad gäller införandet av dessa nya dimensioner av säkerhet, skriver författarna:

‘Dessa framväxande teman betonar ett kritiskt behov av att berika AI-bildutvärderingsramverk genom att integrera subjektiva, emotionella och perceptuella element.’

Detta kan vara en farlig väg att gå, eftersom det verkar tillåta annoteringsprocesser att godtyckligt lägga till regler baserat på reaktioner som material kan väcka hos en enskild annotator, snarare än att kräva att alla annotatorer följer etablerade standarder och benchmarkvärden.

Om man kunde tillskriva en ekonomisk imperativ till denna idé, är det att denna metod tillåter hyperskala mänsklig annotering, där processen är friktionsfri, deltagarna är självreglerande och där de själva bestämmer vad reglerna och gränserna är.

Under standardannotering är reglerna framkomna genom mänsklig konsensus och följs av mänskliga annotatorer; under den scenario som beskrivs i artikeln är den initiala övervakningsnivån antingen borttagen eller nedgraderad: i princip skulle varje bild som kan orsaka något som helst störande för någon människa flaggas (inte minst, kanske, för att konsensus är dyrt såväl som tidskrävande).

Rorschach-bedömningar

Avsikten med annotering är att komma fram till en korrekt beskrivning eller definition antingen genom expertövervakning, allmän konsensus bland flera annotatorer eller (idealt) båda. I stället för att utöka en begränsad men väldefinierad hierarki av skador till en “intuitiv” och högt personlig tolkningsståndpunkt, är det likvärdigt med att annotera en Rorschach-test.

Till exempel, noterar artikeln, tolkade vissa annotatorer dålig bildkvalitet (såsom JPEG-artefakter, samt meningslösa tekniska fel i en bild) som ‘störande’ eller ‘indikativt för skada’:

‘Detta inträffade trots att uppgiften utelämnade instruktioner om bildkvalitet. Dessutom tolkade annotatorerna dessa kvalitetsartefakter som semantiskt meningsfulla.

‘En annotator kommenterade: “Bilden är inte skadlig alls; han har bara en lite förvriden uppsyn.” På samma sätt tolkade vissa annotatorer bildkvalitetsartefakter som avsiktlig skada, och tillskrev emotionell mening åt glapp.

Genom att höja subjektiva, emotionella eller kontextspecifika reaktioner över fördefinierade säkerhetskategorier, öppnar idéerna som presenteras här dörren till ett system där allt kan godtyckligt flaggas som skadligt, och där en “kylnings-effekt” av ad hoc-nedtagningar eller negativ omkategorisering av material (d.v.s. material som kan “stöta” en speciell intressegrupp) blir en verklig möjlighet.

 

 

Artikeln “Just a strange pic”: Evaluating ‘safety’ in GenAI Image safety annotation tasks from diverse annotators’ perspectives är tillgänglig på Arxiv.

* En genväg, eftersom det inte är det centrala ämnet här; under den nya lagstiftningen förväntas störande webbplatser antingen polisa sig själva; införa komplexa och dyra gransknings-system och ålderskontrollstekniker som är otillgängliga för alla utom de största webbplatserna; eller blockera sina domäner från brittiska publik (igen, på egen bekostnad).

† Uttryckt enkelt i “tänk på barnen”-memet, som satiriserar tillägnandet av en annan persons moraliska agent för tydligen altruistiska syften.

 

Publicerad första gången fredagen den 25 juli 2025

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai