Andersons vinkel

“Den ‘Ladda ner fler etiketter!’-illusionen i AI-forskning”

mm
Lägg till Unite.AI bland dina föredragna källor på Google
ChatGPT-4o: 'A wall on which hundreds of photographs are stuck with thumb-tacks. Each photo depicts a different kind of subject, such as fruit or animals or bridges or buildings or people, etc. Each photo has 2-3 yellow post-it notes attached to it. We are too far away to read anything written on the post-it notes, but we can see that there are dozens and dozens of photos on the wall, and each with several post-it notes tacked on.'

En vanlig uppfattning inom nuvarande maskinlärningsforskning är att maskinlärning själv kan användas för att förbättra kvaliteten på AI-datasettsannoteringar – särskilt bildtexter avsedda för användning i vision-språkmodeller (VLM). Denna tankegång drivs av den höga kostnaden för mänsklig annotering och den tillkommande bördan av att övervaka annotatörens prestation.

Detta kan ses som den AI-ekvivalenten till den tidiga 2000-talets ‘ladda ner mer RAM’-meme, som satiriserade föreställningen att en hårdvarubegränsning kunde lösas med en mjukvarubaserad lösning.

Det är också ett underbedömt problem; medan nya AI-modeller får stor uppmärksamhet i både offentliga och kommersiella sfärer, verkar annotering ofta vara en trivial detalj i maskinlärningspipelinen, överskuggad av upphetsningen kring bredare ramverk.

I själva verket är maskinlärningssystemens förmåga att känna igen och reproducera mönster (det centrala användningsfallet för nästan alla AI-system) beroende av kvaliteten och konsekvensen hos verkliga annoteringar – etiketter och fraser som skapas eller bedöms av verkliga människor, ofta med subjektiva bedömningar om enskilda datapunkter i icke-ideala omständigheter.

Oundvikligen kan system som syftar till att observera och reproducera mönster i annotatörens beteende (och därmed ersätta mänskliga annotatörer och underlätta korrekt märkning i stor skala) inte hoppas på att fungera bra på data inte innehållna i exemplen från mänskliga observatörer. Ingenting “likt” är riktigt detsamma, och tvärdomän-ekvivalens förblir ett problematiskt företag inom datavisualisering.

“Upstream data-buck” måste sluta någonstans, och i det här fallet är det exakt där det slutar – med en mänsklig hjärna som gör någon form av subjektiv distinktion för att kodifiera data för ett artificiellt system.

RAG-branschen

Fram till nyligen sågs de felaktigheter som uppstod från underkuraterade dataset-annoteringar kanske som acceptabelt kollateralskada i sammanhanget med de ofullkomliga men fortfarande marknadsbara resultaten från generativa AI-system.

Verkligen, bara i år drog en studie från Singapore slutsatsen att hallucinationer – dvs. tillfällena när AI-systemen uppfinner saker som undergräver våra avsikter – är oundvikliga och bundna till den konceptuella arkitekturen i sådana system.

För att motverka detta blir RAG-baserade agenter – som kan “verifiera” fakta genom internet-sökningar – allt mer populära i forskning och tillämpade kommersiella lösningar. Men de ökar resurskostnaden och fördröjer svaren; dessutom kan ny information som tillämpas på en tränad modell inte konkurrera med de mer invecklade och djupt sammanflätade anslutningarna som kännetecknar de naturliga lagren i en tränad modell.

Det vore därför bättre om annoteringsdata som informerar dessa modeller var avsevärt mindre felaktiga från början, även om de inte kan vara perfekta (inte minst för att denna aktivitet intränger i området för mänsklig subjektivitet).

RePOPE

En ny rapport från Tyskland belyser de problem som uppstår från att förlita sig på äldre, allmänt använda dataset, med fokus på särskilt noggrannhet och tillförlitlighet hos deras bildtexter. Forskarnas slutsatser tyder på att etikettfel i benchmark kan dölja eller missrepresentera hallucination i vision-språkmodeller.

Från den nya rapporten, några exempel där de ursprungliga bildtexterna inte kunde korrekt identifiera objekt i MSCOCO-datasetet av bilder. Forskarnas manuella revision av POPE-benchmark-datasetet åtgärdar dessa brister, och visar på kostnaden av att spara pengar på annoteringskurering. Källa: https://arxiv.org/pdf/2504.15707

Från den nya rapporten, några exempel där de ursprungliga bildtexterna inte kunde korrekt identifiera objekt i MSCOCO-datasetet av bilder. Forskarnas manuella revision av POPE-benchmark-datasetet åtgärdar dessa brister, och visar på kostnaden av att spara pengar på annoteringskurering. Källa: https://arxiv.org/pdf/2504.15707

Tänk er att en modell visas en bild av en gatuscen och tillfrågas om det finns en cykel i den. Modellen svarar ja. Om benchmark-datasetet säger att det inte finns någon cykel, markeras modellen som fel. Men om en cykel tydligt syns i bilden och bara missades under annotering, då var modellens svar korrekt, och benchmarken har misslyckats. Fel som dessa kan ackumuleras över ett dataset, vilket ger en förvriden bild av vilka modeller som är korrekta och vilka som är benägna till hallucination.

Således, när felaktiga eller tvetydiga annoteringar behandlas som grundfakta, kan modeller tyckas hallucinera när de är korrekta, eller också verka korrekta när de inte är det, vilket förvrider både mätningen av hallucination och rangordningen av modellprestanda, och gör det svårare att diagnostisera eller åtgärda problemet med säkerhet.

Den nya rapporten återbesöker en allmänt använd benchmark som kallas Polling-based Object Probing Evaluation (POPE), som testar om vision-språkmodeller kan korrekt säga vad som är eller inte är i en bild.

POPE baseras på etiketter från den inflytelserika Microsoft COCO: Common Objects in Context (MSCOCO)-datasetet, en samling av annoterade bilder som länge har behandlats som att erbjuda en god nivå av annoteringsnoggrannhet.

POPE utvärderar objekt-hallucination i stora vision-språkmodeller genom att omforma problemet till en binär klassificeringsuppgift. Istället för att tolka genererade bildtexter, ställer systemet enkla ja/nej-frågor till modellen om huruvida specifika objekt är närvarande i en bild, med hjälp av mallar som ‘Finns det ett <objekt> i bilden?’.

Exempel på objekt-hallucination i vision-språkmodeller. Fetstilta etiketter indikerar objekt som markerats som närvarande i de ursprungliga annoteringarna, medan röda etiketter visar objekt som hallucinerats av modellerna. Det vänstra exemplet reflekterar en traditionell instruktionsbaserad utvärdering, medan de tre exemplen till höger är hämtade från olika POPE-benchmark-varianter. Källa: https://aclanthology.org/2023.emnlp-main.20.pdf

Exempel på objekt-hallucination i vision-språkmodeller. Fetstilta etiketter indikerar objekt som markerats som närvarande i de ursprungliga annoteringarna, medan röda etiketter visar objekt som hallucinerats av modellerna. Det vänstra exemplet reflekterar en traditionell instruktionsbaserad utvärdering, medan de tre exemplen till höger är hämtade från olika POPE-benchmark-varianter. Källa: https://aclanthology.org/2023.emnlp-main.20.pdf

Grundfakta-objekt (svar: Ja) parades med sampade icke-existerande objekt (svar: Nej), valda genom slumpmässiga, frekventa (populära) eller samexisterande (adversariala) strategier. Detta setup möjliggör en mer stabil, prompt-insensitiv utvärdering av hallucination utan att förlita sig på komplexa regelbaserade bildtextanalyser.

Författarna till den nya rapporten – med titeln RePOPE: Impact of Annotation Errors on the POPE Benchmark – utmanar den antagna noggrannheten hos POPE genom att kontrollera etiketterna på benchmarkens bilder (dvs. MSCOCO) – och finner att ett förvånansvärt stort antal är felaktiga eller oklara.

Exempel från 2014 års MSCOCO-dataset. Källa: https://arxiv.org/pdf/1405.0312

Exempel från 2014 års MSCOCO-dataset. Källa: https://arxiv.org/pdf/1405.0312

De här felen ändrar sättet modeller rankas, med vissa som ursprungligen presterade bra som faller bakom när de bedöms mot korrigeringsetiketter.

I tester utvärderade författarna en rad öppenviktiga vision-språkmodeller på både den ursprungliga POPE-benchmarken och deras ometiketterade RePOPE-version.

Enligt rapporten ledde de korrigeringsetiketterna till betydande förändringar i modellrankningar, särskilt i F1-poäng, med flera högpresterande modeller som föll i position under RePOPE.

Författarna hävdar att denna förändring illustrerar den utsträckning till vilken annoteringsfel kan dölja den faktiska hallucinationsbeteendet hos modellerna, och de presenterar RePOPE som ett mer tillförlitligt verktyg för att utvärdera hallucinationsvulnerabilitet.

I ett annat exempel från den nya rapporten ser vi hur de ursprungliga POPE-bildtexterna inte kunde korrekt identifiera subtila objekt, såsom en person som sitter bredvid hytten på en spårvagn i den högra bilden, eller stolen som döljs av tennis spelaren i den andra bilden från vänster.

I ett annat exempel från den nya rapporten ser vi hur de ursprungliga POPE-bildtexterna inte kunde korrekt identifiera subtila objekt, såsom en person som sitter bredvid hytten på en spårvagn i den högra bilden, eller stolen som döljs av tennis spelaren i den andra bilden från vänster.

Metod och tester

Forskarna om-annoterade alla annoteringar i det ursprungliga MSCOCO-datasetet, med två mänskliga annotatörer tilldelade varje data-exempel. Där oklarhet rådde om kvaliteten på de ursprungliga etiketterna (såsom i exemplen nedan), sattes dessa resultat åt sidan från testrundan.

Oklares fall, där etikett-konsistens i POPE reflekterar oklara kategori-gränser. Till exempel en teddybjörn etiketterad som en björn, en motorcykel som en cykel, eller flygplatsfordon som bilar. Dessa fall uteslöts från RePOPE på grund av den subjektiva naturen hos sådana klassificeringar, samt inkonsekvenserna i MSCOCO:s ursprungliga etiketter.

Oklares fall, där etikett-konsistens i POPE reflekterar oklara kategori-gränser. Till exempel en teddybjörn etiketterad som en björn, en motorcykel som en cykel, eller flygplatsfordon som bilar. Dessa fall uteslöts från RePOPE på grund av den subjektiva naturen hos sådana klassificeringar, samt inkonsekvenserna i MSCOCO:s ursprungliga etiketter.

Rapporten fastställer:

‘De ursprungliga annotatörerna missade personer i bakgrunden eller bakom glas, tennis spelaren döljer ‘stolarna’ i bakgrunden och coleslaw innehåller bara en liten synlig rand av en morot.

‘För vissa objekt är COCO-annoteringarna mycket inkonsekventa, troligen på grund av olika definitioner av dessa objekt som användes av de ursprungliga annotatörerna. Klassificeringen av en ‘teddybjörn’ som en ‘björn’, en motorcykel som en motoriserad ‘cykel’, eller ett flygplatsfordon som en ‘bil’ beror på specifika definitioner, vilket leder till inkonsekvenser i POPE-grundfakta-annoteringar. Därför annoterar vi de motsvarande bild-fråga-paren som ‘oklara’.’

Resultat från om-annoteringen: de positiva frågorna delas över alla tre POPE-varianter. Bland de som etiketterades 'Ja' i POPE, var 9,3 procent felaktiga och 13,8 procent klassificerades som oklara. För 'Nej'-frågorna var 1,7 procent felaktigt etiketterade och 4,3 procent var oklara.

Resultat från om-annoteringen: de positiva frågorna delas över alla tre POPE-varianter. Bland de som etiketterades ‘Ja’ i POPE, var 9,3 procent felaktiga och 13,8 procent klassificerades som oklara. För ‘Nej’-frågorna var 1,7 procent felaktigt etiketterade och 4,3 procent var oklara.

Författarna utvärderade en rad öppenviktiga modeller på POPE och på RePOPE, över diverse arkitekturer och modell-storlekar. De valda modellerna inkluderade några av de ledande arkitekturerna på OpenVLM-ledaren: InternVL2.5 (8B/26B/38B/78B och 8B-MPO/26B-MPO); LLaVA-NeXT; Vicuna; Mistral 7b; Llama; LLaVA-OneVision; Ovis2 (1B/2B/4B/8B); PaliGemma-3B; och PaliGemma2 (3B/10B).

Initiala resultat: den höga felraten i de ursprungliga positiva etiketterna leder till en skarp minskning av sanna positiva över alla modeller. Falska positiva varierar över subset, nästan dubblar på det slumpmässiga subset, men förblir i stort sett oförändrade på det populära subset, och visar en lätt minskning på det adversariala subset. Om-annoteringen har en stor effekt på F1-baserade rankningar. Modeller som Ovis2-4B och Ovis2-8B, som presterade bra på det populära och adversariala subset i POPE, stiger också till toppen på det slumpmässiga subset under RePOPE.

Initiala resultat: den höga felraten i de ursprungliga positiva etiketterna leder till en skarp minskning av sanna positiva över alla modeller. Falska positiva varierar över subset, nästan dubblar på det slumpmässiga subset, men förblir i stort sett oförändrade på det populära subset, och visar en lätt minskning på det adversariala subset. Om-annoteringen har en stor effekt på F1-baserade rankningar. Modeller som Ovis2-4B och Ovis2-8B, som presterade bra på det populära och adversariala subset i POPE, stiger också till toppen på det slumpmässiga subset under RePOPE.

Resultat-grafiken ovan visar hur antalet sanna positiva och falska positiva förändras efter korrigering av etiketterna i benchmarken.

Sanna positiva minskade över alla modeller, vilket visar att de ofta fick credit för korrekta svar när dessa svar bara var korrekta under felaktiga etiketter, medan falska positiva följde ett mer varierat mönster.

På det ‘slumpmässiga’ versionen av POPE, nästan dubblades falska positiva för många modeller, vilket indikerar att ett betydande antal objekt som flaggats som hallucinationer faktiskt var närvarande i bilderna men hade missats under annotering. I detta fall var många påstådda modellfel i själva verket dataset-etikettfel.

För det ‘adversariala’ versionen av POPE, där frågorna baserades på objekt som ofta samexisterar, minskade falska positiva. Detta reflekterar troligen en högre chans att det påstått frånvarande objektet verkligen fanns i bilden men lämnades ometiketterat.

Även om dessa förändringar påverkade precision och återkallande, förblev modellrankningar relativt stabila för båda måtten.

F1-poängen – POPE:s huvudsakliga utvärderingsmått – var betydligt känsligare för etikett-korrigeringarna. På det slumpmässiga subset, modeller som ursprungligen rankades högt under de ursprungliga etiketterna, som InternVL2.5-8B och -26B, föll till botten när de rankades med RePOPE. Andra, som Ovis2-4B och -8B, steg till toppen.

En liknande mönster uppstod i noggrannhetspoängen, även om författarna noterar att dessa nu kan vara förvrängda, eftersom den korrigeringade dataseten innehåller ett ojämnt antal positiva och negativa exempel.

Författarna hävdar att den starka påverkan av annoteringsfel på benchmark-resultat understryker behovet av högkvalitativa data. För att stödja en mer tillförlitlig utvärdering av objekt-hallucination, har de släppt de korrigeringsetiketterna på GitHub.

Men de noterar att denna om-annotering inte fullständigt åtgärdar benchmarkens mättnad, eftersom många modeller fortfarande uppnår sanna positiva och sanna negativa rater över 90%. De föreslår att ytterligare benchmark, som DASH-B, som använder en mer utmanande uppsättning negativa exempel, bör användas tillsammans med RePOPE.

Slutsats

Detta specifika experiment var möjligt på grund av den mycket små skalan på datasetet som var inblandat. Att bevisa samma hypotes på hyperskale-dataset skulle innebära att arbeta med mycket begränsade fragment av data; i högt varierande stora dataset kan det visa sig vara nästan omöjligt att isolera statistiskt representativa och semantiskt sammanhängande grupperingar – potentiellt förvridande resultaten.

Även om det vore möjligt, vad skulle då vara åtgärden under den nuvarande tillståndskonsten? Argumentet återgår oundvikligen till behovet av bättre och mer omfattande mänsklig annotering.

I detta avseende existerar ‘bättre’ och ‘mer omfattande’ som separata problem i sig själva, eftersom man kan erhålla en större volym av annoteringar genom race-to-the-bottom-ekonomier som Amazon Mechanical Turk (AMT). Tydligt, denna potentiellt exploaterande sub-ekonomi leder ofta till sämre resultat.

Alternativt kunde man fördela annoteringsuppgifter till ekonomiska regioner där samma utgifter skulle ge en större mängd annoteringar. Men ju längre bort annotatören är från den avsedda användningen av modellen som deras etiketter kommer att forma, desto mindre sannolikt är det att den resulterande modellen kommer att motsvara behoven eller förväntningarna på måldomen.

Detta förblir därför en av de mest bestående och olösta utmaningarna i ekonomisk utveckling av maskinlärning.

Publicerad första gången onsdag, 23 april 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai