Andersons vinkel
‘Download More Labels!’ Illusionen i AI-forskning

En udbredt antagelse i moderne maskinlæringsforskning er, at maskinlæring selv kan forbedre annotationer i AI-datasæt, især billedtekster til vision-sprogmodeller (VLM’er). Tanken drives af de høje omkostninger ved menneskelig annotation og arbejdet med at kontrollere annotatorernes præstation.
Det minder om 2000’ernes meme om at »downloade mere RAM«: forestillingen om, at en grundlæggende begrænsning kan løses med et softwarelag. Annotation får ofte mindre opmærksomhed end nye modeller, selv om næsten alle AI-systemers evne til at genkende og gengive mønstre afhænger af kvaliteten og konsistensen i etiketter skabt af mennesker, ofte under dårlige forhold og med subjektive vurderinger.
Systemer, der lærer annotatorernes adfærd for at erstatte dem i stor skala, kan ikke håndtere fænomener, som ikke findes i de menneskelige eksempler. Tværdomæneækvivalens er fortsat vanskelig. Et sted må ansvaret for data stoppe, og her stopper det ved et menneske, der træffer en subjektiv beslutning for at kode data til et kunstigt system.
RAG-kompromiset
Indtil for nylig blev fejl fra utilstrækkeligt kuraterede annotationer måske accepteret som en bivirkning af generative systemers ufuldkomne, men salgbare resultater. En undersøgelse fra Singapore konkluderede i år, at hallucinationer er uundgåelige og knyttet til systemernes grundlæggende arkitektur.
RAG-baserede agenter, der kan kontrollere fakta via internetsøgning, er derfor blevet populære. De øger dog ressourceforbruget og svartiden, og ny information hentet efter træningen kan ikke konkurrere med de dybe forbindelser i modellens egne lag. Derfor ville det være bedre, hvis de oprindelige annotationsdata var langt mindre fejlbehæftede, selv om de aldrig kan blive perfekte.
RePOPE
En ny tysk undersøgelse viser problemerne ved at stole på ældre, udbredte datasæt og fokuserer på billedteksters nøjagtighed. Fejl i benchmarkets etiketter kan skjule eller fejlfremstille hallucinationer i vision-sprogmodeller.

Forestil dig et gadebillede, hvor modellen spørges, om der er en cykel. Modellen svarer ja. Hvis benchmarkets etiket siger nej, markeres svaret som forkert. Men er cyklen tydeligt synlig og blot overset af annotatoren, er modellen korrekt, mens benchmarket fejler. Sådanne fejl kan ophobes og give et forvrænget billede af, hvilke modeller der er præcise eller hallucinerer. Forkerte eller tvetydige etiketter kan både få korrekte modeller til at se forkerte ud og omvendt.
Undersøgelsen genbesøger Polling-based Object Probing Evaluation (POPE), som tester, om VLM’er kan afgøre, hvad der findes i et billede. POPE bygger på Microsoft COCO: Common Objects in Context (MSCOCO) og omformer objekthallucination til binær klassifikation med ja/nej-spørgsmål som »Er der et <objekt> i billedet?«

Objekter, som grunddata angiver findes (ja), kombineres med ikke-eksisterende objekter (nej), udvalgt tilfældigt, efter hyppighed eller efter samforekomst. Det giver en mere stabil evaluering end kompleks analyse af genererede billedtekster.
Den nye artikel, RePOPE: Impact of Annotation Errors on the POPE Benchmark, kontrollerer MSCOCO-etiketterne igen og finder overraskende mange forkerte eller uklare tilfælde.

Korrektionerne ændrer modelrangeringen. Flere modeller, der klarede sig godt på POPE, falder på RePOPE, især målt med F1. Forskerne mener derfor, at annotationsfejl kan skjule modellernes reelle hallucinationsadfærd, og at RePOPE er et mere pålideligt mål.

Metode og test
Forskerne genannoterede alle benchmarkets data med to menneskelige annotatorer pr. forekomst. Tvivlsomme tilfælde blev udeladt. Eksempler omfatter en bamse kategoriseret som bjørn, en motorcykel som cykel og lufthavnskøretøjer som biler; klassifikationen afhænger af definitionen og var inkonsistent i MSCOCO.

De oprindelige annotatorer overså personer i baggrunden eller bag glas, stole skjult af en tennisspiller og en lille synlig stribe gulerod i coleslaw. Sådanne billed-spørgsmålspar blev markeret som tvetydige.

Blandt positive spørgsmål, der var mærket »ja« i POPE, viste 9,3 procent sig at være forkerte, og 13,8 procent var tvetydige. Blandt »nej«-spørgsmålene var 1,7 procent fejlmærkede og 4,3 procent tvetydige.
Forskerne testede en bred gruppe åbne modeller i forskellige størrelser: InternVL2.5 (8B, 26B, 38B, 78B samt MPO-varianter), LLaVA-NeXT, Vicuna, Mistral 7B, Llama, LLaVA-OneVision, Ovis2 (1B, 2B, 4B, 8B), PaliGemma-3B og PaliGemma2 (3B, 10B).

Efter korrektion faldt antallet af sande positive svar for alle modeller, fordi de tidligere fik kredit for svar, der kun var korrekte under defekte etiketter. Falske positive udviklede sig forskelligt. På POPE’s tilfældige delmængde blev de næsten fordoblet for mange modeller, fordi objekter, der var blevet kaldt hallucinationer, faktisk fandtes i billederne, men manglede i annotationerne.
På den adversarielle delmængde, hvor spørgsmålene bygger på objekter, der ofte optræder sammen, faldt antallet af falske positive. Det afspejler sandsynligvis, at det angiveligt fraværende objekt faktisk var i billedet, men ikke mærket. Præcision og recall ændrede sig, men deres modelrangering var forholdsvis stabil.
F1, POPE’s vigtigste mål, var langt mere følsomt. På den tilfældige delmængde faldt InternVL2.5-8B og -26B fra toppen til bunden under RePOPE, mens Ovis2-4B og -8B steg til toppen. Nøjagtighed viste et lignende mønster, men kan være skæv, fordi det korrigerede datasæt har ulige antal positive og negative eksempler.
De korrigerede etiketter er offentliggjort på GitHub. Genannoteringen løser dog ikke benchmarkets mætning, da mange modeller stadig har over 90 procent sande positive og sande negative. Forskerne anbefaler derfor også vanskeligere benchmarks som DASH-B.
Konklusion
Eksperimentet var muligt, fordi datasættet var lille. På datasæt i hyperskala ville man være nødt til at undersøge begrænsede fragmenter, og i meget varierede samlinger kan det være næsten umuligt at udtage statistisk repræsentative og semantisk sammenhængende grupper uden at skævvride resultatet.
Den nuværende løsning peger tilbage på behovet for bedre og mere omfattende menneskelig annotation. »Bedre« og »mere« er forskellige problemer. Markeder som Amazon Mechanical Turk kan levere større mængder gennem et kapløb mod bunden, men den potentielt udnyttende økonomi giver ofte ringere resultater.
Man kan også flytte arbejdet til billigere regioner, men jo længere annotatoren befinder sig fra modellens tilsigtede anvendelse, desto mindre sandsynligt er det, at etiketterne og den færdige model matcher måldomænets behov. Dette er fortsat en af de mest vedvarende og uløste økonomiske udfordringer i maskinlæringsudvikling.
Først offentliggjort onsdag den 23. april 2025.
Kilder og relaterede links
- https://arxiv.org/pdf/2410.09416
- https://arxiv.org/pdf/2408.04917
- https://www.unite.ai/the-forgotten-layers-how-hidden-ai-biases-are-lurking-in-dataset-annotation-practices/
- https://github.com/daniel071/ramDownloader
- https://www.unite.ai/the-hidden-role-of-data-annotation-in-everyday-ai-tools/
- https://www.unite.ai/the-shortcomings-of-amazon-mechanical-turk-may-threaten-natural-language-generation-systems/
- https://arxiv.org/pdf/2403.12372
- https://arxiv.org/pdf/2401.11817
- https://www.unite.ai/top-5-ai-hallucination-detection-solutions/
- https://www.unite.ai/what-is-retrieval-augmented-generation/
- https://aclanthology.org/2023.emnlp-main.20.pdf
- https://arxiv.org/pdf/1405.0312
- https://www.unite.ai/what-is-a-confusion-matrix/
- https://arxiv.org/pdf/2504.15707
- https://deepai.org/machine-learning-glossary-and-terms/f-score
- https://arxiv.org/pdf/2407.11691
- https://arxiv.org/abs/2412.05271
- https://github.com/LLaVA-VL/LLaVA-NeXT
- https://github.com/Instruction-Tuning-with-GPT-4/GPT-4-LLM
- https://arxiv.org/pdf/2310.06825
- https://arxiv.org/abs/2407.21783
- https://arxiv.org/abs/2408.03326
- https://arxiv.org/abs/2405.20797
- https://arxiv.org/abs/2407.07726
- https://arxiv.org/abs/2412.03555
- https://github.com/YanNeu/RePOPE
- https://arxiv.org/pdf/2503.23573
- https://www.unite.ai/amazon-mechanical-turk-pays-less-than-40-of-us-minimum-wage-research-suggests/












