Andersons vinkel

‘Download More Labels!’ Illusionen i AI-forskning

mm
Føj Unite.AI til dine foretrukne kilder på Google
ChatGPT-4o: 'A wall on which hundreds of photographs are stuck with thumb-tacks. Each photo depicts a different kind of subject, such as fruit or animals or bridges or buildings or people, etc. Each photo has 2-3 yellow post-it notes attached to it. We are too far away to read anything written on the post-it notes, but we can see that there are dozens and dozens of photos on the wall, and each with several post-it notes tacked on.'

En udbredt antagelse i moderne maskinlæringsforskning er, at maskinlæring selv kan forbedre annotationer i AI-datasæt, især billedtekster til vision-sprogmodeller (VLM’er). Tanken drives af de høje omkostninger ved menneskelig annotation og arbejdet med at kontrollere annotatorernes præstation.

Det minder om 2000’ernes meme om at »downloade mere RAM«: forestillingen om, at en grundlæggende begrænsning kan løses med et softwarelag. Annotation får ofte mindre opmærksomhed end nye modeller, selv om næsten alle AI-systemers evne til at genkende og gengive mønstre afhænger af kvaliteten og konsistensen i etiketter skabt af mennesker, ofte under dårlige forhold og med subjektive vurderinger.

Systemer, der lærer annotatorernes adfærd for at erstatte dem i stor skala, kan ikke håndtere fænomener, som ikke findes i de menneskelige eksempler. Tværdomæneækvivalens er fortsat vanskelig. Et sted må ansvaret for data stoppe, og her stopper det ved et menneske, der træffer en subjektiv beslutning for at kode data til et kunstigt system.

RAG-kompromiset

Indtil for nylig blev fejl fra utilstrækkeligt kuraterede annotationer måske accepteret som en bivirkning af generative systemers ufuldkomne, men salgbare resultater. En undersøgelse fra Singapore konkluderede i år, at hallucinationer er uundgåelige og knyttet til systemernes grundlæggende arkitektur.

RAG-baserede agenter, der kan kontrollere fakta via internetsøgning, er derfor blevet populære. De øger dog ressourceforbruget og svartiden, og ny information hentet efter træningen kan ikke konkurrere med de dybe forbindelser i modellens egne lag. Derfor ville det være bedre, hvis de oprindelige annotationsdata var langt mindre fejlbehæftede, selv om de aldrig kan blive perfekte.

RePOPE

En ny tysk undersøgelse viser problemerne ved at stole på ældre, udbredte datasæt og fokuserer på billedteksters nøjagtighed. Fejl i benchmarkets etiketter kan skjule eller fejlfremstille hallucinationer i vision-sprogmodeller.

From the new paper, some examples where the original captions failed to correctly identify objects in the MSCOCO dataset of images. The researchers' manual revision of the POPE benchmark dataset addresses these shortcomings, demonstrating the cost of saving money on annotation curation. Source: https://arxiv.org/pdf/2504.15707
Eksempler hvor de oprindelige billedtekster i MSCOCO ikke identificerede objekter korrekt.

Forestil dig et gadebillede, hvor modellen spørges, om der er en cykel. Modellen svarer ja. Hvis benchmarkets etiket siger nej, markeres svaret som forkert. Men er cyklen tydeligt synlig og blot overset af annotatoren, er modellen korrekt, mens benchmarket fejler. Sådanne fejl kan ophobes og give et forvrænget billede af, hvilke modeller der er præcise eller hallucinerer. Forkerte eller tvetydige etiketter kan både få korrekte modeller til at se forkerte ud og omvendt.

Undersøgelsen genbesøger Polling-based Object Probing Evaluation (POPE), som tester, om VLM’er kan afgøre, hvad der findes i et billede. POPE bygger på Microsoft COCO: Common Objects in Context (MSCOCO) og omformer objekthallucination til binær klassifikation med ja/nej-spørgsmål som »Er der et <objekt> i billedet?«

Examples of object hallucination in vision-language models. Bolded labels indicate objects marked as present in the original annotations, while red labels show objects hallucinated by the models. The left example reflects a traditional instruction-based evaluation, while the three examples on the right are drawn from different POPE benchmark variants.. Source: https://aclanthology.org/2023.emnlp-main.20.pdf
Eksempler på objekthallucination i vision-sprogmodeller og POPE-varianterne.

Objekter, som grunddata angiver findes (ja), kombineres med ikke-eksisterende objekter (nej), udvalgt tilfældigt, efter hyppighed eller efter samforekomst. Det giver en mere stabil evaluering end kompleks analyse af genererede billedtekster.

Den nye artikel, RePOPE: Impact of Annotation Errors on the POPE Benchmark, kontrollerer MSCOCO-etiketterne igen og finder overraskende mange forkerte eller uklare tilfælde.

Examples from the 2014 MSCOCO dataset. Source: https://arxiv.org/pdf/1405.0312
Eksempler fra MSCOCO-datasættet fra 2014.

Korrektionerne ændrer modelrangeringen. Flere modeller, der klarede sig godt på POPE, falder på RePOPE, især målt med F1. Forskerne mener derfor, at annotationsfejl kan skjule modellernes reelle hallucinationsadfærd, og at RePOPE er et mere pålideligt mål.

In another example from the new paper, we see how the original POPE captions fail to discern subtle objects, such as a person sitting beside the cabin of a tram in the rightmost photo, or the chair obscured by the tennis player in the second photo from the left.
POPE overser blandt andet en person ved en sporvogn og en stol bag en tennisspiller.

Metode og test

Forskerne genannoterede alle benchmarkets data med to menneskelige annotatorer pr. forekomst. Tvivlsomme tilfælde blev udeladt. Eksempler omfatter en bamse kategoriseret som bjørn, en motorcykel som cykel og lufthavnskøretøjer som biler; klassifikationen afhænger af definitionen og var inkonsistent i MSCOCO.

Ambiguous cases, where labeling inconsistencies in POPE reflect unclear category boundaries. For instance, a teddy bear labeled as a bear, a motorcycle as a bicycle, or airport vehicles as cars. These cases are excluded from RePOPE due to the subjective nature of such classifications, as well as the inconsistencies in MSCOCO's original labels.
Tvetydige kategorier, som blev udelukket fra RePOPE.

De oprindelige annotatorer overså personer i baggrunden eller bag glas, stole skjult af en tennisspiller og en lille synlig stribe gulerod i coleslaw. Sådanne billed-spørgsmålspar blev markeret som tvetydige.

Results of the re-annotation: the positive questions are shared across all three POPE variants. Among those labeled 'Yes' in POPE, 9.3 percent were found to be incorrect and 13.8 percent were classified as ambiguous. For the 'No' questions, 1.7 percent were mislabeled and 4.3 percent were ambiguous.
Resultater af genannoteringen af positive og negative spørgsmål.

Blandt positive spørgsmål, der var mærket »ja« i POPE, viste 9,3 procent sig at være forkerte, og 13,8 procent var tvetydige. Blandt »nej«-spørgsmålene var 1,7 procent fejlmærkede og 4,3 procent tvetydige.

Forskerne testede en bred gruppe åbne modeller i forskellige størrelser: InternVL2.5 (8B, 26B, 38B, 78B samt MPO-varianter), LLaVA-NeXT, Vicuna, Mistral 7B, Llama, LLaVA-OneVision, Ovis2 (1B, 2B, 4B, 8B), PaliGemma-3B og PaliGemma2 (3B, 10B).

Initial results: the high error rate in the original positive labels leads to a sharp drop in true positives across all models. False positives vary across subsets, nearly doubling on the random subset, but remaining largely unchanged on the popular subset, and show a slight decrease on the adversarial subset. The relabeling has a major effect on F1-based rankings. Models like Ovis2-4B and Ovis2-8B, which performed well on the popular and adversarial splits in POPE, also rise to the top on the random subset under RePOPE.. Please refer to the source PDF for better resolution.
Modelresultater efter genannotering; korrektionerne ændrer især F1-rangeringen.

Efter korrektion faldt antallet af sande positive svar for alle modeller, fordi de tidligere fik kredit for svar, der kun var korrekte under defekte etiketter. Falske positive udviklede sig forskelligt. På POPE’s tilfældige delmængde blev de næsten fordoblet for mange modeller, fordi objekter, der var blevet kaldt hallucinationer, faktisk fandtes i billederne, men manglede i annotationerne.

På den adversarielle delmængde, hvor spørgsmålene bygger på objekter, der ofte optræder sammen, faldt antallet af falske positive. Det afspejler sandsynligvis, at det angiveligt fraværende objekt faktisk var i billedet, men ikke mærket. Præcision og recall ændrede sig, men deres modelrangering var forholdsvis stabil.

F1, POPE’s vigtigste mål, var langt mere følsomt. På den tilfældige delmængde faldt InternVL2.5-8B og -26B fra toppen til bunden under RePOPE, mens Ovis2-4B og -8B steg til toppen. Nøjagtighed viste et lignende mønster, men kan være skæv, fordi det korrigerede datasæt har ulige antal positive og negative eksempler.

De korrigerede etiketter er offentliggjort på GitHub. Genannoteringen løser dog ikke benchmarkets mætning, da mange modeller stadig har over 90 procent sande positive og sande negative. Forskerne anbefaler derfor også vanskeligere benchmarks som DASH-B.

Konklusion

Eksperimentet var muligt, fordi datasættet var lille. På datasæt i hyperskala ville man være nødt til at undersøge begrænsede fragmenter, og i meget varierede samlinger kan det være næsten umuligt at udtage statistisk repræsentative og semantisk sammenhængende grupper uden at skævvride resultatet.

Den nuværende løsning peger tilbage på behovet for bedre og mere omfattende menneskelig annotation. »Bedre« og »mere« er forskellige problemer. Markeder som Amazon Mechanical Turk kan levere større mængder gennem et kapløb mod bunden, men den potentielt udnyttende økonomi giver ofte ringere resultater.

Man kan også flytte arbejdet til billigere regioner, men jo længere annotatoren befinder sig fra modellens tilsigtede anvendelse, desto mindre sandsynligt er det, at etiketterne og den færdige model matcher måldomænets behov. Dette er fortsat en af de mest vedvarende og uløste økonomiske udfordringer i maskinlæringsudvikling.

Først offentliggjort onsdag den 23. april 2025.

Kilder og relaterede links

Forfatter inden for maskinlæring, domænespecialist i menneskelig billedsyntese. Tidligere chef for forskningsindhold hos Metaphysic.ai, indtil den blev opløst i DNEGs Brahma.ai.
Websted: martinanderson.ai
Kontakt: martin@martinanderson.ai