Andersons vinkel

Den ‘last ned flere merker!’ Illusjonen i AI-forskning

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
ChatGPT-4o: 'A wall on which hundreds of photographs are stuck with thumb-tacks. Each photo depicts a different kind of subject, such as fruit or animals or bridges or buildings or people, etc. Each photo has 2-3 yellow post-it notes attached to it. We are too far away to read anything written on the post-it notes, but we can see that there are dozens and dozens of photos on the wall, and each with several post-it notes tacked on.'

En vanlig oppfatning i nåværende maskinlæringsforskning er at maskinlæring selv kan brukes til å forbedre kvaliteten på AI-datasett-annoteringer – spesielt bilde-underskrifter ment for bruk i visjon-språkmodeller (VLMs). Denne tankegangen drives av den høye kostnaden av menneskelig annotering, og den tilleggsbyrden av tilsyn over annotatorkvalitet.

Det kan hevdes at dette er AI-ekvivalenten av den tidlige 2000-årenes ‘last ned mer RAM’ meme, som satirerte forestillingen om at en maskinvarebegrensning kunne løses med en programvarebasert fiksering.

Dette er også et underansett problem; mens nye AI-modeller tiltrekker seg stor oppmerksomhet i både offentlige og kommersielle sfærer, synes annotering ofte å være en trivial detalj i maskinlæringspipeliner, overskygget av spenningen rundt bredere rammeverk.

I virkeligheten er evnen til maskinlæringsystemer til å gjenkjenne og reproducere mønster (den sentrale bruksområdet for nesten alle AI-systemer) er avhengig av kvaliteten og konsistensen av virkelige annoteringer – merker og fraser som er skapt eller avgjort av virkelige mennesker, ofte gjør subjektive avgjørelser om enkeltdata i ikke-ideelle omstendigheter.

Uunngåelig, systemer som søker å observere og reproducere mønster i annotatør-atferd (og dermed erstatte menneskelige annotatorer og fasilitere nøyaktig merking i stor skala) kan ikke håpe å fungere godt på data ikke inneholdt i eksemplene tatt fra menneskelige observatører. Ingen “lignende” er helt det samme, og tverrdomæne-ekvivalens forblir et problematisk forsøk i datavisualisering.

‘Upstream data-buck’ må stoppe et sted, og i dette tilfelle er det akkurat der det stopper – med et menneskelig cerebellum som gjør en slags subjektiv distinksjon for å kodifisere data for et kunstig system.

The RAG Trade

Inntil nylig var feilene som oppstod fra under-kurerte datasett-annoteringer, kanskje, sett på som akseptable skadevarer i sammenheng med de ufullkomne, men likevel markedsmessige resultater som ble oppnådd fra generative AI-systemer.

Det er faktisk bare i år en studie fra Singapore konkluderte at hallusinasjoner – dvs. tilfellene hvor AI-systemer oppfinner ting som undergraver våre intensjoner – er uunngåelige, og bundet inn i den konseptuelle arkitekturen til slike systemer.

For å motvirke dette, RAG-baserte agenter – som kan ‘verifisere’ fakta gjennom internett-søk – blir populære i forskning og anvendt kommersielle løsninger. Imidlertid legger de til ressurskost og til latent tid i spørringer; dessuten kan ny informasjon som brukes på en trent modell ikke konkurrere med de mer intrikate og dypere sammenkoblede forbindelsene som kjennetegner de native lagene i en trent modell.

Det ville derfor være bedre hvis annoteringsdataene som informerer disse modellene var betydelig mindre feilfulle fra først av, selv om de ikke kan være perfekte (minst av alt fordi denne aktiviteten inntrer i menneskelig subjektivitet).

RePOPE

En ny rapport fra Tyskland fremhever problemene som oppstår fra å avhenge av eldre, vidt brukte datasett, med fokus på nøyaktigheten og påliteligheten av deres bilde-underskrifter. Forskerne mener at feil i merker i benchmark kan skjule eller misrepresentere hallusinasjon i visjon-språkmodeller.

Fra den nye rapporten, noen eksempler hvor de opprinnelige underskriftene ikke klarte å korrekt identifisere objekter i MSCOCO-datasettet av bilder. Forskerne manuelle revisjon av POPE-benchmark-datasettet adresserer disse manglene, og demonstrerer kostnadene ved å spare penger på annoteringskurering. Kilde: https://arxiv.org/pdf/2504.15707

Fra den nye rapporten, noen eksempler hvor de opprinnelige underskriftene ikke klarte å korrekt identifisere objekter i MSCOCO-datasettet av bilder. Forskerne manuelle revisjon av POPE-benchmark-datasettet adresserer disse manglene, og demonstrerer kostnadene ved å spare penger på annoteringskurering. Kilde: https://arxiv.org/pdf/2504.15707

Forestall en modell som vises et bilde av en gate-scene og spør om det er en sykkel i det. Modellen svarer ja. Hvis benchmark-datasettet sier det ikke er en sykkel, blir modellen markert feil. Men hvis en sykkel er klart synlig i bildet, og ble bare oversett under annotering, så var modellens svar korrekt, og benchmark-datasettet har feilet. Feil som disse kan akkumuleres over et datasett, og gi en forvrengt bilde av hvilke modeller som er nøyaktige og hvilke som er utsatt for hallusinasjon.

Dette betyr at når feil eller tvetydige annoteringer behandles som grunn-sannhet, kan modeller synes å hallusinere når de er korrekte, eller synes å være nøyaktige når de ikke er, og forvrenger både måling av hallusinasjon og rangering av modell-ytelse, og gjør det vanskeligere å diagnostisere eller løse problemet med sikkerhet.

Den nye rapporten reviderer en vidt brukt benchmark kalt Polling-based Object Probing Evaluation (POPE), som tester om visjon-språkmodeller kan korrekt si hva som er eller ikke er i et bilde.

POPE er basert på merker fra den innflytelsesrike Microsoft COCO: Common Objects in Context (MSCOCO)-datasettet, en samling av annoterte bilder som har lenge vært behandlet som å tilby en god nivå av annoteringsnøyaktighet.

POPE evaluerer objekt-hallusinasjon i store visjon-språkmodeller ved å omdefinere problemet som en binær klassifiseringsoppgave. I stedet for å parse genererte underskrifter, stiller systemet enkle ja/nei-spørsmål til modellen om hvorvidt bestemte objekter er til stede i et bilde, ved å bruke maler som ‘Er det en <objekt> i bildet?’.

Eksempler på objekt-hallusinasjon i visjon-språkmodeller. Fetteikede merker indikerer objekter merket som til stede i de opprinnelige annoteringene, mens røde merker viser objekter hallusinert av modellene. Eksempelet til venstre reflekterer en tradisjonell instruksjonsbasert evaluering, mens de tre eksemplene til høyre er hentet fra forskjellige POPE-benchmark-varianter.. Kilde: https://aclanthology.org/2023.emnlp-main.20.pdf

Eksempler på objekt-hallusinasjon i visjon-språkmodeller. Fetteikede merker indikerer objekter merket som til stede i de opprinnelige annoteringene, mens røde merker viser objekter hallusinert av modellene. Eksempelet til venstre reflekterer en tradisjonell instruksjonsbasert evaluering, mens de tre eksemplene til høyre er hentet fra forskjellige POPE-benchmark-varianter. Kilde: https://aclanthology.org/2023.emnlp-main.20.pdf

Grund-sannhet-objekter (svar: Ja) er parret med sampede ikke-eksisterende objekter (svar: Nei), valgt gjennom tilfeldig, hyppig (populær), eller sam-forekomst-basert (motstridende) strategier. Dette oppsettet tillater en mer stabil, prompt-uavhengig evaluering av hallusinasjon uten å avhenge av komplekse regelbaserte underskriftsanalyser.

Forskerne bak den nye rapporten – tittel RePOPE: Impact of Annotation Errors on the POPE Benchmark – utfordrer den antatte nøyaktigheten av POPE ved å re-kontrollere merkingene på benchmarkets bilder (dvs. MSCOCO) – og finner at et overraskende antall er feil eller uklare.

Eksempler fra 2014 MSCOCO-datasettet. Kilde: https://arxiv.org/pdf/1405.0312

Eksempler fra 2014 MSCOCO-datasettet. Kilde: https://arxiv.org/pdf/1405.0312

Disse feilene endrer måten modellene rangeres, med noen som opprinnelig performerte godt faller bak når de blir bedømt mot korrigerte merker.

I tester, evaluerte forfatterne en rekke åpne vekt- visjon-språkmodeller på både den opprinnelige POPE-benchmarken og deres re-merkede RePOPE-versjon.

Ifølge rapporten ledet de korrigerte annoteringene til merkede endringer i modell-rangering, spesielt i F1-poeng, med flere høytfremførende modeller som falt i posisjon under RePOPE.

Forskerne hevder at denne skiftet illustrerer omfanget av hvordan annoteringsfeil kan skjule den faktiske hallusinasjons-atferden til modellene, og de presenterer RePOPE som et mer pålitelig verktøy for å vurdere hallusinasjons-sårbarhet.

I et annet eksempel fra den nye rapporten, ser vi hvordan de opprinnelige POPE-underskriftene ikke klarte å skille subtile objekter, som en person som sitter ved siden av vogna på en trikk i det høyre bildet, eller stolen som er skjult av tennis-spilleren i det andre bildet fra venstre.

I et annet eksempel fra den nye rapporten, ser vi hvordan de opprinnelige POPE-underskriftene ikke klarte å skille subtile objekter, som en person som sitter ved siden av vogna på en trikk i det høyre bildet, eller stolen som er skjult av tennis-spilleren i det andre bildet fra venstre.

Metode og tester

Forskerne re-merket alle annoteringene i det opprinnelige MSCOCO-datasettet, med to menneskelige merker tildelt hver data-eksemplar. Hvor tvetydighet om kvaliteten på de opprinnelige merkingene oppstod (som i eksemplene nedenfor), ble disse resultater satt til side fra test-runden.

Tvetydige tilfeller, hvor merking-konsistens i POPE reflekterer uklare kategori-grenser. For eksempel, en teddybjørn merket som en bjørn, en motorsykkel som en sykkel, eller flyplass-kjøretøy som biler. Disse tilfellene er ekskludert fra RePOPE på grunn av den subjektive naturen til slike klassifiseringer, samt inkonsistensene i MSCOCO sine opprinnelige merker.

Tvetydige tilfeller, hvor merking-konsistens i POPE reflekterer uklare kategori-grenser. For eksempel, en teddybjørn merket som en bjørn, en motorsykkel som en sykkel, eller flyplass-kjøretøy som biler. Disse tilfellene er ekskludert fra RePOPE på grunn av den subjektive naturen til slike klassifiseringer, samt inkonsistensene i MSCOCO sine opprinnelige merker.

Rapporten sier:

‘De opprinnelige annotatorene overså personer i bakgrunnen eller bak glass, tennis-spilleren skjuler ‘stolene’ i bakgrunnen og coleslawen inneholder bare en liten synlig stripe av en gulrot.

‘For noen objekter er COCO-annoteringene høyt inkonsistente, sannsynligvis på grunn av forskjellige definisjoner av disse objekter som ble brukt av de opprinnelige annotatorene. Klassifiseringen av en ‘teddybjørn’ som en ‘bjørn’, en motorsykkel som en ‘sykkel’, eller et flyplass-kjøretøy som en ‘bil’ avhenger av bestemte definisjoner, og fører til inkonsistenser i POPE-grunn-sannhet-annoteringer. Derfor annoterer vi de tilhørende bilde-spørsmål-par som ‘tvetydige’.’

Resultater fra re-annoteringen: de positive spørsmålene er delt over alle tre POPE-varianter. Blant de som ble merket 'Ja' i POPE, ble 9,3 prosent funnet å være feil og 13,8 prosent ble klassifisert som tvetydige. For 'Nei'-spørsmålene ble 1,7 prosent feilmerket og 4,3 prosent ble tvetydige.

Resultater fra re-annoteringen: de positive spørsmålene er delt over alle tre POPE-varianter. Blant de som ble merket ‘Ja’ i POPE, ble 9,3 prosent funnet å være feil og 13,8 prosent ble klassifisert som tvetydige. For ‘Nei’-spørsmålene ble 1,7 prosent feilmerket og 4,3 prosent ble tvetydige.

Forskerne evaluerte en rekke åpne vekt- visjon-språkmodeller på både POPE og RePOPE, over diverse arkitekturer og modell-størrelser. Modellene som ble valgt inkluderte noen av de ledende arkitekturer på OpenVLM-listen: InternVL2.5 (8B/26B/38B/78B og 8B-MPO/26B-MPO); LLaVA-NeXT; Vicuna; Mistral 7b; Llama; LLaVA-OneVision; Ovis2 (1B/2B/4B/8B); PaliGemma-3B; og PaliGemma2 (3B/10B).

Initielle resultater: den høye feil-raten i de opprinnelige positive merkene fører til en skarp nedgang i sanntreff over alle modeller. Falske positiver varierer over undergrupper, nesten doblet på den tilfeldige undergruppen, men forble stort sett uendret på den populære undergruppen, og viste en liten nedgang på den motstridende undergruppen. Re-merkingen hadde en stor effekt på F1-basert rangering. Modeller som Ovis2-4B og Ovis2-8B, som performerte godt på den populære og motstridende delene i POPE, steg også til toppen på den tilfeldige undergruppen under RePOPE.. Vennligst se kilde-PDF for bedre oppløsning.

Initielle resultater: den høye feil-raten i de opprinnelige positive merkene fører til en skarp nedgang i sanntreff over alle modeller. Falske positiver varierer over undergrupper, nesten doblet på den tilfeldige undergruppen, men forble stort sett uendret på den populære undergruppen, og viste en liten nedgang på den motstridende undergruppen. Re-merkingen hadde en stor effekt på F1-basert rangering. Modeller som Ovis2-4B og Ovis2-8B, som performerte godt på den populære og motstridende delene i POPE, steg også til toppen på den tilfeldige undergruppen under RePOPE.. Vennligst se kilde-PDF for bedre oppløsning.

Resultatene ovenfor viser hvordan antallet sanntreff og falske positiver endrer seg etter korreksjon av merkene i benchmarken.

Sanntreff falt over alle modeller, og viste at de ofte ble kreditert for korrekte svar når disse svarene bare var korrekte under feil merkene, mens falske positiver fulgte en mer variert mønster.

På den ’tilfeldige’ versjonen av POPE, nesten doblet falske positiver for mange modeller, og indikerte at et betydelig antall objekter som ble merket som hallusinasjoner, faktisk var til stede i bildene, men ble oversett under den opprinnelige annoteringen. I dette tilfelle var mange påståtte modell-feil faktisk datasett-merking-feil.

For den ‘motstridende’ versjonen av POPE, hvor spørsmål var basert på objekter som ofte sam-existerer, sank falske positiver. Dette reflekterer sannsynligvis en høyere sjanse for at det påståtte fraværende objektet faktisk var til stede i bildet, men ble u-merket.

Selv om disse endringene påvirkte presisjon og gjentakelse, forble modell-rangeringen relativt stabil for begge målinger.

F1-poeng – POPEs hoved-evaluering-mål – var mye mer følsom for korreksjonene av merkene. På den tilfeldige undergruppen, modeller som rangerte nær toppen under de opprinnelige merkene, som InternVL2.5-8B og -26B, falt til bunnen når de ble scoret med RePOPE. Andre, som Ovis2-4B og -8B, steg til toppen.

En lignende mønster oppstod i nøyaktighets-poeng, selv om forfatterne noterer at disse nå kan være forvrengt, ettersom den korrigerte datasettet inneholder et ujevn antall positive og negative eksempler.

Forskerne argumenterer for at den sterke påvirkningen av annoteringsfeil på benchmark-resultater understreker behovet for høykvalitetsdata. For å støtte en mer pålitelig evaluering av objekt-hallusinasjon, har de gjort de korrigerte merkene tilgjengelige på GitHub.

Men de noterer at denne re-merkingen ikke fullstendig løser benchmarkets metning, ettersom mange modeller fortsatt oppnår sanntreff- og sant-negativ-rater over 90%. De foreslår at ytterligere benchmarks, som DASH-B, som bruker en mer utfordrende samling av negative eksempler, bør brukes sammen med RePOPE.

Konklusjon

Dette eksperimentet var mulig på grunn av den svært lille skalaen på datasettet som var involvert. Å bevise den samme hypotesen på hyperskale-datasett ville innebære å arbeide på svært begrensede fragmenter av data; i svært diverse store datasett kunne det være nær umulig å isolere statistisk representative og semantisk kohesive grupper – potensielt forvrengt resultater.

Even om det var mulig, hva ville være løsningen under den nåværende stand-of-the-art? Argumentet går tilbake uunngåelig mot behovet for bedre og mer omfattende menneskelig annotering.

I denne sammenhengen eksisterer ‘bedre’ og ‘mer omfattende’ som separate problemer i seg selv, ettersom man kan oppnå en større mengde annoteringer gjennom race-to-the-bottom-økonomier som Amazon Mechanical Turk (AMT). Det er åpenbart at denne potensielt utnyttende sub-økonomi ofte fører til dårligere resultater.

Alternativt kunne man sende annoteringsoppgaver til økonomiske regioner hvor den samme utgift ville gi en større mengde annoteringer. Men jo lengre annotatoren er fjernet fra den planlagte bruken av modellen deres merker vil forme, desto mindre sannsynlig er det at den resulterende modellen vil være i samsvar med behovene eller forventningene til måldomænet.

Dette forblir derfor ett av de mest vedvarende og uløste utfordringene i økonomien av maskinlæringsutvikling.

 

Først publisert onsdag, 23. april 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai