Andersons vinkel
De ‘Rogue’ Data Forurensning av Generative AI-Ytelse

En ny studie finner at mange populære bilde datasett brukt til å trene AI-modeller er forurenset med testbilder eller nærduplikater, og tillater modellene å juke ved å huske svarene i stedet for å lære. Lekkasjen er utbredt, men generelt ikke oppdaget, og inflaterer stille poengene og gir urimelige fordeler til modeller trent på web-skala data.
Når du tar en bildeksamen, blir du vanligvis ikke fortalt på forhånd eksakt hvilke veier som vil bli brukt til eksamen. Hvis du gjorde (og du var en smule mangelfull i integritet), kunne du ‘optimalisere’ for eksamen ved å øve gjentatte ganger på den ruten, i stedet for å utvikle bredere kjøreferdigheter som kan håndtere enhver rute rimelig godt.
I trening av maskinlæringsmodeller er dette en rimelig analogi for en testdeling – en oppdeling av treningssettdata mellom (vanligvis) en 70% del for data som vil bli brukt til å trene modellen, med de resterende 30% brukt som ‘i felten’ data.
Siden ‘i felten’ data aldri har vært sett av modellen, hvis modellen utfører seg bra på den data, kan det antas å være effektivt og utførende; hvis ikke, kan modellen ha overfittet på en velbalansert sett – eller også data trengte ekstra kurasjon og definisjon.
Uansett, ikke å evaluere modeller på deres treningsdata er hjørnestenen i nåværende metode i AI-forskning og utvikling.
Igjen, Vennligst
Ifølge en ny forskningsrapport fra Japan, har datavisjon og generativ AI-forskningssktoren ikke i nærheten matchet innsatsen fra LLM-forskere for å sikre at testdata ikke forurenser treningsdata; i tester fant forskerne at hver hyperskala datavisjon datasett de studerte, inkludert de som driver noen av de største nåværende generative AI-systemene, har i noen grad tillatt sin testdata å krysse over i sin treningsdata – noe som betyr at benchmark og ytelsesrapporter for modeller trent på disse delingene ikke vil være mer nøyaktige enn en eksamensresultat fra noen som smuglet en krybbe inn i eksamenssalen, og vil ikke reflektere virkelige resultater på virkelig nye data.

Eksempler på krysning av data funnet av forskerne, der duplikat eller nærduplikat datapunkter finnes i både trenings- og testdata. Source: https://arxiv.org/pdf/2508.17416
I bildet ovenfor, fra den nye rapporten, ser vi eksempler på enten duplikat eller nærduplikat datapunkter funnet i både kjernens treningsdata og testdata for en rekke modeller – nok til å gjøre modellens ytelse på den data ugyldig, og lett inflasjon av dens generelle poeng over hele linjen, og faciliterer fremtreden av en nivå av generalisering som modellen kanskje ikke faktisk har oppnådd.
For å gjøre saken mer komplisert, synes forurensningen å skje over en mangfoldighet av mulige scenarier, inkludert ‘pre-trening‘, der vektene til eldre stammodeller brukes til å ‘starte’ en ny modell. Hvis den oppstrøms, eldre modellen har noen av de samme dataene som den nyere datasetten som brukes til pre-trening, kan krysning skje selv om 70/30 eller 80/20-delingen er ren.
Kumulativ Effekt
Dette er nesten sikkert å skje selv i de aller nyeste datasettene: omfanget av visuell/språk datasett har vokst enormt over de siste fem årene, og tatt med ikke bare de nyeste bilde dataene på nettet, men også gjenhøstet mye av de samme dataene som befolket de eldre, historiske datasettene.
Fortsatt, automatiske rutiner designet til å tråle og filtere milliarder av bilder for duplikater og nærduplikater står nå overfor en så stor oppgave at kurasjon selv – dens kostnad i termer av tid og penger – må nå bli vurdert innenfor rammen av budsjettbegrensninger
Mens bildeduplikasjon er en uunngåelig konsekvens av den type ad hoc nett-tråling bak massive samlinger som Common Crawl, på grunn av den vanlige praksisen med å reproducere og rekompresere bilder, og å anvende redigeringer som beskjæring, og selv flipping (for å unngå oppdaging, når bildet kanskje har vært brukt uten tillatelse, for eksempel).
Forfatterne observerer*:
‘Data-lekkasje er et utbredt problem, vanlig i de fleste visuelle datasett. Lekkasje kan skjule generaliserings-evnen til modeller, noe som er spesielt problematisk når man sammenligner modeller trent på ulike datasett, og fører til urimelige sammenligninger.
‘Vi oppfordrer datasett-designere til å vurdere implikasjonene av disse evalueringene. For en mer rettferdig modell-evaluering, anbefaler vi bruk av duplikat-detektorer som tar hensyn til både hard og soft lekkasje.
‘Ideelt sett bør lekkede bilder fjernes fra treningssettet, og hvis ikke mulig, bør de i alle fall fjernes fra testsettet.’
Rapporten utdyper en rekke tester som forskerne utførte på massive og populære datasett – hver enkelt av dem viste en viss grad av forurensning.
Den nye rapporten har tittelen Data-lekkasje i visuelle datasett, og kommer fra tre forskere ved Universitetet i Osaka.
Metode
Rapportens forfattere definerer lekkasje i termer av tre dimensjoner: modalitet, dekning, og grad.
Modalitet skiller om bare bilder lekkes eller om både bilder og merker er eksponert; dekning identifiserer om overlapet skjer innenfor samme datasett eller over ulike datasett; og grad definerer om den duplikerte innholdet er eksakt det samme eller bare nærliggende.
Med hensyn til lekkasje, ble to scenarier vurdert i arbeidet: intra-dataset-lekkasje (der evalueringbilder gjentar seg i treningsdelen av samme datasett), og inter-dataset-lekkasje (der evalueringbilder fra ett datasett er til stede i et annet datasett brukt til trening).
Med hensyn til grad, ble to nivåer definert: soft-lekkasje (der bilder ikke er identiske, men viser mindre variasjoner), og hard-lekkasje (der bilder er eksakt det samme over trenings- og evaluering).
Forskerne adresse lekkasje i termer av bildehenting, ved å bruke bilde-encodere til å representere hver bilde som en funksjonsvektor. Spørringssettet er evalueringdata, mens samlingen er treningssettet.
For mindre datasett, ble hver spørringsvektor direkte sammenlignet med alle treningsvektorer ved hjelp av kosin-ligning. For større datasett, ble et Faiss-indeks bygget for å muliggjøre raskere, K-Nearest Neighbors (KNN) søk.
Ettersom encoderen trenger å fange nok visuell informasjon for å detektere subtile likheter, men samtidig forbli effektiv i møte med svært store datamengder, la forfatterne seg på forhåndsberegnet CLIP-funksjoner gjort tilgjengelig av datasett- skaperne, i tilfelle LAION-samlingen som underbygger Stable Diffusion, og senere prosjekter.
Forfatterne bemerker at å la CLIP bruke sin destillerte forståelse av datasett (i stedet for å avhøre de faktiske filene i skala) akselererte prosessen betraktelig, og tilbød forbedret konsistens over sammenligninger.
Data og Tester
CLIP-bilde-encoderen brukt i testene for det nye arbeidet var standard CLIP ViT-B/32 opprinnelig brukt til å si fra LAION. For å etablere om diverse bilder var relatert til hverandre, ble KNN brukt under AutoFaiss.
Datasettene ble gruppert i tre typer: pre-trening datasett – store, web-skrapede samlinger brukt til å trene generalist-modeller; trenings datasett – mindre, ofte annoterte samlinger, ment for direkte modell-justering; og benchmark datasett – manuelt annotert, og brukt eksklusivt for evaluering.
Analysen dekket tyve delinger over syv datasett: Microsoft COCO ble brukt både som trenings- og evalueringsett, og omfattet trenings-, validerings-, test- og ubeskrivende delinger; Flickr30k fungerte eksklusivt som en benchmark; og Google Conceptual Captions (GCC) samlingen ble behandlet som en pre-trening kilde, med dens valideringsdel også brukt til evaluering.
I tillegg ble ImageNet brukt både til trening og benchmarking, mens LAION-400M datasett ble brukt kun til pre-trening.
OpenImages v4 bidro med trenings- og benchmarkdata, og TextCaps ga både trenings- og testdeler for evaluering.

Eksempler på bilde-annoteringer fra Googles Open Images datasett, undersøkt i det nye arbeidet. Source: https://arxiv.org/pdf/1811.00982
For å vurdere hvor godt metoden kan detektere lekkasje når bilder har blitt subt endret gjennom resizing, beskjæring eller lignende ikke-semantiske transformasjoner, testet forfatterne på Flickr30k, og valgte tilfeldig 5 000 bilder som spørringer, og brukte hele datasett som referansekolleksjonen.
Hver spørringsbilde ble transformert før den ble kodet (dvs. undergikk en ikke-semantisk modifikasjon som resizing eller beskjæring), og så matchet mot det mest liknende element i samlingen ved hjelp av kosin-ligning; en match ble bare talt hvis det opprinnelige bildet ble hentet som det øverste resultatet.
De tre encodere sammenlignet var ResNet-152; DINOv2 ViT-B/14; og CLIP ViT-B/32.
Fire typer ikke-semantiske bilde-transformasjoner ble brukt: geometrisk (flipping og rotasjoner); beskjæring (fjerning av 20, 50 eller 100 piksler fra hver kant); pikselisering (Gaussian blur, lagt til støy eller nedskalert til 128 eller 256 piksler); og farge (gråskala, inversjon eller rød, grønn eller blå overlag).

Fra supplementært materiale, eksempler på transformasjonene som ble brukt på data – typiske rutiner også i data-forstørkningsforbehandling.
Forskerne testet så for lekkasje i bildehenting:

Leakkasje-detteksjonsnøyaktighet på 5 000 Flickr30k-spørringsbilder undergitt ulike ikke-semantiske transformasjoner.
Alle tre encodere oppnådde perfekt ytelse på uendrede bilder, og CLIP forble pålitelig over beskjæring, horisontale flipping, støy og resizing, og overgikk ResNet på piksel-nivå og farge-endringer.
DINOv2 viste sterk motstandskraft mot farge-transformasjoner (sannsynligvis på grunn av sin selv-superviserte design, mener forfatterne), men var merkbart svakere på geometriske redigeringer og beskjæring – begge vanlige i dupliserte datasett.
Ettersom LAION allerede inkluderer CLIP-embeddings, og gitt dens konsistente robusthet og hastighet, ble CLIP valgt som standard-encoderen for hovedanalysen.
Hard og Soft Leakkasje
Ytelse ble evaluert over ulike kosin-ligningstrøskler for å skille mellom eksakte og nærduplikat-bilder (hard og soft lekkasje).
En trøskel på 0,98 ble valgt for å definere hard lekkasje, med ingen falske positiver og perfekt deteksjon av identiske bilder.
For soft-lekkasje ble en trøskel på 0,95 valgt, og tillot flere nærduplikater å bli hentet mens en nær null falsk positiv rate ble opprettholdt. Prioritet ble gitt til presisjon over oppkall, og funnene ble derfor konservativt estimert:

Mottaker-operatør-kurver ble brukt til å guide valget av hard og soft-trøskler for lekkasje-detteksjon. Høye AUC-poeng under både transformerte og uforandrede betingelser viser at nærduplikater kan pålitelig skilles fra urelaterte bilder, selv når minimalt endringer er til stede.
Intra-DataSet Leakkasje
Intra-dataset-lekkasje ble beregnet ved å identifisere bilde-overlapp mellom trenings- og evalueringdeler innenfor samme datasett. Bare datasett med både benchmark- og trenings- eller pre-treningdeler var berettiget, og analysen ble begrenset til COCO, GCC, ImageNet, OpenImages og TextCaps.
For COCO ble testsettet sammenlignet med treningssettet, evalueringsettet og ubeskrivende undersett, og valideringsettet mot trenings- og ubeskrivende undersett.
De høyeste ratene av intra-dataset-lekkasje ble observert i ImageNet-test- og valideringdeler, med hard-lekkasje som nådde opp til 1,58% og soft-lekkasje like under 2%. GCC og COCO fulgte, med COCO-val2017 som viste en soft-lekkasje på 3% og dens testdeler som varierte mellom 1,35% og 1,38%. OpenImages viste lav hard-lekkasje på 0,05%, men soft-lekkasje oversteg 1,3% i både test- og valideringsett. TextCaps viste den laveste totale lekkasje, på 0,69%, med ingen hard-lekkasje detektert:

Intra-dataset-lekkasje-rater, som viser andelen av hver evalueringdel som overlapper med dens tilhørende treningsdata.
Med hensyn til disse resultater, uttaler forfatterne†:
‘Disse resultatene viser at intra-dataset-lekkasje skjer i alle de analyserede datasett, enten i hard eller soft grad.
‘Gitt at data-lekkasje kan kompromittere modell-evaluering og at datasett er spesifikt designet for dette formålet, er intra-dataset-lekkasje en risiko som ved design ikke bør eksistere.
‘Likevel har vi identifisert flere eksempler i alle datasett.’
Inter-DataSet Leakkasje
For å måle inter-dataset-lekkasje (der en modell er trent på ett datasett og evaluert på et annet), ble fire datasett brukt som kilder for treningsdata: GCC-trening, ImageNet-trening, OpenImages-trening, og LAION.
Disse ble sammenlignet med evalueringdata hentet fra COCO 2014-test- og valideringdeler, Flickr30K, TextCaps-test, OpenImages-test- og valideringdeler, og ImageNet-test- og valideringdeler.
CLIP ViT-B/32-embeddings ble ekstrahert for alle datasett unntatt LAION, som tilbyr sine egne forhåndsberegnet embeddings. Imidlertid, siden disse embeddingene skiller seg litt fra de generert ved å bruke den offisielle CLIP-implementeringen, ble spørringsbildene reskalert i henhold til metoden brukt i clip-retrieval-repositoriet for å sikre kompatibilitet.
Henting ble utført ved hjelp av en KNN-søk, selv om skalaen på LAION krevde oppdeling i blokker på en million bilder, med hver indexert separat:

Inter-dataset-lekkasje mellom benchmark-datasett (kolonner) og pre-trening-datasett (rader). På venstre side ser vi ‘hard’ lekkasje (identiske bilder), og på høyre side ‘soft’ lekkasje (nærduplikater).
Kryss-dataset-lekkasje ble observert over alle benchmark-datasett, med varierende grader av alvorlighet. LAION viste de høyeste ratene av hard-lekkasje (identiske bilder), spesielt for OpenImages og TextCaps-testdata, hver av dem oversteg 3%. OpenImages bidro også med en mindre mengde hard-lekkasje til COCO.
Selv om det var mindre alvorlig, inneholdt ImageNet fortsatt harde duplikater fra hver enkelt benchmark undersøkt; og GCC viste den laveste totale hard-lekkasje, under 1%.
Soft-lekkasje (nærduplikater) var mer utbredt: LAION produserte de høyeste ratene, med opptil 7,9% overlap for visse benchmark-datasett; OpenImages og TextCaps var de mest berørte benchmark-datasett totalt; og Flickr30K viste den minste lekkasjen.
Selv om slike overlapper kan utgjøre bare en liten del av evalueringsett, bemerker forfatterne at deres tilstedeværelse kan tillate memorering og kompromittere test-gyldighet:

Eksempler på lekkede bilder. På venstre side ser vi eksempler på ‘hard’ lekkasje, der bilder er identiske innenfor ett datasett (øverst) eller mellom datasett (nederst); på høyre side ser vi eksempler på ‘soft’ lekkasje, der bilder er visuelt nærduplikater.
Effekt på Nedstrøms-Evaluering
Rapporten vurderer deretter hvordan data-lekkasje påvirker nedstrøms-evalueringer (dvs. ytelse på standardoppgaver når forhånds-trent modell testes på benchmark-datasett som inneholder duplisert treningsdata).
Tre oppgaver ble vurdert: zero-shot-klassifisering; supervisert klassifisering; og bilde-til-tekst-henting.
For hver oppgave ble modell-ytelse evaluert på et benchmark-datasett for hvilket lekkede eksempler allerede var identifisert i forhånds-treningsdata. Resultatene ble sammenlignet over fire undersett: det fullstendige benchmark-datasett; et undersett av lekkede eksempler; et undersett av ikke-lekkede eksempler; og et tilfeldig valgt undersett av samme størrelse som lekkede-gruppen (brukt som kontroll).
Effekten av data-lekkasje på tre nedstrøms-oppgaver ble målt ved hjelp av benchmark-undersett kjent for å inneholde lekkede eksempler. I zero-shot-klassifisering oppnådde en modell forhånds-trent på LAION merkbar høyere nøyaktighet på lekkede bilder fra ImageNet-evalueringsettet, og bekreftet at eksponering for selv nærduplikater under trening gir en målbart fordel:

Zero-shot-klassifisering-nøyaktighet på ImageNet-valideringsettet over undersett med og uten lekkasje. Den siste kolonnen rapporterer nøyaktighetsgevinster i forhold til det fullstendige settet, og høydepunkter radene som tilsvarer lekkede undersett.
I supervisert klassifisering forårsaket lekkasje i ImageNet en dramatisk ytelsesnedgang – med mindre det lekkede bildet hadde samme merke i begge deler, i hvilket tilfelle modellen oppnådde nesten perfekt nøyaktighet, og avslørte en sterk memoreringseffekt:

Supervisert klassifisering-nøyaktighet på ImageNet-valideringsettet for undersett med og uten lekkasje. Gevinst-kolonner viser endring i forhold til det fullstendige settet. Lekkede undersett er høydepunkter.
I bilde-til-tekst-henting forbedret ytelsen igjen for lekkede eksempler, med både hard og soft-lekkasje som førte til høyere tilbakekall, og med lekkede undersett som også ga mer konsistente resultater over løp:

Bilde-til-tekst-henting-ytelse på Flickr30k over undersett med og uten lekkasje, med lekkede undersett høydepunkter.
Forfatterne konkluderer:
‘Totalt sett [viser vi] konsistent bevis for at lekkasje utgjør en alvorlig trussel mot rettferdig modell-evaluering i visuelle datasett, og kompromitterer en av de mest grunnleggende maskinlærings-prinsippene: å ikke evaluere modeller på deres treningsdata.’
Konklusjon
En chokerende aspekt av rapporten, selv om det ikke er noen nyhet, er beskrivelsen av behovet for å bruke CLIP til å oppnå embeddings for den enorme mengden bilde-data i LAION, som representerer en skala som ikke lenger kan håndteres på noen annen måte enn agregat, og håndtering av tokenisert metadata i stedet for de mer detaljerte egenskapene som kan inspiseres når et datasett er mer håndterbart.
Det er en skarp illustrasjon av omfanget av hvilken grad treningsprosessen for visuell-språk-modeller har overskredet grensene og evnene til menneskelig tilsyn, eller noen form for manuell kurasjon utover representative under-eksempler.
* Kanskje noe forvirrende, er problemet med duplikasjon definert i rapporten som ‘lekkasje’.
† Forfatterens betoning.
Først publisert tirsdag, 26. august 2025












