Andersons vinkel

Den ‘Rogue’ Data Forurening Generative AI Performance

mm
Føj Unite.AI til dine foretrukne kilder på Google
Flux Dev, Firefly.

En ny studie viser, at mange populære billedsæt, der bruges til at træne AI-modeller, er forurenet med testbilleder eller næsten-duplikater, hvilket giver modellerne mulighed for at snyde ved at huske svarene i stedet for at lære. Lækagen er udbredt, men generelt upåagtet, og den forvrænger stille scoren og giver modeller, der er trænet på web-skala data, en uretfærdig fordel.

 

Når du tager en køreprøve, fortælles du normalt ikke på forhånd, hvilke veje der vil blive brugt til prøven. Hvis du gjorde (og du manglede en smule integritet), kunne du ‘optimerer’ for prøven ved at øve gentagne gange på den rute, i stedet for at udvikle bredere kørefærdigheder, der kan håndtere enhver rute på en rimelig måde.

I træningen af maskinelæringsmodeller er dette en rimelig analogi for en testdeling – en opdeling af træningssætdata mellem (normalt) en 70%-deling for data, der vil blive brugt til at træne modellen, og de resterende 30% bruges som ‘i felten’ data.

Siden ‘i felten’ data aldrig er set af modellen, kan det antages, at modellen er effektiv og yderligere, hvis den klarer sig godt på den data; hvis ikke, kan modellen have overfittet på et velafbalanceret sæt – eller også dataene havde brug for ekstra kuratering og definition.

Uanset hvad, ikke at evaluere modeller på deres træningsdata er hjørnestenen i nuværende metode i AI-forskning og udvikling.

Samme igen, tak

Ifølge en ny forskningsrapport fra Japan har computer vision og generative AI-forskningssæktoren ikke nær matcher indsatsen fra LLM-forskere for at sikre, at testdata ikke forurener træningsdata; i tests fandt forskerne, at hver hyperskala vision dataset, de undersøgte, herunder de, der driver nogle af de største nuværende generative AI-systemer, har i visse tilfælde tilladt, at deres testdata er gået over i deres træningsdata – hvilket betyder, at benchmarks og ydelsesrapporter for modeller, der er trænet på disse splits, ikke vil være mere præcise end en eksamensresultat fra nogen, der sneg sig ind i eksaminationssalen, og vil ikke afspejle virkelige præstationer på ægte nye data.

Eksempler på dataforurening fundet af forskerne, hvor duplikat eller næsten-duplikat datapunkter findes i både trænings- og testdata. Kilde: https://arxiv.org/pdf/2508.17416

Eksempler på dataforurening fundet af forskerne, hvor duplikat eller næsten-duplikat datapunkter findes i både trænings- og testdata. Kilde: https://arxiv.org/pdf/2508.17416

I billedet ovenfor, fra den nye rapport, ser vi eksempler på enten duplikat eller næsten-duplikat datapunkter fundet i både kerne-træningsdata og testdata for en række modeller – nok til at ugyldiggøre modellens ydelse på den data og lette dens generelle score over hele linjen, hvilket giver en illusion af en niveau af generalisering, som modellen måske ikke faktisk har opnået.

For at gøre sagen mere kompliceret, synes forureningen at optræde på tværs af en diversitet af mulige scenarier, herunder ‘prætræning‘, hvor vægtene af ældre oprindelsesmodeller bruges til at ‘starte’ en ny model. Hvis den oprindelige, ældre model har nogle af de samme data som den nyere dataset, der er under prætræning, kan datapunktslækage optræde, selv hvis 70/30- eller 80/20-splitten er ren.

Kumulativ Effekt

Dette er næsten sikkert at optræde, selv i de seneste datasets: Omfanget af vision/sprog-datasets er vokset enormt over de seneste fem år, og omfatter ikke kun den nyeste billeddata på internettet, men også genhøstning af meget af den samme data, der befolker de ældre, historiske datasets.

Desuden er automatiserede rutiner designet til at trawle og filtrere milliarder af billeder for duplikater og næsten-duplikater nu konfronteret med en sådan en byrdefuld opgave, at kuratering i sig selv – dens omkostninger i form af tid og penge – nu må være en del af budgetbegrænsningerne

Imens er billed duplikation en uundgåelig konsekvens af den type ad hoc web-trawling bag massive samlinger som Common Crawl, på grund af den almindelige praksis med at genpublicere og genkomprimere billeder og anvende redigeringer såsom beskæringer og endda flipping (for at undgå opdagelse, når billedet måske er blevet brugt uden tilladelse, for eksempel).

Forfatterne bemærker*:

‘Dataforurening er et udbredt problem, der findes i de fleste visuelle datasets. Forurening kan skjule modellens generaliseringsfærdighed, hvilket er særligt problematisk, når modeller trænet på forskellige datasets sammenlignes, hvilket fører til urimelige sammenligninger.

‘Vi opfordrer dataset-designere til at overveje implikationerne af disse evalueringer. For en mere retfærdig model-evaluering anbefaler vi brugen af duplikatdetektorer, der tager både hård og blød forurening i betragtning.

‘Ideelt set burde lækagede billeder fjernes fra træningssættet, og hvis det ikke er muligt, burde de i hvert fald fjernes fra test-sættet.’

Rapporten udvider på en række tests, som forskerne har udført på massive og populære datasets – hver enkelt af dem viste et vis niveau af forurening.

Den nye rapport har titlen Dataforurening i Visuelle Datasets og kommer fra tre forskere ved University of Osaka.

Metode

Rapportens forfattere definerer forurening i tre dimensioner: modalitet, dækning og grad.

Modalitet skelner, om kun billeder eller både billeder og mærker er eksponeret; dækning identificerer, om overlapet forekommer inden for det samme dataset eller på tværs af forskellige datasets; og grad definerer, om den duplikerede indhold er nøjagtig det samme eller kun næsten det samme.

Med hensyn til forurening overvejer arbejdet to scenarier: intra-dataset-forurening (hvor evaluering af billeder genoptræder i træningssplitten af det samme dataset) og inter-dataset-forurening (hvor evaluering af billeder fra ét dataset er til stede i et andet dataset, der bruges til træning).

Med hensyn til grad defineres to niveauer: blød forurening (hvor billeder ikke er identiske, men viser mindre variationer) og hård forurening (hvor billeder er nøjagtig det samme på tværs af træning og evaluering).

Forskerne beskæftiger sig med detektion af forurening i form af billedhenting, ved hjælp af billedencodere til at repræsentere hvert billede som en funktionvektor. Spørgsættet er evalueringdata, mens samlingen er træningssættet.

For mindre datasets blev hver spørgsætsvektor direkte sammenlignet med alle træningsvektorer ved hjælp af cosinuslighed. For større datasets blev et Faiss-indeks opbygget for at muliggøre hurtigere K-Nearest Neighbors (KNN) søgning.

Da encoderen skal fange nok visuel information til at detektere subtile ligheder, men stadig forblive effektiv i forhold til meget store mængder af data, hvilede forfatterne på forudberegnede CLIP-funktioner, der var til rådighed fra dataset-creatorerne, i tilfældet af LAION-samlingen, der underbygger Stable Diffusion, og senere projekter.

Forfatterne bemærker, at det at lade CLIP bruge sin destillerede forståelse af datasettet (i stedet for at afhøje de faktiske filer i skala) accelererede processen betydeligt og tilbød forbedret konsistens på tværs af sammenligninger.

Data og Tests

CLIP-billedencoderen, der blev brugt i tests for det nye arbejde, var standard CLIP ViT-B/32 originally brugt til at si LAION. For at fastslå, om diverse billeder var relaterede til hinanden, blev KNN brugt under AutoFaiss.

Datasets blev grupperet i tre typer: prætræning-datasets – store, web-skrapede samlinger brugt til at træne generalistmodeller; træning-datasets – mindre, ofte annoterede samlinger, beregnet til direkte modeltilpasning; og benchmark-datasets – manuelt annoterede og brugt udelukkende til evaluering.

Analysen dækkede tyve splits på tværs af syv datasets: Microsoft COCO blev brugt både som træningssæt og evalueringssæt, og omfattede træning, validering, test og ubeskedne splits; Flickr30k fungerede udelukkende som benchmark; og Google Conceptual Captions (GCC) samlingen blev behandlet som en prætræningssource, med dens valideringsdel også brugt til evaluering.

Desuden blev ImageNet brugt til både træning og benchmarking, mens LAION-400M-datasettet blev brugt udelukkende til prætræning.

OpenImages v4 bidrog med både trænings- og benchmarkdata, og TextCaps leverede både træning og test splits til evaluering.

Eksempler på billedannotationer fra Googles Open Images-dataset, undersøgt i det nye arbejde. Kilde: https://arxiv.org/pdf/1811.00982

Eksempler på billedannotationer fra Googles Open Images-dataset, undersøgt i det nye arbejde. Kilde: https://arxiv.org/pdf/1811.00982

For at vurdere, hvor godt metoden kan detektere forurening, når billeder er blevet subt ændret gennem resizing, beskæring eller lignende ikke-semantiske transformationer, testede forfatterne på Flickr30k, hvor de tilfældigt valgte 5.000 billeder som spørgsmål og brugte hele datasettet som reference-samlingen.

Hvert spørgsmålsbillede blev transformeret, før det blev kodet (dvs. underlagt en ikke-semantisk ændring såsom resizing eller beskæring), og derefter matchet til det mest lignende element i samlingen ved hjælp af cosinuslighed; en match blev kun talt, hvis det originale billede blev returneret som det øverste resultat.

De tre encodere, der blev sammenlignet, var ResNet-152; DINOv2 ViT-B/14; og CLIP ViT-B/32.

Fire typer ikke-semantiske billedtransformationer blev brugt: geometrisk (flips og rotationer); beskæring (fjernelse af 20, 50 eller 100 pixels fra hver kant); pixelisering (Gaussian blur, tilføjet støj eller downsampling til 128 eller 256 pixels); og farve (gråtone, inversion eller rød, grøn eller blå overlays).

Fra supplementmaterialet, eksempler på transformationer, der er anvendt på dataene – typiske rutiner, der også anvendes i dataforstærkning-forarbejdning.

Fra supplementmaterialet, eksempler på transformationer, der er anvendt på dataene – typiske rutiner, der også anvendes i dataforstærkning-forarbejdning.

Derefter testede forfatterne for forurening i billedhenting:

Forureningsdetektionsnøjagtighed på 5.000 Flickr30k-spørgsmålsbilleder, der er underlagt forskellige ikke-semantiske transformationer.

Forureningsdetektionsnøjagtighed på 5.000 Flickr30k-spørgsmålsbilleder, der er underlagt forskellige ikke-semantiske transformationer.

Alle tre encodere opnåede perfekt præstation på uændrede billeder og CLIP forblev pålidelig på tværs af beskæring, horisontale flips, støj og resizing, og overgik ResNet på pixelniveau og farveændringer.

DINOv2 viste stærk modstand over for farvetransformationer (sandsynligvis på grund af sin selv-tilsyneladende design, mener forfatterne), men var bemærkelsesværdigt svagere på geometriske redigeringer og beskæring – begge dele er almindelige i duplikerede datasets.

Da LAION allerede indeholder CLIP-indlejring, og på grund af dens konsekvente robusthed og hastighed, blev CLIP valgt som standard-encoderen til den primære analyse.

Hård og Blød Forurening

Præstationen blev evaluaret på tværs af forskellige cosinuslighedstrøskler for at skelne mellem nøjagtige og næsten-duplikat billeder (hård og blød forurening).

En trøskel på 0,98 blev valgt til at definere hård forurening, hvilket resulterede i ingen falske positive og perfekt detektion af identiske billeder.

For blød forurening blev en trøskel på 0,95 valgt, hvilket tillod mere næsten-duplikater at blive hentet, mens en næsten-nul falsk positiv rate blev opretholdt; prioritet blev givet til præcision over opkald, og fundene blev derfor konservativt estimeret:

Modtager-operatør-kurver blev brugt til at vejlede valget af hård og blød forureningstrøskler. Høje AUC-scores under både transformeret og uændret betingelser viser, at næsten-duplikater kan pålideligt skelnes fra ikke-relaterede billeder, selv når minimal ændring er til stede.

Modtager-operatør-kurver blev brugt til at vejlede valget af hård og blød forureningstrøskler. Høje AUC-scores under både transformeret og uændret betingelser viser, at næsten-duplikater kan pålideligt skelnes fra ikke-relaterede billeder, selv når minimal ændring er til stede.

Intra-Dataset Forurening

Intra-dataset forurening blev beregnet ved at identificere billedoverlap mellem træning og evalueringssplits inden for det samme dataset. Kun datasets med både benchmark og træning eller prætræningssplits var berettigede, hvilket begrænsede analysen til COCO, GCC, ImageNet, OpenImages og TextCaps.

For COCO blev test-sættet sammenlignet med træningssættet, evalueringssættet og ubeskedne undergrupper, og valideringssættet sammenlignet med træningssættet og ubeskedne undergrupper.

De højeste rater af intra-dataset forurening blev observeret i ImageNet-test og valideringssplits, med hård forurening op til 1,58% og blød forurening lige under 2%. GCC og COCO fulgte, med COCO val2017 visende en blød forurening på 3% og dens test-splits rangerende mellem 1,35% og 1,38%. OpenImages viste lav hård forurening på 0,05%, men blød forurening oversteg 1,3% i både test og valideringssæt. TextCaps viste den laveste samlede forurening, på 0,69%, med ingen hård forurening detekteret:

Intra-dataset forureningsrater, der viser den proportion af hver evalueringssplit, der overlapper med dens tilhørende træningssæt.

Intra-dataset forureningsrater, der viser den proportion af hver evalueringssplit, der overlapper med dens tilhørende træningssæt.

Med hensyn til disse resultater bemærker forfatterne†:

‘Disse resultater viser, at intra-dataset forurening forekommer i alle de analyserede datasets, enten i dens hård eller blød grad.

‘Givet, at dataforurening kan kompromittere model-evaluering og at datasets specifikt er designet til dette formål, er intra-dataset forurening en risiko, der ved design ikke burde eksistere.

‘Alligevel har vi identificeret flere eksempler i alle datasets.’

Inter-Dataset Forurening

For at måle inter-dataset forurening (hvor en model trænes på ét dataset og evalueres på et andet) blev fire datasets brugt som kilder til træningsdata: GCC træning, ImageNet træning, OpenImages træning og LAION.

Disse blev matchet mod evalueringdata fra COCO 2014 test- og valideringssplit, Flickr30K, TextCaps test, OpenImages test- og valideringssplit og ImageNet test- og valideringssplit.

CLIP ViT-B/32-indlejring blev ekstraheret for alle datasets, undtagen LAION, som leverer sine egne forudberegnede indlejring. Imidlertid, da disse indlejring adskiller sig lidt fra dem, der er genereret ved hjælp af den officielle CLIP-implementation, blev spørgsmålsbillederne reskaleret i overensstemmelse med metoden brugt i clip-retrieval-repositoriet for at sikre kompatibilitet.

Henting blev udført ved hjælp af en KNN-søgning, selv om omfanget af LAION krævede partitionering i blokke på en million billeder, hvor hver blev indekseret separat:

Inter-dataset forurening mellem benchmark-datasets (kolonner) og prætrænings-datasets (rækker). På venstre side ser vi 'hård' forurening (identiske billeder), og på højre side 'blød' forurening (næsten-duplikater).

Inter-dataset forurening mellem benchmark-datasets (kolonner) og prætrænings-datasets (rækker). På venstre side ser vi ‘hård’ forurening (identiske billeder), og på højre side ‘blød’ forurening (næsten-duplikater).

Forurening på tværs af dataset blev observeret på tværs af alle benchmark-datasets, med varierende grader af alvorlighed. LAION viste de højeste rater af hård forurening (identiske billeder), især for OpenImages og TextCaps testdata, hver af dem oversteg 3%. OpenImages bidrog også med en mindre mængde hård forurening til COCO.

Selv om det var mindre alvorligt, indeholdt ImageNet stadig hård duplikater fra hver benchmark, der blev undersøgt; og GCC viste den laveste samlede hård forurening, under 1%.

Blød forurening (næsten-duplikater) var mere udbredt: LAION producerede igen de højeste rater, med op til 7,9% overlap for visse benchmarks; OpenImages og TextCaps var de mest berørte benchmarks samlet; og Flickr30k viste den mindste forurening.

Selv om sådanne overlap kan udgøre kun en lille del af evalueringssæt, bemærker forfatterne, at deres tilstedeværelse kan tillade memorering og kompromittere testgyldighed:

Eksempler på lækagede billeder. På venstre side ser vi tilfælde af 'hård' forurening, hvor billeder er identiske inden for et dataset (top) eller mellem datasets (bunden); på højre side ser vi tilfælde af 'blød' forurening, hvor billeder er visuelt næsten-identiske.

Eksempler på lækagede billeder. På venstre side ser vi tilfælde af ‘hård’ forurening, hvor billeder er identiske inden for et dataset (top) eller mellem datasets (bunden); på højre side ser vi tilfælde af ‘blød’ forurening, hvor billeder er visuelt næsten-identiske.

Effekt på Downstream Evaluering

Rapporten overvejer derefter, hvordan dataforurening påvirker downstream-evalueringer (dvs. ydelse på standardopgaver, når fortrænede modeller testes på benchmarks, der indeholder duplikeret træningsdata).

Tre opgaver blev overvejet: zero-shot klassifikation; overvåget klassifikation; og tekst-billede-henting.

For hver opgave blev modelpræstation evalueret på en benchmark-dataset, hvor lækagede eksempler allerede var identificeret inden for prætræningsdata. Resultaterne blev sammenlignet på tværs af fire undergrupper: det fulde benchmark; en undergruppe af lækagede eksempler; en undergruppe af ikke-lækagede eksempler; og en tilfældigt valgt undergruppe af samme størrelse som den lækagede gruppe (brugt som kontrol).

Effekten af dataforurening på tre downstream-opgaver blev målt ved hjælp af benchmark-undergrupper, der var kendt for at indeholde lækagede billeder. I zero-shot klassifikation opnåede en model, der var fortrænet på LAION, bemærkelsesværdigt højere nøjagtighed på lækagede billeder fra ImageNet-evalueringssættet, hvilket bekræfter, at eksponering for selv næsten-duplikater under træning giver en målbart fordel:

Zero-shot klassifikationsnøjagtighed på ImageNet-valideringssættet på tværs af undergrupper med og uden forurening. Den sidste kolonne rapporterer nøjagtighedsforbedring i forhold til det fulde sæt, og højligtede rækker svarer til lækagede undergrupper.

Zero-shot klassifikationsnøjagtighed på ImageNet-valideringssættet på tværs af undergrupper med og uden forurening. Den sidste kolonne rapporterer nøjagtighedsforbedring i forhold til det fulde sæt, og højligtede rækker svarer til lækagede undergrupper.

For overvåget klassifikation forårsagede forurening i ImageNet en dramatisk præstationsfald – medmindre det lækagede billede havde samme mærke i begge splits, i hvilket tilfælde modellen opnåede næsten-perfekt nøjagtighed, hvilket afslører en stærk memoreringseffekt:

Overvåget klassifikationsnøjagtighed på ImageNet-valideringssættet for undergrupper med og uden forurening. Forbedringskolonner viser ændringen i forhold til det fulde sæt. Lækagede undergrupper er højligtede.

Overvåget klassifikationsnøjagtighed på ImageNet-valideringssættet for undergrupper med og uden forurening. Forbedringskolonner viser ændringen i forhold til det fulde sæt. Lækagede undergrupper er højligtede.

I billed-til-tekst-henting forbedredes præstation igen for lækagede eksempler, med både hård og blød forurening, der førte til højere recall, og med lækagede undergrupper, der også gav mere konsistente resultater på tværs af kørsler:

Billed-til-tekst-hentingspræstation på Flickr30k på tværs af undergrupper med og uden forurening, med lækagede undergrupper højligtede.

Billed-til-tekst-hentingspræstation på Flickr30k på tværs af undergrupper med og uden forurening, med lækagede undergrupper højligtede.

Forfatterne konkluderer:

‘Samlet set viser vi konsistent bevis for, at forurening udgør en alvorlig trussel mod retfærdig model-evaluering i visuelle datasets, og kompromitterer en af de mest fundamentale maskinlæringsprincipper: ikke at evaluere modeller på deres træningsdata.’

Konklusion

En chokerende aspekt af rapporten, selv om det ikke er noget nyt, er beskrivelsen af, at CLIP skal bruges til at få indlejring for den enorme mængde billeddata i LAION, hvilket repræsenterer en skala, der ikke længere kan håndteres på anden vis end agregat, og omhandler tokeniseret metadata i stedet for de mere detaljerede egenskaber, der kan inspiceres, når et dataset er mere håndterbart.

Det er en skarp illustration af, hvor langt træningen af vision-sprog-modeller har overskredet grænserne for og evnerne hos menneskelig oversigt, eller enhver form for manuel kuratering ud over repræsentative underprøver.

 

* Kanskje lidt forvirrende, er problemet med duplikation defineret i rapporten som ‘forurening’.

† Forfatterens fremhævelse.

Først udgivet tirsdag, 26. august 2025

Forfatter inden for maskinlæring, domænespecialist i menneskelig billedsyntese. Tidligere chef for forskningsindhold hos Metaphysic.ai, indtil den blev opløst i DNEGs Brahma.ai.
Websted: martinanderson.ai
Kontakt: martin@martinanderson.ai