Andersonův úhel

‘Rogue’ Data Znečišťující Generativní AI Performance

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Flux Dev, Firefly.

Nová studie zjistila, že mnoho populárních obrazových datových sad používaných pro trénování modelů AI je kontaminováno testovacími obrázky nebo near-duplicity, což umožňuje modelům podvádět tím, že si pamatují odpovědi místo toho, aby se učily. Únik je široce rozšířen, ale obecně nezjištěn, a tiše zvyšuje skóre a poskytuje nespravedlivé výhody modelům trénovaným na web-škálových datech.

 

Když jste na řízení, obvykle vám není řečeno, které přesně cesty budou použity pro test. Pokud byste to věděli (a vy byste byli trochu postrádající integritu), mohli byste “optimalizovat” pro test tím, že byste opakovaně cvičili na té trase, místo toho, abyste vyvinuli širší řidičské dovednosti, které mohou zvládnout jakoukoli trasu rozumně dobře.

Při trénování modelů strojového učení je to rozumná analogie pro testovací split – rozdělení trénovací sady dat mezi (obvykle) 70% split pro data, která budou použita pro trénování modelu, a zbývajících 30% pro “v terénu” data.

Pokud model dobře funguje na tomto datu, lze předpokládat, že je efektivní a výkonný; pokud ne, model může mít přeučený na dobře vyvážené sadě – nebo jinak data potřebovala další kuraci a definici.

Buď jak buď, ne hodnocení modelů na jejich trénovacích datech je základní kámen současné metody v AI výzkumu a vývoji.

Stejně znovu, prosím

Podle nové výzkumné práce z Japonska se počítačové vidění a generativní AI výzkumová sekce vůbec nevyrovnala úsilí LLM výzkumníků, aby se zajistilo, že testovací data neznečišťují trénovací data; ve testech výzkumníci zjistili, že každá hyperscale vizuální datová sada, kterou studovali, včetně těch, které pohání některé z největších současných generativních AI systémů, do jisté míry umožnila, aby se testovací data překrývala s trénovacími daty – což znamená, že benchmarky a výkonnostní zprávy pro modely trénované na těchto rozděleních nebudou přesnější než výsledek zkoušky od někoho, kdo si do zkoušky přinesl podvodný materiál, a nebudou odrážet skutečný výkon ve skutečném světě na skutečně nových datech.

Příklady kontaminace dat nalezené výzkumníky, kde existují duplikátní nebo near-duplikátní datové body v obou trénovacích a testovacích datech. Zdroj: https://arxiv.org/pdf/2508.17416

Příklady kontaminace dat nalezené výzkumníky, kde existují duplikátní nebo near-duplikátní datové body v obou trénovacích a testovacích datech. Zdroj: https://arxiv.org/pdf/2508.17416

Na obrázku výše, z nové práce, vidíme příklady buď duplikátních nebo near-duplikátních datových bodů nalezených v obou jádru trénovacích dat a testovacích dat různých modelů – dostatečně na to, aby zrušily výkon modelu na těch datech, a lehce zvýšily jeho obecné skóre, což usnadňuje vzhled generalizace, kterého model možná ve skutečnosti nedosáhl.

Aby věci byly ještě složitější, kontaminace se zdá objevovat napříč různými scénáři, včetně ‘předběžného trénování‘, kde se váhy starších předchozích modelů používají k “spuštění” nového modelu. Pokud má předchozí model některé stejné datové body jako novější datová sada, která je předběžně trénována, může dojít k úniku dat, i když je 70/30 nebo 80/20 split čistý.

Kumulativní efekt

Toto je téměř jisté, že se stane i u velmi nejnovějších datových sad: rozsah vizuálních/jazykových datových sad enormně vzrostl za posledních pět let, zahrnující nejen nejnovější obrazová data na webu, ale i znovupoužívání velké části stejných dat, která obsazovala ty starší, historické datové sady.

Dále, automatizované rutiny navržené pro prohledávání a filtrování miliard obrázků pro duplikáty a near-duplikáty jsou nyní tak náročné, že kurace sama o sobě – její cena v čase a penězích – musí být nyní zvažována v kontextu rozpočtových omezení

Zatímco obrazová duplikace je nevyhnutelným důsledkem ad hoc webového prohledávání za velkými sbírkami, jako je Common Crawl, kvůli běžné praxi opětovného zveřejňování a rekompresi obrázků a aplikaci úprav, jako jsou ořezávání, a dokonce i otočení (aby se zabránilo detekci, když může být obrázek použit bez povolení, například).

Autoři pozorují*:

‘Únik dat je široce rozšířený problém, který se vyskytuje ve většině vizuálních datových sad. Únik může zastínit schopnost generalizace modelů, což je zvláště problematické, když se porovnávají modely trénované na různých datech, což vede k nespravedlivým srovnáním.

‘Doporučujeme návrhářům datových sad pečlivě zvažovat důsledky těchto hodnocení. Pro spravedlivější hodnocení modelů doporučujeme použití detektorů duplikátů, které zvažují jak tvrdý, tak i měkký únik.

‘Ideálně by měly být únikové obrázky odstraněny z trénovací sady a pokud je to možné, měly by být alespoň odstraněny z testovací sady.’

Práce se podrobněji zabývá řadou testů, které výzkumníci provedli na velkých a populárních datech – každá z nich prokázala určitou úroveň kontaminace.

Nová práce se jmenuje Únik dat ve vizuálních datech a pochází od tří výzkumníků z Univerzity v Osace.

Metoda

Autoři práce definují únik v termínech tří dimenzí: modality, pokrytí a stupeň.

Modality rozlišuje, zda jsou pouze obrázky únikem nebo zda jsou únikem i obrázky a popisky; pokrytí identifikuje, zda se překrytí vyskytuje uvnitř stejné datové sady nebo napříč různými datovými sadami; a stupeň definuje, zda je duplikovaný obsah přesně stejný nebo pouze blízký.

Vzhledem k úniku jsou dvě scénáře zvažovány v práci: intra-datová únik (kdy se vyhodnocovací obrázky znovu objevují v trénovacím splitu stejné datové sady) a inter-datová únik (kdy se vyhodnocovací obrázky z jedné datové sady objevují v jiné datové sadě používané pro trénování).

Vzhledem ke stupni jsou dva úrovně definovány: měkký únik (kdy jsou obrázky identické, ale vykazují malé variace) a tvrdý únik (kdy jsou obrázky přesně stejné napříč trénovacími a vyhodnocovacími daty).

Výzkumníci se zabývají detekcí úniku z hlediska obrazové rekonstrukce, pomocí obrazových encoderů pro reprezentaci každého obrázku jako funkční vektor. Vyhodnocovací sada je testovací data, zatímco sbírka je trénovací sada.

Pro menší datové sady byl každý dotazový vektor přímo porovnán se všemi trénovacími vektory pomocí kosinové podobnosti. Pro větší datové sady byl vytvořen Faiss index, aby umožnil rychlejší, K-Nearest Neighbors (KNN) hledání.

Pоскольку encoder potřebuje zachytit dostatečné vizuální informace, aby detekoval jemné podobnosti, ale zároveň zůstal efektivní tváří v tvář velmi velkým objemům dat, autoři se spoléhali na předem vypočítané CLIP funkce poskytnuté tvůrci datových sad, v případě LAION kolekce, která je základem Stable Diffusion a pozdějších projektů.

Autoři poznamenávají, že umožnění CLIPu použít jeho destilovanou znalost datové sady (místo dotazování skutečných souborů v měřítku) značně urychloval proces a nabízelo lepší konzistenci napříč porovnáními.

Data a testy

CLIP obrazový encoder použitý v testech pro novou práci byl výchozí CLIP ViT-B/32 původně použitý pro prosévání LAION. Pro stanovení, zda jsou různé obrázky související, byl použit KNN pod AutoFaiss.

Datové sady byly rozděleny do tří typů: předběžné trénování datové sady – velké, webové datové sady používané pro trénování generalistických modelů; trénovací datové sady – menší, často anotované kolekce, určené pro přímé ladění modelů; a benchmark datové sady – ručně anotované a používané výhradně pro hodnocení.

Analýza pokrývala dvacet splitů napříč sedmi datovými sadami: Microsoft COCO byl použit jako trénovací i testovací sada, zahrnující trénovací, validační, testovací a nelabelované split; Flickr30k sloužil výhradně jako benchmark; a Google Conceptual Captions (GCC) kolekce byla použita jako předběžné trénovací zdroj, s jeho validační částí také použitou pro hodnocení.

Dále ImageNet byl použit pro trénování i benchmarking, zatímco LAION-400M datová sada byla použita pouze pro předběžné trénování.

OpenImages v4 přispěl trénovacími i benchmarkními daty a TextCaps poskytl trénovací i testovací split pro hodnocení.

Příklady obrazových anotací z Google Open Images datové sady, prozkoumané v nové práci. Zdroj: https://arxiv.org/pdf/1811.00982

Příklady obrazových anotací z Google Open Images datové sady, prozkoumané v nové práci. Zdroj: https://arxiv.org/pdf/1811.00982

Pro posouzení, jak dobře metoda detekuje únik, když jsou obrázky jemně pozměněny prostřednictvím změny velikosti, ořezání nebo podobných ne-semantických transformací, autoři otestovali na Flickr30k, náhodně vyberouce 5 000 obrázků jako dotazy a používající celou datovou sadu jako referenční sbírku.

Každý dotazový obrázek byl transformován před zakódováním (tj. podroben ne-semantické modifikaci, jako je změna velikosti nebo ořezání) a poté spárován s nejpodobnějším položkou ve sbírce pomocí kosinové podobnosti; shoda byla počítána pouze v případě, že původní obrázek byl získán jako nejlepší výsledek.

Tři encodery porovnávané byly ResNet-152; DINOv2 ViT-B/14; a CLIP ViT-B/32.

Čtyři typy ne-semantických obrazových transformací byly použity: geometrické (otočení a rotace); ořezání (odstranění 20, 50 nebo 100 pixelů z každé hrany); pixelizace (Gaussova rozostření, přidání šumu nebo downsampling na 128 nebo 256 pixelů); a barevné (šedá, inverze nebo červené, zelené nebo modré překrytí).

Z dodatkového materiálu, příklady transformací aplikovaných na data – typické rutiny také v předzpracování datových augmentací.

Z dodatkového materiálu, příklady transformací aplikovaných na data – typické rutiny také v předzpracování datových augmentací.

Autoři poté otestovali únik v obrazové rekonstrukci:

Přesnost detekce úniku na 5 000 Flickr30k dotazových obrázků podrobených různým ne-semantickým transformacím.

Přesnost detekce úniku na 5 000 Flickr30k dotazových obrázků podrobených různým ne-semantickým transformacím.

Všechny tři encodery dosáhly dokonalého výkonu na nezměněných obrázcích a CLIP zůstal spolehlivý napříč ořezáním, horizontálními otočením, šumem a změnou velikosti, překonávající ResNet na pixelové a barevné změny.

DINOv2 ukázal silnou odolnost vůči barevným transformacím (pravděpodobně kvůli jeho samo-supervizované konstrukci, jak autoři míní), ale byl zřetelně slabší na geometrické úpravy a ořezání – obě jsou běžné v duplikovaných datech.

Jelikož LAION již obsahuje CLIP embeddings a vzhledem k jeho konzistentní robustnosti a rychlosti, CLIP byl vybrán jako výchozí encoder pro hlavní analýzu.

Tvrdý a měkký únik

Výkon byl vyhodnocen napříč různými kosinovými podobnostními prahovými hodnotami pro rozlišení mezi přesně identickými a near-duplikátními obrázky (tvrdý a měkký únik).

Prahová hodnota 0,98 byla vybrána pro definici tvrdého úniku, což vedlo k žádným falešným pozitivům a dokonalé detekci identických obrázků.

Pro měkký únik byla vybrána prahová hodnota 0,95, což umožnilo více near-duplikátů, zatímco udržovalo téměř nulovou falešnou pozitivní míru. Priorita byla dána přesnosti nad rekapitulací a zjištění byla proto konzervativně odhadnuta:

Křivky přijímače operátorů byly použity pro výběr tvrdých a měkkých prahových hodnot pro detekci úniku. Vysoké AUC skóre pod oběma transformovanými a ne-transformovanými podmínkami ukazuje, že near-duplikáty lze spolehlivě rozlišit od nesouvisejících obrázků, i když jsou minimální úpravy přítomny.

Křivky přijímače operátorů byly použity pro výběr tvrdých a měkkých prahových hodnot pro detekci úniku. Vysoké AUC skóre pod oběma transformovanými a ne-transformovanými podmínkami ukazuje, že near-duplikáty lze spolehlivě rozlišit od nesouvisejících obrázků, i když jsou minimální úpravy přítomny.

Intra-datový únik

Intra-datový únik byl spočítán identifikací obrazového překrytí mezi trénovacími a vyhodnocovacími splity uvnitř stejné datové sady. Pouze datové sady s benchmarkními a trénovacími nebo předběžnými splity byly způsobilé, zužující analýzu na COCO, GCC, ImageNet, OpenImages a TextCaps.

Pro COCO byl testovací set porovnán proti trénovacímu setu, validačnímu setu a nelabelovanému subsetu a validační set proti trénovacímu a nelabelovanému subsetu.

Nejvyšší míry intra-datového úniku byly pozorovány v ImageNet testovacím a validačním splitu, s tvrdým únikem dosahujícím až 1,58% a měkkým únikem mírně pod 2%. GCC a COCO následovaly, s COCO val2017 ukazující měkký únik 3% a jeho testovacími splitu se pohybujícími mezi 1,35% a 1,38%. OpenImages vykazoval nízký tvrdý únik na 0,05%, ale měkký únik překročil 1,3% v obou testovacích a validačních setech. TextCaps ukázal nejnižší celkový únik, na 0,69%, s žádným tvrdým únikem detekovaným:

Míry intra-datového úniku, ukazující podíl každé vyhodnocovací splitu, která se překrývá s jejími přidruženými trénovacími daty.

Míry intra-datového úniku, ukazující podíl každé vyhodnocovací splitu, která se překrývá s jejími přidruženými trénovacími daty.

Vzhledem k těmto výsledkům autoři uvádějí†:

‘Tyto výsledky ukazují, že intra-datový únik se vyskytuje ve všech analyzovaných datech, buď v jeho tvrdé nebo měkké míře.

‘Vzhledem k tomu, že únik dat může ohrozit hodnocení modelu a že datové sady jsou speciálně navrženy pro tento účel, intra-datový únik je riziko, které by design nemělo existovat.

‘Přesto jsme identifikovali několik instancí ve všech datech.’

Inter-datový únik

Pro měření inter-datového úniku (kdy je model trénován na jedné datové sadě a vyhodnocen na jiné) byly použity čtyři datové sady jako zdroje trénovacích dat: GCC trénovací, ImageNet trénovací, OpenImages trénovací a LAION.

Tyto byly spárovány s vyhodnocovacími daty z COCO 2014 testovacího a validačního splitu, Flickr30K, TextCaps testovacího, OpenImages testovacího a validačního splitu a ImageNet testovacího a validačního splitu.

CLIP ViT-B/32 embeddings byly extrahovány pro všechny datové sady kromě LAION, které poskytuje své vlastní předem vypočítané embeddings. Nicméně, protože tyto embeddings se mírně liší od těch generovaných pomocí oficiální CLIP implementace, dotazovací obrázky byly přepočítány podle metody použité v clip-retrieval repozitáři, aby se zajistila kompatibilita.

Rekonstrukce byla provedena pomocí KNN hledání, i když rozsah LAION vyžadoval rozdělení do bloků po milionu obrázků, s každým indexovaným samostatně:

Inter-datový únik mezi benchmarkními datovými sadami (sloupce) a předběžnými trénovacími datovými sadami (řádky). Na levé straně vidíme 'tvrdý' únik (identické obrázky), a na pravé straně 'měkký' únik (near-duplikáty).

Inter-datový únik mezi benchmarkními datovými sadami (sloupce) a předběžnými trénovacími datovými sadami (řádky). Na levé straně vidíme ‘tvrdý’ únik (identické obrázky), a na pravé straně ‘měkký’ únik (near-duplikáty).

Překryv dat byl pozorován napříč všemi benchmarkními datovými sadami, s různou mírou závažnosti. LAION ukázal nejvyšší míry tvrdého úniku (identických obrázků), zvláště pro OpenImages a TextCaps testovací data, každý překračující 3%. OpenImages také přispěl menší množství tvrdého úniku do COCO.

Although méně závažný, ImageNet stále obsahoval tvrdé duplikáty z každého benchmarku, který byl prozkoumán; a GCC ukázal nejnižší celkový tvrdý únik, zůstávající pod 1%.

Měkký únik (near-duplikáty) byl více rozšířený: LAION opět produkoval nejvyšší míry, s až 7,9% překryvem pro jisté benchmarky; OpenImages a TextCaps byly nejvíce postiženými benchmarky; a Flickr30k ukázal nejnižší únik.

Although takový překryv může tvořit pouze malou část vyhodnocovacích sad, autoři poznamenávají, že jejich přítomnost může umožnit memorizaci a ohrozit platnost testu:

Příklady únikových obrázků. Na levé straně jsou případy 'tvrdého' úniku, kde obrázky jsou identické uvnitř datové sady (nahoře) nebo mezi datovými sadami (dole); na pravé straně, případy 'měkkého' úniku, kde obrázky jsou vizuálně near-identické.

Příklady únikových obrázků. Na levé straně jsou případy ‘tvrdého’ úniku, kde obrázky jsou identické uvnitř datové sady (nahoře) nebo mezi datovými sadami (dole); na pravé straně, případy ‘měkkého’ úniku, kde obrázky jsou vizuálně near-identické.

Vliv na následné hodnocení

Práce poté zvažuje, jak únik dat ovlivňuje následné hodnocení (tj. výkon na standardních úkolech, když jsou předtrénované modely testovány na benchmarkních datech, která obsahují duplikovaná trénovací data).

Tři úkoly byly zvažovány: nultý výstřel klasifikace; dozorovaná klasifikace; a obraz-text rekonstrukce.

Pro každý úkol byl výkon modelu vyhodnocen na benchmarkní datové sadě, pro kterou již byly identifikovány únikové vzorky v rámci předběžného trénování. Výsledky byly porovnány napříč čtyřmi podmnožinami: plnou benchmarkní sadou; podmnožinou únikových vzorků; podmnožinou ne-únikových vzorků; a náhodně vybranou podmnožinou stejné velikosti jako úniková skupina (použité jako kontrola).

Vliv úniku dat na tři následné úkoly byl měřen pomocí benchmarkních podmnožin, které již obsahovaly únikové vzorky. V nultém výstřelu klasifikace model předtrénovaný na LAION dosáhl pozoruhodně vyšší přesnosti na únikových obrázcích z ImageNet vyhodnocovací sady, potvrzující, že expozice i near-duplikátům během trénování poskytuje měřitelnou výhodu:

Přesnost nultého výstřelu klasifikace na ImageNet validační sadě napříč podmnožinami s a bez úniku. Poslední sloupec uvádí přesnostní zisky relativně k plné sadě, a zvýrazněné řádky odpovídají únikovým podmnožinám.

Přesnost nultého výstřelu klasifikace na ImageNet validační sadě napříč podmnožinami s a bez úniku. Poslední sloupec uvádí přesnostní zisky relativně k plné sadě, a zvýrazněné řádky odpovídají únikovým podmnožinám.

Pro dozorovanou klasifikaci únik v ImageNet způsobil dramatický pokles výkonu – pokud neměl únikový obrázek stejnou značku v obou splitu, v kterémžto případě model dosáhl téměř dokonalé přesnosti, odhalující silný memorizační efekt:

Přesnost dozorované klasifikace na ImageNet validační sadě pro podmnožiny s a bez úniku. Ziskové sloupce ukazují změnu relativně k plné sadě. Únikové podmnožiny jsou zvýrazněny.

Přesnost dozorované klasifikace na ImageNet validační sadě pro podmnožiny s a bez úniku. Ziskové sloupce ukazují změnu relativně k plné sadě. Únikové podmnožiny jsou zvýrazněny.

Při obraz-text rekonstrukci výkon opět vzrostl pro únikové vzorky, s oběma tvrdým a měkkým únikem vedoucím k vyšší rekapitulaci, a s únikovými podmnožinami také poskytujícími konzistentnější výsledky napříč běhy:

Výkon obraz-text rekonstrukce na Flickr30k napříč podmnožinami s a bez úniku, s únikovými podmnožinami zvýrazněnými.

Výkon obraz-text rekonstrukce na Flickr30k napříč podmnožinami s a bez úniku, s únikovými podmnožinami zvýrazněnými.

Autoři uzavírají:

‘Celkově jsme [ukázali] konzistentní důkazy, že únik představuje vážnou hrozbu pro spravedlivé hodnocení modelů ve vizuálních datech, ohrožující jednu z nejzákladnějších principů strojového učení: nehodnotit modely na jejich trénovacích datech.’

Závěr

Jedním šokujícím aspektem práce, i když to není žádná novinka, je účet o potřebě použití CLIPu pro získání embeddings pro obrovské množství obrazových dat v LAION, reprezentujícího měřítko, které již nemůže být řešeno žádným jiným způsobem než agregovaným, pracujícím s tokenizovanými metadata místo podrobnějších charakteristik, které lze prozkoumat, když je datová sada více zvládnutelná.

To je ostrý ilustrací rozsahu, v jakém trénování vizuálních/jazykových modelů definitivně překročilo hranice a schopnosti lidského dohledu, nebo jakéhokoli druhu manuální kurace za reprezentativními pod-vzorky.

 

* Možná trochu matoucí, problém duplikace je definován v práci jako ‘únik’.

† Autoři zdůrazňují.

Poprvé zveřejněno v úterý, 26. srpna 2025

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai