Unghiul lui Anderson

Datele “Rogue” care Poluează Performanța Generativă a Inteligenței Artificiale

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Flux Dev, Firefly.

O nouă studiu a descoperit că multe seturi de date de imagine populare utilizate pentru antrenarea modelelor de inteligență artificială sunt contaminate cu imagini de test sau near-duplicate, permițând modelelor să “înșele” prin memorizarea răspunsurilor în loc de a învăța. Scurgerile sunt răspândite, dar în general nedetectate, inflând în mod discret scorurile și oferind avantaje nefare modelelor antrenate pe date la scară largă.

 

Când susții un test de conducere, de obicei nu ți se spun în prealabil exact care sunt drumurile care vor fi utilizate pentru test. Dacă ți s-ar spune (și ai fi puțin lipsit de integritate), ai putea “optimiza” pentru test prin practicarea repetată a acelei rute, în loc de a dezvolta abilități de conducere mai largi care pot gestiona orice rută în mod rezonabil.

În antrenarea modelelor de învățare automată, aceasta este o analogie rezonabilă pentru o divizare a datelor de test – o divizare a datelor de antrenare între (de obicei) o divizare de 70% pentru datele care vor fi utilizate pentru antrenarea modelului, cu restul de 30% utilizate ca date “în sălbăticie”.

Deoarece datele “în sălbăticie” nu au fost văzute niciodată de model, dacă modelul performează bine pe aceste date, se poate presupune că este eficient și performant; dacă nu, modelul poate fi supraantrenat pe un set de date bine echilibrat – sau altfel datele au nevoie de curățare și definire suplimentară.

În orice caz, nu evaluarea modelelor pe datele de antrenare este coloana vertebrală a metodei actuale în cercetarea și dezvoltarea inteligenței artificiale.

La Fel Din Nou

Conform unui nou studiu din Japonia, sectorul cercetării viziunii computerizate și a inteligenței artificiale generative nu a egalat deloc eforturile cercetătorilor LLM pentru a se asigura că datele de test nu poluează datele de antrenare; în testele efectuate, cercetătorii au descoperit că fiecare set de date de vedere la scară largă pe care l-au studiat, inclusiv cele care alimentează unele dintre cele mai mari sisteme de inteligență artificială generativă actuale, a permis într-o oarecare măsură ca datele de test să se suprapună cu datele de antrenare – ceea ce înseamnă că benchmark-urile și rapoartele de performanță pentru modelele antrenate pe aceste divizări nu vor fi mai precise decât un rezultat de examen de la cineva care a introdus un criptogramă în sala de examen și nu vor reflecta performanța reală în date cu adevărat noi.

Exemple de contaminare a datelor descoperite de cercetători, unde punctele de date duplicate sau near-duplicate există atât în datele de antrenare, cât și în datele de test. Sursă: https://arxiv.org/pdf/2508.17416

Exemple de contaminare a datelor descoperite de cercetători, unde punctele de date duplicate sau near-duplicate există atât în datele de antrenare, cât și în datele de test. Sursă: https://arxiv.org/pdf/2508.17416

În imaginea de mai sus, din noul studiu, vedem exemple de puncte de date duplicate sau near-duplicate găsite atât în datele de antrenare, cât și în datele de test ale unor modele – suficient pentru a invalida performanța modelului pe aceste date și pentru a infla ușor scorurile generale, facilitând apariția unui nivel de generalizare pe care modelul poate să nu-l fi atins de fapt.

Pentru a complica și mai mult lucrurile, contaminarea pare să apară într-o varietate de scenarii posibile, inclusiv ‘pre-antrenarea‘, unde greutățile modelelor ancestrale mai vechi sunt utilizate pentru a “porni” un model nou. Dacă modelul ancestral mai vechi are unele dintre aceleași date ca și setul de date mai nou care este pre-antrenat, atunci scurgerea poate apărea chiar și dacă divizarea 70/30 sau 80/20 este curată.

Cumulativ

Acest lucru este aproape sigur să se întâmple chiar și în cele mai recente seturi de date: domeniul seturilor de date de vedere și limbaj a crescut enorm în ultimii cinci ani, incluzând nu numai noile date de imagine de pe web, ci și re-harvestând multe dintre aceleași date care au populat seturile de date mai vechi, istorice.

Mai mult, rutinele automate proiectate pentru a căuta și filtra miliarde de imagini pentru duplicate și near-duplicate sunt acum confruntate cu o asemenea sarcină grea încât curățarea în sine – costul său în termeni de timp și bani – trebuie să fie luat în considerare în contextul limitărilor bugetare

Între timp, duplicarea imaginilor este o consecință inevitabilă a tipului de ad hoc de trawlare pe web din spatele unor colecții masive, cum ar fi Common Crawl, datorită practicii comune de repostare și recomprimare a imaginilor și aplicarea de editări, cum ar fi decuparea și chiar răsturnarea (pentru a evita detectarea, atunci când imaginea ar fi putut fi utilizată fără permisiune, de exemplu).

Autorii observă*:

‘Scurgerea de date este o problemă răspândită, prezentă în majoritatea seturilor de date vizuale. Scurgerea poate ascunde capacitatea de generalizare a modelelor, ceea ce este deosebit de problematic atunci când se compară modele antrenate pe seturi de date diferite, ceea ce duce la comparații nefiare.

‘Îi îndemnăm pe designerii de seturi de date să ia în considerare cu atenție implicațiile acestor evaluări. Pentru o evaluare mai corectă a modelului, recomandăm utilizarea detectoarelor de duplicate care ia în considerare atât scurgerile dure, cât și cele moi.

‘Ideal, imaginile scurse ar trebui să fie eliminate din setul de antrenare, iar dacă nu este posibil, ar trebui să fie eliminate cel puțin din setul de test.’

Studiul detaliază o serie de teste pe care cercetătorii le-au efectuat pe seturi de date masive și populare – fiecare dintre ele a demonstrat un anumit nivel de contaminare.

Noul studiu, intitulat Scurgerea de date în seturile de date vizuale, provine de la trei cercetători de la Universitatea din Osaka.

Metodă

Autorii studiului definesc scurgerea în termeni de trei dimensiuni: modalitate, acoperire și grad.

Modalitatea distinge dacă numai imaginile sunt scurse sau dacă atât imaginile, cât și etichetele sunt expuse; acoperirea identifică dacă suprapunerea apare în cadrul aceluiași set de date sau între seturi de date diferite; și gradul definește dacă conținutul duplicat este exact același sau doar adjacent.

În ceea ce privește scurgerea, cele două scenarii luate în considerare în lucrare sunt scurgerea intra-set de date (unde imaginile de evaluare reapar în divizarea de antrenare a aceluiași set de date) și scurgerea inter-set de date (unde imaginile de evaluare dintr-un set de date sunt prezente într-un alt set de date utilizat pentru antrenare).

În ceea ce privește gradul, cele două niveluri definite sunt scurgerea moale (unde imaginile nu sunt identice, dar prezintă variații minore) și scurgerea dură (unde imaginile sunt exact aceleași în seturile de antrenare și de evaluare).

Cercetătorii abordează detectarea scurgerii în termeni de recuperare de imagini, utilizând encodatori de imagini pentru a reprezenta fiecare imagine ca un vector de caracteristici. Setul de interogare este datele de evaluare, în timp ce colecția este setul de antrenare.

Pentru seturile de date mai mici, fiecare vector de interogare a fost comparat direct cu toate vectorii de antrenare utilizând similaritatea cosinus. Pentru seturile de date mai mari, un index Faiss a fost creat pentru a permite o căutare mai rapidă, K-Nearest Neighbors (KNN).

Deoarece encoderul trebuie să capteze suficiente informații vizuale pentru a detecta asemănări subtile, dar să rămână eficient în fața unor volume foarte mari de date, autorii s-au bazat pe caracteristici precalculate CLIP puse la dispoziție de creatorii setului de date, în cazul colecției LAION care stă la baza Stable Diffusion și a proiectelor ulterioare.

Autorii notează că permisiunea CLIP de a utiliza înțelegerea sa distilată a setului de date (în loc de a consulta fișierele reale la scară) a accelerat procesul considerabil și a oferit o consistență îmbunătățită în comparații.

Date și Teste

Encoderul de imagini CLIP utilizat în testele pentru noul studiu a fost CLIP ViT-B/32 original utilizat pentru a căuta LAION. Pentru a stabili dacă imagini diverse sunt legate între ele, KNN a fost utilizat sub AutoFaiss.

Seturile de date au fost grupate în trei tipuri: seturi de date de pre-antrenare – colecții mari, extrase din web, utilizate pentru antrenarea modelelor generaliste; seturi de date de antrenare – colecții mai mici, adesea annotate, destinate pentru ajustarea directă a modelului; și seturi de date de referință – annotate manual și utilizate exclusiv pentru evaluare.

Analiza a acoperit douăzeci de divizări din șapte seturi de date: Microsoft COCO a fost utilizat atât ca set de antrenare, cât și ca set de evaluare, incluzând diviziunile de antrenare, validare, test și neetichetate; Flickr30k a servit exclusiv ca set de referință; și colecția Google Conceptual Captions (GCC) a fost tratată ca o sursă de pre-antrenare, cu porțiunea sa de validare utilizată și pentru evaluare.

În plus, ImageNet a fost utilizat atât pentru antrenare, cât și pentru evaluare, în timp ce setul de date LAION-400M a fost utilizat exclusiv pentru pre-antrenare.

OpenImages v4 a contribuit cu date de antrenare și de referință, și TextCaps a furnizat atât date de antrenare, cât și de test pentru evaluare.

Exemple de anotări de imagini din setul de date Open Images de la Google, examinate în noul studiu. Sursă: https://arxiv.org/pdf/1811.00982

Exemple de anotări de imagini din setul de date Open Images de la Google, examinate în noul studiu. Sursă: https://arxiv.org/pdf/1811.00982

Pentru a evalua cât de bine metoda poate detecta scurgeri atunci când imaginile au fost modificate subtil prin redimensionare, decupare sau transformări non-semantice similare, autorii au testat pe Flickr30k, selectând aleatoriu 5.000 de imagini ca interogări și utilizând întregul set de date ca colecție de referință.

Fiecare imagine de interogare a fost transformată înainte de a fi codificată (adică, supusă unei modificări non-semantice, cum ar fi redimensionarea sau decuparea), și apoi asociată cu cel mai asemănător element din colecție utilizând similaritatea cosinus; o potrivire a fost numărată doar dacă imaginea originală a fost recuperată ca rezultatul de top.

Cei trei encodatori comparați au fost ResNet-152; DINOv2 ViT-B/14; și CLIP ViT-B/32.

Patru tipuri de transformări non-semantice de imagine au fost utilizate: geometrice (răsturnări și rotații); decupare (îndepărtarea a 20, 50 sau 100 de pixeli de la fiecare margine); pixelizare (blur Gaussian, zgomot adăugat sau redimensionare la 128 sau 256 de pixeli); și culori (grayscale, inversare sau suprapuneri de roșu, verde sau albastru).

Din materialul suplimentar, exemple de transformări aplicate datelor – rutine tipice și în prelucrarea de augmentare a datelor.

Exemple de transformări aplicate datelor – rutine tipice și în prelucrarea de augmentare a datelor.

Autorii au testat apoi pentru scurgere în recuperarea de imagini:

Precizia detectării scurgerii pe 5.000 de imagini de interogare Flickr30k supuse unor transformări non-semantice diverse.

Precizia detectării scurgerii pe 5.000 de imagini de interogare Flickr30k supuse unor transformări non-semantice diverse.

Toți cei trei encodatori au atins performanță perfectă pe imagini nealterate și CLIP a rămas fiabil pe decupare, răsturnări orizontale, zgomot și redimensionare, depășindu-l pe ResNet la modificări de nivel de pixel și culori.

DINOv2 a arătat o rezistență puternică la transformări de culori (probabil datorită proiectării sale auto-supervizate, după părerea autorilor), dar a fost semnificativ mai slab la editări geometrice și decupare – ambele fiind comune în seturi de date duplicate.

Deoarece LAION include deja încorporate caracteristici CLIP și având în vedere robustețea și viteza sa consistentă, CLIP a fost ales ca encoder implicit pentru analiza principală.

Scurgere Dură și Moale

Performanța a fost evaluată la diferite praguri de similaritate cosinus pentru a distinge între imagini exacte și near-duplicate (scurgere dură și moale).

Un prag de 0,98 a fost selectat pentru a defini scurgerea dură, rezultând zero fals pozitive și detectare perfectă a imaginilor identice.

Pentru scurgerea moale, un prag de 0,95 a fost ales, permițând recuperarea mai multor near-duplicate, menținând în același timp o rată de fals pozitive aproape de zero. Prioritatea a fost acordată preciziei în detrimentul recuperării, iar rezultatele au fost estimate în mod conservator:

Curbele caracteristice ale receptorului au fost utilizate pentru a ghida selectarea pragurilor dure și moi pentru detectarea scurgerii. Scorurile AUC ridicate în ambele condiții transformate și ne-transformate demonstrează că near-duplicate pot fi distinse în mod fiabil de imagini nelegate, chiar și atunci când se efectuează modificări minime.

Curbele caracteristice ale receptorului au fost utilizate pentru a ghida selectarea pragurilor dure și moi pentru detectarea scurgerii.

Scurgere Intra-Set de Date

Scurgerea intra-set de date a fost calculată prin identificarea suprapunerii de imagini între diviziunile de antrenare și de evaluare în cadrul aceluiași set de date. Numai seturile de date cu ambele diviziuni de referință și de antrenare sau pre-antrenare au fost eligibile, limitând analiza la COCO, GCC, ImageNet, OpenImages și TextCaps.

Pentru COCO, setul de test a fost comparat cu setul de antrenare, setul de evaluare și subsetul neetichetat, iar setul de validare a fost comparat cu setul de antrenare și subsetul neetichetat.

Ratele cele mai mari de scurgere intra-set de date au fost observate în seturile de test și de validare ImageNet, cu scurgere dură ajungând până la 1,58% și scurgere moale puțin sub 2%. GCC și COCO au urmat, COCO val2017 arătând o scurgere moale de 3% și seturile de test între 1,35% și 1,38%. OpenImages a prezentat o scurgere dură scăzută de 0,05%, dar scurgerea moale a depășit 1,3% în ambele seturi de test și de validare. TextCaps a arătat cea mai mică scurgere generală, de 0,69%, fără scurgere dură detectată:

Ratele de scurgere intra-set de date, arătând proporția fiecărei diviziuni de evaluare care se suprapune cu datele sale de antrenare asociate.

Ratele de scurgere intra-set de date, arătând proporția fiecărei diviziuni de evaluare care se suprapune cu datele sale de antrenare asociate.

În legătură cu aceste rezultate, autorii afirmă†:

‘Aceste rezultate arată că scurgerea intra-set de date apare în toate seturile de date analizate, fie în forma sa dură, fie în forma sa moale.

‘Având în vedere că scurgerea de date poate compromite evaluarea modelului și că seturile de date sunt proiectate în mod special pentru acest scop, scurgerea intra-set de date este un risc care prin design nu ar trebui să existe.

‘Și totuși, am identificat multiple instanțe în toate seturile de date.’

Scurgere Inter-Set de Date

Pentru a măsura scurgerea inter-set de date (unde un model este antrenat pe un set de date și evaluat pe altul), patru seturi de date au fost utilizate ca surse de date de antrenare: setul de antrenare GCC, setul de antrenare ImageNet, setul de antrenare OpenImages și LAION.

Acestea au fost asociate cu date de evaluare extrase din setul de test și de validare COCO 2014, Flickr30K, TextCaps test, setul de test și de validare OpenImages și setul de test și de validare ImageNet.

Caracteristici CLIP ViT-B/32 au fost extrase pentru toate seturile de date, cu excepția LAION, care oferă caracteristici precalculate. Cu toate acestea, deoarece aceste caracteristici diferă ușor de cele generate utilizând implementarea oficială CLIP, imaginile de interogare au fost redimensionate în conformitate cu metoda utilizată în depozitul clip-retrieval pentru a asigura compatibilitatea.

Recuperarea a fost efectuată utilizând o căutare KNN, deși dimensiunea LAION a necesitat împărțirea în blocuri de un milion de imagini, cu fiecare bloc indexat separat:

Scurgere inter-set de date între seturi de date de referință (coloane) și seturi de date de pre-antrenare (rânduri). Pe partea stângă vedem scurgerea 'dură' (imagini identice), iar pe partea dreaptă scurgerea 'moale' (near-duplicate).

Scurgere inter-set de date între seturi de date de referință (coloane) și seturi de date de pre-antrenare (rânduri).

Scurgerea inter-set de date a fost observată în toate seturile de date de referință, cu grade diferite de gravitate. LAION a prezentat ratele cele mai mari de scurgere dură (imagini identice), în special pentru seturile de test OpenImages și TextCaps, fiecare depășind 3%. OpenImages a contribuit și cu o cantitate mai mică de scurgere dură către COCO.

Deși mai puțin severe, ImageNet a conținut și duplicate dure provenite din toate seturile de date de referință examinate; și GCC a prezentat cea mai mică scurgere dură generală, rămânând sub 1%.

Scurgerea moale (near-duplicate) a fost mai răspândită: LAION a produs din nou ratele cele mai mari, cu până la 7,9% suprapunere pentru anumite seturi de date de referință; OpenImages și TextCaps au fost seturile de date de referință afectate în general; și Flickr30k a prezentat cea mai mică scurgere.

Deși astfel de suprapuneri pot reprezenta doar o mică parte a seturilor de date de evaluare, autorii notează că prezența lor poate permite memorizarea și compromite valabilitatea testului:

Exemple de imagini scurse. Pe partea stângă, cazuri de scurgere 'dură', unde imaginile sunt identice în cadrul unui set de date (sus) sau între seturi de date (jos); pe partea dreaptă, cazuri de scurgere 'moale', unde imaginile sunt vizual near-identice.

Exemple de imagini scurse.

Efectul asupra Evaluării Downstream

Studiul examinează apoi cum scurgerea de date afectează evaluările downstream (adică, performanța la sarcini standard atunci când modelele pre-antrenate sunt testate pe seturi de date de referință care conțin date de antrenare duplicate).

Trei sarcini au fost luate în considerare: clasificarea cu zero fotografii; clasificarea supravegheată; și recuperarea text-imaginilor.

Pentru fiecare sarcină, performanța modelului a fost evaluată pe un set de date de referință pentru care s-a identificat scurgerea în datele de pre-antrenare. Rezultatele au fost comparate în patru subseturi: setul de date de referință complet; un subset de imagini scurse; un subset de imagini ne-scurse; și un subset selectat aleatoriu de aceeași mărime cu grupul scurs (utilizat ca control).

Efectul scurgerii de date asupra celor trei sarcini downstream a fost măsurat utilizând subseturi de seturi de date de referință cunoscute pentru a conține imagini scurse. În clasificarea cu zero fotografii, un model pre-antrenat pe LAION a atins o acuratețe semnificativ mai mare pe imaginile scurse din setul de evaluare ImageNet, confirmând că expunerea la near-duplicate în timpul antrenării oferă un avantaj măsurabil:

Acuratețea clasificării cu zero fotografii pe setul de evaluare ImageNet pe subseturi cu și fără scurgere. Colonia finală raportează câștiguri de acuratețe relative la setul complet, iar rândurile evidențiate corespund subseturilor scurse.

Acuratețea clasificării cu zero fotografii pe setul de evaluare ImageNet pe subseturi cu și fără scurgere.

Pentru clasificarea supravegheată, scurgerea în ImageNet a cauzat o scădere dramatică a performanței – cu excepția cazului în care imaginea scursă avea aceeași etichetă în ambele diviziuni, în care caz modelul a atins o acuratețe aproape perfectă, dezvăluind un efect puternic de memorizare:

Acuratețea clasificării supravegheate pe setul de evaluare ImageNet pentru subseturi cu și fără scurgere. Colonele de câștig arată schimbarea relativă la setul complet. Subseturile scurse sunt evidențiate.

Acuratețea clasificării supravegheate pe setul de evaluare ImageNet pentru subseturi cu și fără scurgere.

În recuperarea imagine-text, performanța a fost din nou îmbunătățită pentru imagini scurse, atât scurgerea dură, cât și cea moale conducând la o recuperare mai mare, iar subseturile scurse au oferit și rezultate mai consistente pe parcursul execuțiilor:

Performanța recuperării imagine-text pe Flickr30k pe subseturi cu și fără scurgere, cu subseturile scurse evidențiate.

Performanța recuperării imagine-text pe Flickr30k pe subseturi cu și fără scurgere.

Autorii concluzionează:

‘În general, [arătăm] dovezi consistente că scurgerea de date reprezintă o amenințare gravă pentru evaluarea corectă a modelelor în seturile de date vizuale, compromițând unul dintre principiile de bază ale învățării automate: să nu evaluați modelele pe datele de antrenare.’

Concluzie

Un aspect șocant al studiului, deși nu este o noutate, este relatarea despre necesitatea de a utiliza CLIP pentru a obține caracteristici pentru marea cantitate de date de imagine din LAION, reprezentând o scară care nu mai poate fi abordată în niciun alt mod decât agregat, lucrând cu metadate tokenizate în loc de caracteristici mai detaliate care pot fi inspectate atunci când un set de date este mai manevrabil.

Este o ilustrare crudă a extinderii cu care antrenarea modelelor de viziune-limbaj a depășit capacitatea de supraveghere umană și orice fel de curățare manuală dincolo de mostre reprezentative.

 

* Posibil în mod confuz, problema duplicării este definită în studiul ca ‘scurgere’.

† Accentuarea autorilor.

Publicat pentru prima dată marți, 26 august 2025

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai