Kąt Andersona

‘Rogue’ Dane Polluting Wydajność Generatywnych Modeli AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Flux Dev, Firefly.

Nauka odkryła, że wiele popularnych zbiorów danych obrazowych używanych do szkolenia modeli AI jest zanieczyszczonych obrazami testowymi lub near-duplikatami, pozwalając modelom oszukiwać, memorując odpowiedzi zamiast uczenia się. Przecieki są powszechne, ale geralnie niewykrywalne, cicho nadmuchując wyniki i dając niesprawiedliwe przewagi modelom szkolonym na danych internetowych.

 

Gdy przystępujesz do egzaminu na prawo jazdy, zwykle nie jesteś uprzedzony o konkretnych drogach, które będą używane podczas egzaminu. Jeśli tak było (i brakowałoby ci uczciwości), mogłbyś “optymalizować” egzamin, ćwicząc powtarzalnie na tej trasie, zamiast rozwijać szersze umiejętności jazdy, które mogą radzić sobie z dowolną trasą w rozsądku.

W treningu modeli machine learning jest to uzasadniona analogia dla test split – podziału danych szkoleniowych na (zwykle) 70% danych używanych do szkolenia modelu, a pozostałe 30% używanych jako dane “w terenie”.

Ponieważ dane “w terenie” nie były wcześniej widziane przez model, jeśli model działa dobrze na tych danych, można założyć, że jest skuteczny i wydajny; jeśli nie, model może przeuczyć na dobrze zbalansowanym zestawie – lub też dane potrzebują dodatkowej kuracji i definicji.

W każdym razie niewykonywanie modeli na danych szkoleniowych jest kamieniem węgielnym bieżącej metody w badaniach i rozwoju AI.

To samo jeszcze raz

Według nowego artykułu badawczego z Japonii, sektor badań nad widzeniem komputerowym i generatywnym AI nie zbliżył się nawet do wysiłków badaczy LLM, aby upewnić się, że dane testowe nie zanieczyszczają danych szkoleniowych; w testach badacze odkryli, że każdy hiperskalowy zbiór wizji, który badali, w tym te, które napędzają niektóre z największych obecnych systemów generatywnych AI, pozwolił w pewnym stopniu na przeniknięcie danych testowych do danych szkoleniowych – co oznacza, że punkty odniesienia i raporty wydajności modeli szkolonych na tych podziałach nie będą bardziej dokładne niż wynik egzaminu od kogoś, kto wśliznął się do sali egzaminacyjnej, i nie będą odzwierciedlać rzeczywistej wydajności na prawdziwie nowych danych.

Przykłady skażeń danych odkrytych przez badaczy, gdzie punkty danych lub near-duplikaty istnieją zarówno w danych szkoleniowych, jak i testowych. Źródło: https://arxiv.org/pdf/2508.17416

Przykłady skażeń danych odkrytych przez badaczy, gdzie punkty danych lub near-duplikaty istnieją zarówno w danych szkoleniowych, jak i testowych. Źródło: https://arxiv.org/pdf/2508.17416

Na powyższym obrazie, z nowego artykułu, widzimy przykłady duplikatów lub near-duplikatów punktów danych znalezionych w danych szkoleniowych i testowych różnych modeli – wystarczająco, aby unieważnić wyniki modelu na tych danych i lekko nadmuchując ogólne wyniki, ułatwiając pojawienie się poziomu uogólnienia, którego model może nie rzeczywiście osiągnąć.

Aby sprawy były bardziej skomplikowane, zanieczyszczenie wydaje się występować w różnych możliwych scenariuszach, w tym ‘wstępnego szkolenia‘, gdzie wagi starszych modeli przodków są używane do “uruchomienia” nowego modelu. Jeśli model górny, starszy ma niektóre z tych samych danych, co nowy zbiór danych, który jest wstępnie szkolony, to zanieczyszczenie może wystąpić, nawet jeśli podział 70/30 lub 80/20 jest czysty.

Cumulative Effect

To jest prawie pewne, że wystąpi to nawet w najnowszych zbiorach danych: zakres zbiorów wizji/języka wzrósł ogromnie w ciągu ostatnich pięciu lat, obejmując nie tylko najnowsze dane obrazowe w sieci, ale także ponownie zbierając wiele danych, które zaludniały te starsze, historyczne zbiory danych.

Dalej, automatyczne rutyny zaprojektowane do przeczesywania i filtrowania miliardów obrazów w celu znalezienia duplikatów i near-duplikatów są teraz skonfrontowane z takim trudnym zadaniem, że sama kuracja – jej koszt w czasie i pieniądzu – musi być teraz brana pod uwagę w kontekście ograniczeń budżetowych

Tymczasem duplikacja obrazu jest nieuniknioną konsekwencją rodzaju ad hoc przeczesywania sieci za pomocą ogromnych kolekcji, takich jak Common Crawl, ze względu na powszechną praktykę ponownego publikowania i rekompresowania obrazów oraz stosowania edycji, takich jak obcięcia, a nawet odwracania (aby uniknąć wykrycia, gdy obraz mógł być użyty bez pozwolenia, na przykład).

Autorzy zauważają*:

‘Przecieki danych są powszechnym problemem, występującym w większości zbiorów wizji. Przecieki mogą zaciemnić zdolność uogólniania modeli, co jest szczególnie problematyczne, gdy porównuje się modele szkolone na różnych zbiorach danych, prowadząc do niesprawiedliwych porównań.

‘Nalegamy, aby projektanci zbiorów danych starannie rozważyli implikacje tych ocen. Dla uczciwszej oceny modelu zalecamy użycie wykrywaczy duplikatów, które uwzględniają zarówno twarde, jak i miękkie przecieki.

‘Ideally, przeciekłe obrazy powinny zostać usunięte z zestawu szkoleniowego, a jeśli to niemożliwe, powinny zostać usunięte z zestawu testowego.’

Artykuł wyjaśnia szereg testów, które badacze przeprowadzili na ogromnych i popularnych zbiorach danych – każdy z nich wykazał pewien poziom zanieczyszczenia.

Nowy artykuł nowy artykuł nosi tytuł Przecieki danych w zbiorach wizji, i pochodzi od trzech badaczy z Uniwersytetu Osaka.

Metoda

Autorzy artykułu definiują przecieki w trzech wymiarach: modality, coverage, i degree.

Modality rozróżnia, czy tylko obrazy są przeciekłe, czy też zarówno obrazy, jak i etykiety są narażone; coverage identyfikuje, czy nakład występuje w tym samym zbiorze danych, czy też między różnymi zbiorami; i degree definiuje, czy zduplikowane treści są identyczne, czy tylko sąsiednie.

Odnośnie do przecieków, dwa scenariusze są brane pod uwagę w pracy: wewnątrz-zbioru przecieki (gdzie obrazy oceny pojawiają się w podziale szkoleniowym tego samego zbioru danych), i między-zbioru przecieki (gdzie obrazy oceny z jednego zbioru danych są obecne w innym zbiorze danych używanym do szkolenia).

Odnośnie do stopnia, dwa poziomy są definiowane: miękkie przecieki (gdzie obrazy nie są identyczne, ale wykazują niewielkie różnice), i twarde przecieki (gdzie obrazy są identyczne w szkoleniu i ocenie).

Badacze zajmują się wykrywaniem przecieków w zakresie odzyskiwania obrazu, używając kodera obrazu do reprezentowania każdego obrazu jako wektor cech. Zestaw zapytań to dane oceny, podczas gdy zbior to zestaw szkoleniowy.

Dla mniejszych zbiorów danych, każdy wektor zapytania był bezpośrednio porównywany ze wszystkimi wektorami szkoleniowymi przy użyciu podobieństwa cosinusa. Dla większych zbiorów danych, Faiss index został utworzony, aby umożliwić szybsze wyszukiwanie K-Nearest Neighbors (KNN).

Ponieważ koder musi przechwytywać wystarczającą ilość informacji wizualnych, aby wykryć subtelne podobieństwa, ale jednocześnie pozostać wydajnym w obliczeniach, autorzy polegali na prekomputowanych CLIP cechach udostępnionych przez twórców zbiorów danych, w przypadku kolekcji LAION, która podpinuje Stable Diffusion, i późniejszych projektów.

Autorzy zauważają, że pozwolenie CLIP na użycie jego destylowanego zrozumienia zbioru danych (zamiast głosowania plików w skali) znacznie przyspieszyło proces i zapewniło lepszą spójność porównań.

Dane i testy

Koder obrazu CLIP użyty w testach dla nowej pracy był domyślnym CLIP ViT-B/32 pierwotnie używanym do przesiania LAION. Aby ustalić, czy różne obrazy są ze sobą powiązane, KNN został użyty pod AutoFaiss.

Zbiory danych zostały pogrupowane w trzy typy: wstępne szkolenie – duże, zebrane z sieci kolekcje używane do szkolenia modeli ogólnych; szkolenie – mniejsze, często opatrzonych adnotacjami kolekcje, przeznaczone do bezpośredniego dostosowania modelu; i benchmark – ręcznie opatrzonych adnotacjami, i używanych wyłącznie do oceny.

Analiza objęła dwadzieścia podziałów w siedmiu zbiorach danych: Microsoft COCO został użyty jako zestaw szkoleniowy i oceny, obejmując zestaw treningowy, walidacyjny, testowy i nieoznaczony; Flickr30k służył wyłącznie jako benchmark; i kolekcja Google Conceptual Captions (GCC) została potraktowana jako źródło wstępnego szkolenia, z częścią walidacyjną również używaną do oceny.

Dodatkowo, ImageNet został użyty do szkolenia i benchmarkingu, podczas gdy zbiór LAION-400M został użyty wyłącznie do wstępnego szkolenia.

OpenImages v4 wniósł wkład w dane szkoleniowe i benchmarkowe, a TextCaps dostarczył zarówno dane szkoleniowe, jak i testowe do oceny.

Przykłady adnotacji obrazowych z zestawu Open Images, badanego w nowej pracy. Źródło: https://arxiv.org/pdf/1811.00982

Przykłady adnotacji obrazowych z zestawu Open Images, badanego w nowej pracy. Źródło: https://arxiv.org/pdf/1811.00982

Aby ocenić, jak dobrze metoda może wykryć przecieki, gdy obrazy zostały delikatnie zmienione przez zmianę rozmiaru, obcięcie lub podobne nie-semantyczne transformacje, autorzy przetestowali na Flickr30k, losowo wybierając 5 000 obrazów jako zapytania, i używając całego zestawu danych jako kolekcji odniesienia.

Każde zapytanie obrazu zostało przekształcone przed zakodowaniem (tj. poddano mu nie-semantyczną modyfikację, taką jak zmiana rozmiaru lub obcięcie), a następnie dopasowane do najbardziej podobnego elementu w kolekcji przy użyciu podobieństwa cosinusa; dopasowanie zostało policzone tylko wtedy, gdy oryginalny obraz został odzyskany jako najlepszy wynik.

Trzy kodery porównywane były: ResNet-152; DINOv2 ViT-B/14; i CLIP ViT-B/32.

Cztery typy nie-semantycznych transformacji obrazu zostały użyte: geometryczne (odwrócenia i obroty); obcięcie (usunięcie 20, 50 lub 100 pikseli z każdej krawędzi); pikselizacja (rozmycie gaussowskie, dodanie szumu lub zmniejszenie do 128 lub 256 pikseli); i kolor (odwrócenie, szarość lub nałożenie czerwonego, zielonego lub niebieskiego.

Z materiału uzupełniającego, przykłady transformacji zastosowanych do danych – typowe rutyny również w wstępnym przetwarzaniu danych.

Z materiału uzupełniającego, przykłady transformacji zastosowanych do danych – typowe rutyny również w wstępnym przetwarzaniu danych.

Następnie badacze przetestowali na wykrywanie przecieków w odzyskiwaniu obrazu:

Dokładność wykrywania przecieków na 5 000 obrazach testowych Flickr30k poddanych różnym nie-semantycznym transformacjom.

Dokładność wykrywania przecieków na 5 000 obrazach testowych Flickr30k poddanych różnym nie-semantycznym transformacjom.

Wszystkie trzy kodery osiągnęły idealną wydajność na niezmienionych obrazach, a CLIP pozostał niezawodny w obcięciu, poziomych odwróceniach, szumie i zmianie rozmiaru, przewyższając ResNet w zmianach na poziomie pikseli i kolorze.

DINOv2 wykazał silną odporność na transformacje koloru (prawdopodobnie ze względu na jego samouczący się design, jak twierdzą autorzy), ale był znacznie słabszy w edycjach geometrycznych i obcięciu – oba powszechnie spotykane w zduplikowanych zbiorach danych.

Ponieważ LAION już zawiera cechy CLIP, a biorąc pod uwagę jego spójną wydajność i szybkość, CLIP został wybrany jako domyślny koder dla głównej analizy.

Twarde i miękkie przecieki

Wydajność została oceniona w różnych progach podobieństwa cosinusa, aby rozróżnić między identycznymi a near-duplikatami obrazów (twarde i miękkie przecieki).

Progi 0,98 został wybrany do definiowania twardych przecieków, co skutkowało brakiem fałszywych pozytywów i idealnym wykrywaniem identycznych obrazów.

Dla miękkich przecieków prog 0,95 został wybrany, co pozwoliło na odzyskanie większej liczby near-duplikatów, przy zachowaniu niemal zerowej stopy fałszywych pozytywów. Priorytet został nadany precyzji nad czułością, a wyniki zostały oszacowane w sposób konserwatywny:

Krzywe charakterystyki odbioru były używane do wyboru progów twardych i miękkich przecieków. Wysokie wyniki AUC w warunkach przekształconych i nieprzekształconych dowodzą, że near-duplikaty mogą być niezawodnie rozróżnione od niezwiązanych obrazów, nawet przy minimalnych zmianach.

Krzywe charakterystyki odbioru były używane do wyboru progów twardych i miękkich przecieków. Wysokie wyniki AUC w warunkach przekształconych i nieprzekształconych dowodzą, że near-duplikaty mogą być niezawodnie rozróżnione od niezwiązanych obrazów, nawet przy minimalnych zmianach.

Wewnątrz-zbioru przecieki

Wewnątrz-zbioru przecieki zostały obliczone przez identyfikację nakładu obrazów między zestawem szkoleniowym a oceny w tym samym zbiorze danych. Tylko zbiory danych z obiema częściami benchmarkowymi i szkoleniowymi lub wstępnymi były dopuszczone, ograniczając analizę do COCO, GCC, ImageNet, OpenImages i TextCaps.

Dla COCO, zestaw testowy został porównany z zestawem szkoleniowym, zestawem oceny i nieoznaczonym podzbiorem, a zestaw walidacyjny z zestawem szkoleniowym i nieoznaczonym podzbiorem.

Najwyższe stawki wewnątrz-zbioru przecieków zostały zaobserwowane w zestawie testowym i walidacyjnym ImageNet, z twardymi przeciekami sięgającymi do 1,58% i miękkimi przeciekami nieco poniżej 2%. GCC i COCO następowały, z COCO val2017 wykazującym miękkie przecieki na poziomie 3% i jego zestawem testowym wahającym się między 1,35% a 1,38%. OpenImages wykazywał niskie twarde przecieki na poziomie 0,05%, ale miękkie przecieki przekraczały 1,3% w obu zestawach testowych i walidacyjnych. TextCaps wykazywał najniższe ogólne przecieki, na poziomie 0,69%, bez wykrycia twardych przecieków:

Stawki wewnątrz-zbioru przecieków, pokazujące udział każdego zestawu oceny, który nakłada się z jego zestawem szkoleniowym.

Stawki wewnątrz-zbioru przecieków, pokazujące udział każdego zestawu oceny, który nakłada się z jego zestawem szkoleniowym.

Odnośnie tych wyników, autorzy stwierdzają†:

‘Te wyniki pokazują, że wewnątrz-zbioru przecieki występują we wszystkich analizowanych zbiorach danych, albo w postaci twardych, albo miękkich.

‘Uwzględniając, że przecieki danych mogą kompromitować ocenę modelu i że zbiory danych są specjalnie zaprojektowane do tego celu, wewnątrz-zbioru przecieki są ryzykiem, które z założenia nie powinno istnieć.

‘Jednakże, zidentyfikowaliśmy wiele przypadków we wszystkich zbiorach danych.’

Między-zbioru przecieki

Aby zmierzyć między-zbioru przecieki (gdzie model jest szkolony na jednym zbiorze danych i oceniany na innym), cztery zbiory danych zostały użyte jako źródła danych szkoleniowych: GCC szkolenie, ImageNet szkolenie, OpenImages szkolenie, i LAION.

Te zbiory danych zostały dopasowane do danych oceny pobranych z zestawu testowego COCO 2014, Flickr30K, zestawu testowego TextCaps, zestawu testowego i walidacyjnego OpenImages, oraz zestawu testowego i walidacyjnego ImageNet.

Cechy CLIP ViT-B/32 zostały wyodrębnione dla wszystkich zbiorów danych z wyjątkiem LAION, który zapewnia własne prekomputowane cechy. Jednakże, ponieważ te cechy różnią się nieznacznie od tych wygenerowanych przy użyciu oficjalnej implementacji CLIP, obrazy zapytań zostały przeskalowane zgodnie z metodą używaną w repozytorium clip-retrieval, aby zapewnić kompatybilność.

Odzyskiwanie zostało wykonane przy użyciu wyszukiwania KNN, chociaż skala LAION wymagała podziału na bloki po milionie obrazów, z każdym indeksowanym oddzielnie:

Między-zbioru przecieki między zbiorami benchmarkowymi (kolumny) a zbiorami wstępnego szkolenia (wiersze). Po lewej stronie widzimy 'twarde' przecieki (identyczne obrazy), a po prawej stronie 'miękkie' przecieki (near-duplikaty).

Między-zbioru przecieki między zbiorami benchmarkowymi (kolumny) a zbiorami wstępnego szkolenia (wiersze). Po lewej stronie widzimy ‘twarde’ przecieki (identyczne obrazy), a po prawej stronie ‘miękkie’ przecieki (near-duplikaty).

Przecieki między zbiorami zostały zaobserwowane we wszystkich zbiorach benchmarkowych, z różnymi stopniami nasilenia. LAION wykazał najwyższe stawki twardych przecieków (identyczne obrazy), szczególnie dla zestawu testowego OpenImages i zestawu testowego TextCaps, każdy przekraczający 3%. OpenImages również wniósł mniejszy wkład w twarde przecieki do COCO.

Chociaż mniej dotkliwe, ImageNet nadal zawierał twarde duplikaty z każdego badanego benchmarku; i GCC wykazał najniższe ogólne twarde przecieki, pozostając poniżej 1%.

Przecieki miękkie (near-duplikaty) były bardziej rozpowszechnione: LAION ponownie wyprodukował najwyższe stawki, z maksymalnie 7,9% nakładu dla niektórych benchmarków; OpenImages i TextCaps były najbardziej dotkniętymi benchmarkami; i Flickr30k wykazał najmniejsze przecieki.

Chociaż takie nakłady mogą stanowić tylko niewielką część zestawów oceny, autorzy zauważają, że ich obecność może umożliwić pamiętanie i kompromitować ważność testu:

Przykłady przeciekłych obrazów. Po lewej stronie widzimy przypadki 'twardych' przecieków, gdzie obrazy są identyczne wewnątrz zbioru (góra) lub między zbiorami (dół); po prawej stronie, przypadki 'miękkich' przecieków, gdzie obrazy są wizualnie bardzo podobne.

Przykłady przeciekłych obrazów. Po lewej stronie widzimy przypadki ‘twardych’ przecieków, gdzie obrazy są identyczne wewnątrz zbioru (góra) lub między zbiorami (dół); po prawej stronie, przypadki ‘miękkich’ przecieków, gdzie obrazy są wizualnie bardzo podobne.

Wpływ na późniejszą ocenę

Artykuł następnie rozważa, jak przecieki danych wpływają na późniejsze oceny (tj. wydajność w standardowych zadaniach, gdy wstępnie wytrenowane modele są testowane na benchmarkach zawierających zduplikowane dane szkoleniowe).

Trzy zadania zostały rozważone: klasyfikacja zero-shot; klasyfikacja nadzorowana; i odzyskiwanie obrazu-tekstu.

Dla każdego zadania, wydajność modelu została oceniona na benchmarkowym zbiorze danych, dla którego przeciekłe próbki zostały już zidentyfikowane w danych wstępnego szkolenia. Wyniki zostały porównane w czterech podzbiorach: pełnym benchmarku; podzbiorze przeciekłych próbek; podzbiorze nieprzeciekłych próbek; i losowo wybranym podzbiorze o tym samym rozmiarze, co grupa przeciekłych (używana jako kontrola).

Wpływ przecieków danych na trzy późniejsze zadania został zmierzony przy użyciu podzbiorów benchmarkowych znanych jako zawierające przeciekłe obrazy. W klasyfikacji zero-shot, model wstępnie wytrenowany na LAION osiągnął znacznie wyższą dokładność na przeciekłych obrazach z zestawu oceny ImageNet, potwierdzając, że narażenie nawet na near-duplikaty podczas szkolenia zapewnia wymierne korzyści:

Dokładność klasyfikacji zero-shot na zestawie oceny ImageNet w podzbiorach z i bez przecieków. Ostatnia kolumna raportuje zyski względem pełnego zestawu, a wyróżnione wiersze odpowiadają przeciekłym podzbiorom.

Dokładność klasyfikacji zero-shot na zestawie oceny ImageNet w podzbiorach z i bez przecieków. Ostatnia kolumna raportuje zyski względem pełnego zestawu, a wyróżnione wiersze odpowiadają przeciekłym podzbiorom.

Dla klasyfikacji nadzorowanej, przecieki w ImageNet spowodowały dramatyczny spadek wydajności – chyba że przeciekły obraz miał tę samą etykietę w obu podzbiorach, w którym to przypadku model osiągnął niemal idealną dokładność, ujawniając silny efekt pamiętania:

Dokładność klasyfikacji nadzorowanej na zestawie oceny ImageNet dla podzbiorów z i bez przecieków. Kolumny zysków pokazują zmianę względem pełnego zestawu. Przeciekłe podzbiorom są wyróżnione.

Dokładność klasyfikacji nadzorowanej na zestawie oceny ImageNet dla podzbiorów z i bez przecieków. Kolumny zysków pokazują zmianę względem pełnego zestawu. Przeciekłe podzbiorom są wyróżnione.

W odzyskiwaniu obrazu-tekstu, wydajność ponownie poprawiła się dla przeciekłych próbek, z zarówno twardymi, jak i miękkimi przeciekami prowadzącymi do wyższej odzyskiwalności, a także bardziej spójnych wyników w różnych przebiegach:

Wydajność odzyskiwania obrazu-tekstu na Flickr30k w podzbiorach z i bez przecieków, z przeciekłymi podzbiorami wyróżnionymi.

Wydajność odzyskiwania obrazu-tekstu na Flickr30k w podzbiorach z i bez przecieków, z przeciekłymi podzbiorami wyróżnionymi.

Autorzy konkludują:

‘Ogólnie, pokazujemy spójne dowody, że przecieki stanowią poważne zagrożenie dla uczciwej oceny modeli w zbiorach wizji, kompromitując jedną z najbardziej fundamentalnych zasad machine learningu: nie oceniaj modeli na ich danych szkoleniowych.’

Wnioski

Jeden szokujący aspekt artykułu, chociaż nie jest to nowość, jest relacją o potrzebie użycia CLIP do uzyskania cech dla ogromnej góry danych obrazowych w LAION, reprezentującej skalę, której nie można już rozwiązać w żaden inny sposób niż agregatowy, zajmując się tokenizowanymi metadanjami zamiast bardziej szczegółowymi cechami, które mogą być zbadane, gdy zbiór danych jest bardziej zarządzalny.

To jest wyraźnym ilustracją stopnia, w jakim szkolenie modeli wizji-języka przekroczyło granice i możliwości nadzoru ludzkiego, lub jakiegokolwiek rodzaju ręcznej kuracji poza reprezentatywnymi podzbiorami.

 

* Może trochę myląco, problem duplikacji jest zdefiniowany w artykule jako ‘przecieki’.

† Autorzy podkreślają.

Pierwotnie opublikowane we wtorek, 26 sierpnia 2025

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai