Kąt Andersona

Iluzja „Pobierz więcej etykiet!” w badaniach nad sztuczną inteligencją

mm
Dodaj Unite.AI do preferowanych źródeł w Google
ChatGPT-4o: 'A wall on which hundreds of photographs are stuck with thumb-tacks. Each photo depicts a different kind of subject, such as fruit or animals or bridges or buildings or people, etc. Each photo has 2-3 yellow post-it notes attached to it. We are too far away to read anything written on the post-it notes, but we can see that there are dozens and dozens of photos on the wall, and each with several post-it notes tacked on.'

Współczesne badania nad uczeniem maszynowym często zakładają, że samo uczenie maszynowe może poprawić jakość adnotacji zbiorów danych AI, zwłaszcza podpisów obrazów używanych w modelach wizualno-językowych. Podejście to wynika z wysokiego kosztu pracy ludzi oraz dodatkowego wysiłku potrzebnego do kontroli jakości ich adnotacji.

Przypomina to mem „pobierz więcej pamięci RAM” z początku XXI wieku, który wyśmiewał przekonanie, że ograniczenie sprzętowe można naprawić oprogramowaniem. Problem adnotacji bywa lekceważony, ponieważ uwagę opinii publicznej i rynku przyciągają nowe modele, a etykietowanie danych wygląda jak drobny element całego procesu.

W rzeczywistości zdolność systemów do rozpoznawania i odtwarzania wzorców zależy od jakości i spójności adnotacji ze świata rzeczywistego. Etykiety tworzą lub rozstrzygają ludzie, często podejmując subiektywne decyzje w niedoskonałych warunkach. System uczący się zachowań adnotatorów nie może dobrze działać na danych, których nie ma w przykładach ludzkich. To, co podobne, nie jest identyczne, a równoważność między domenami pozostaje trudnym problemem widzenia komputerowego.

Łańcuch danych źródłowych musi gdzieś się zakończyć. W tym przypadku kończy się na ludzkim mózgu, który dokonuje subiektywnego rozróżnienia i koduje je dla systemu sztucznego.

Koszt i kompromisy RAG

Do niedawna błędy wynikające ze słabo sprawdzonych adnotacji uznawano za akceptowalny koszt uboczny niedoskonałych, ale nadających się do sprzedaży systemów generatywnych. Badanie z Singapuru stwierdziło, że halucynacje, czyli zmyślanie treści sprzecznych z naszym zamiarem, mogą być nieuniknione i związane z architekturą pojęciową modeli.

Agenci RAG, którzy weryfikują fakty przez wyszukiwanie w internecie, stają się więc popularni. Zwiększają jednak koszt zasobów i opóźnienie zapytań, a nowe informacje dostarczone po treningu nie dorównują głębokim powiązaniom utrwalonym w warstwach modelu. Lepiej byłoby ograniczyć błędy w danych adnotacyjnych od początku, nawet jeśli pełna doskonałość jest niemożliwa ze względu na ludzką subiektywność.

RePOPE i błędy wzorcowych etykiet

Nowa praca z Niemiec bada dokładność podpisów obrazów w starszych, powszechnie używanych zbiorach. Autorzy pokazują, że błędy etykiet mogą ukrywać lub fałszywie przedstawiać halucynacje modeli wizualno-językowych.

Przykłady błędnych podpisów obiektów w MSCOCO. Źródło: RePOPE.
Przykłady błędnych podpisów obiektów w MSCOCO. Źródło: RePOPE.

Wyobraźmy sobie zdjęcie ulicy i pytanie, czy znajduje się na nim rower. Model odpowiada „tak”. Jeśli benchmark mówi „nie”, odpowiedź zostanie uznana za błędną. Gdy jednak rower jest wyraźnie widoczny, a adnotator go pominął, poprawny jest model, a nie zbiór testowy. Nagromadzenie takich pomyłek zniekształca ocenę i ranking modeli.

Gdy błędne albo niejednoznaczne etykiety traktuje się jako prawdę, model może wyglądać na halucynujący, kiedy ma rację, lub na trafny, kiedy się myli. Utrudnia to zarówno pomiar problemu, jak i jego diagnozę.

Praca RePOPE: Impact of Annotation Errors on the POPE Benchmark ponownie analizuje benchmark Polling-based Object Probing Evaluation. POPE sprawdza, czy model potrafi powiedzieć, co znajduje się na obrazie, korzystając z etykiet Microsoft COCO, długo uważanych za wystarczająco dokładne.

Przykłady halucynacji obiektów w modelach wizualno-językowych.
Przykłady halucynacji obiektów w modelach wizualno-językowych.

POPE zmienia ocenę halucynacji w klasyfikację binarną. Zamiast analizować długie podpisy, zadaje pytania „tak/nie”, na przykład „Czy na obrazie znajduje się <obiekt>?”. Obiekty obecne są zestawiane z nieistniejącymi, wybieranymi losowo, według popularności albo współwystępowania. Ogranicza to wpływ sformułowania pytania.

Przykłady obrazów z MSCOCO z 2014 roku.
Przykłady obrazów z MSCOCO z 2014 roku.

Autorzy RePOPE ponownie sprawdzili etykiety obrazów MSCOCO i znaleźli zaskakująco wiele przypadków błędnych lub niejasnych. Po korekcie zmieniły się rankingi modeli, szczególnie według wyniku F1. Niektóre modele wcześniej wysoko oceniane spadły, a inne awansowały.

Drobne lub zasłonięte obiekty pominięte w pierwotnych adnotacjach.
Drobne lub zasłonięte obiekty pominięte w pierwotnych adnotacjach.

Metoda i testy

Wszystkie adnotacje w badanym benchmarku zostały ponownie oznaczone przez dwóch ludzi na każdy przykład. Przypadki o niejasnych granicach kategorii, takie jak miś uznany za niedźwiedzia, motocykl za rower albo pojazd lotniskowy za samochód, wykluczono ze względu na subiektywność.

Przypadki niejednoznaczne wynikające z niejasnych granic kategorii.
Przypadki niejednoznaczne wynikające z niejasnych granic kategorii.

Inne przykłady obejmowały osoby w tle lub za szybą, krzesła zasłonięte przez tenisistę oraz mały pasek marchewki widoczny w sałatce. Wśród pytań oznaczonych w POPE jako „tak” 9,3% było błędnych, a 13,8% niejednoznacznych. Dla pytań „nie” 1,7% miało złą etykietę, a 4,3% było niejednoznacznych.

Wyniki ponownej adnotacji pytań dodatnich i ujemnych w POPE.
Wyniki ponownej adnotacji pytań dodatnich i ujemnych w POPE.

Badacze przetestowali szeroki zestaw modeli o otwartych wagach, między innymi InternVL2.5, LLaVA-NeXT, Vicuna, Mistral 7B, Llama, LLaVA-OneVision, Ovis2, PaliGemma i PaliGemma2, porównując oryginalny POPE z poprawionym RePOPE.

Wpływ korekty etykiet na wyniki i rankingi F1.
Wpływ korekty etykiet na wyniki i rankingi F1.

Po korekcie etykiet liczba prawdziwie dodatnich odpowiedzi spadła we wszystkich modelach. Wcześniej otrzymywały one punkty za odpowiedzi zgodne jedynie z wadliwymi etykietami. Wyniki fałszywie dodatnie zmieniały się zależnie od wariantu testu.

W losowej części POPE fałszywie dodatnie odpowiedzi niemal się podwoiły dla wielu modeli. Wiele obiektów uznanych za halucynacje faktycznie znajdowało się na zdjęciach, lecz pominięto je w oryginalnych adnotacjach. W części „adversarial”, opartej na obiektach często współwystępujących, liczba fałszywie dodatnich odpowiedzi spadła.

Precyzja i czułość się zmieniły, ale ich rankingi pozostały dość stabilne. Znacznie bardziej wrażliwy był wynik F1, główna miara POPE. W losowym podzbiorze InternVL2.5-8B i 26B spadły z góry rankingu na dół, podczas gdy Ovis2-4B i 8B awansowały.

Autorzy udostępnili poprawione etykiety w serwisie GitHub. Zastrzegają jednak, że ponowne oznaczenie nie usuwa nasycenia benchmarku, ponieważ wiele modeli nadal osiąga ponad 90% odpowiedzi prawdziwie dodatnich i prawdziwie ujemnych. Zalecają używanie RePOPE razem z trudniejszymi testami, takimi jak DASH-B.

Źródła i powiązane odnośniki

Wnioski

Eksperyment był możliwy dzięki niewielkiej skali badanego benchmarku. Sprawdzenie tej samej hipotezy na ogromnych zbiorach wymagałoby pracy na małych fragmentach, które mogą nie być reprezentatywne statystycznie ani spójne znaczeniowo.

Nawet gdyby było to wykonalne, rozwiązanie prowadzi z powrotem do potrzeby lepszych i liczniejszych adnotacji ludzkich. „Lepsze” i „liczniejsze” to jednak dwa odrębne problemy. Platformy oparte na konkurowaniu ceną, takie jak Amazon Mechanical Turk, zwiększają wolumen, lecz mogą wykorzystywać pracowników i dostarczać gorszą jakość.

Można też zlecać pracę w regionach o niższych kosztach. Im bardziej jednak adnotator jest oddalony kulturowo i kontekstowo od docelowego zastosowania, tym mniej prawdopodobne, że model ukształtowany przez jego etykiety odpowie potrzebom danej domeny.

Dlatego jakość adnotacji pozostaje jednym z najbardziej trwałych i nierozwiązanych wyzwań ekonomiki rozwoju uczenia maszynowego.

Artykuł opublikowano po raz pierwszy w środę, 23 kwietnia 2025 r.

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai