Kąt Andersona
Iluzja „Pobierz więcej etykiet!” w badaniach nad sztuczną inteligencją

Współczesne badania nad uczeniem maszynowym często zakładają, że samo uczenie maszynowe może poprawić jakość adnotacji zbiorów danych AI, zwłaszcza podpisów obrazów używanych w modelach wizualno-językowych. Podejście to wynika z wysokiego kosztu pracy ludzi oraz dodatkowego wysiłku potrzebnego do kontroli jakości ich adnotacji.
Przypomina to mem „pobierz więcej pamięci RAM” z początku XXI wieku, który wyśmiewał przekonanie, że ograniczenie sprzętowe można naprawić oprogramowaniem. Problem adnotacji bywa lekceważony, ponieważ uwagę opinii publicznej i rynku przyciągają nowe modele, a etykietowanie danych wygląda jak drobny element całego procesu.
W rzeczywistości zdolność systemów do rozpoznawania i odtwarzania wzorców zależy od jakości i spójności adnotacji ze świata rzeczywistego. Etykiety tworzą lub rozstrzygają ludzie, często podejmując subiektywne decyzje w niedoskonałych warunkach. System uczący się zachowań adnotatorów nie może dobrze działać na danych, których nie ma w przykładach ludzkich. To, co podobne, nie jest identyczne, a równoważność między domenami pozostaje trudnym problemem widzenia komputerowego.
Łańcuch danych źródłowych musi gdzieś się zakończyć. W tym przypadku kończy się na ludzkim mózgu, który dokonuje subiektywnego rozróżnienia i koduje je dla systemu sztucznego.
Koszt i kompromisy RAG
Do niedawna błędy wynikające ze słabo sprawdzonych adnotacji uznawano za akceptowalny koszt uboczny niedoskonałych, ale nadających się do sprzedaży systemów generatywnych. Badanie z Singapuru stwierdziło, że halucynacje, czyli zmyślanie treści sprzecznych z naszym zamiarem, mogą być nieuniknione i związane z architekturą pojęciową modeli.
Agenci RAG, którzy weryfikują fakty przez wyszukiwanie w internecie, stają się więc popularni. Zwiększają jednak koszt zasobów i opóźnienie zapytań, a nowe informacje dostarczone po treningu nie dorównują głębokim powiązaniom utrwalonym w warstwach modelu. Lepiej byłoby ograniczyć błędy w danych adnotacyjnych od początku, nawet jeśli pełna doskonałość jest niemożliwa ze względu na ludzką subiektywność.
RePOPE i błędy wzorcowych etykiet
Nowa praca z Niemiec bada dokładność podpisów obrazów w starszych, powszechnie używanych zbiorach. Autorzy pokazują, że błędy etykiet mogą ukrywać lub fałszywie przedstawiać halucynacje modeli wizualno-językowych.

Wyobraźmy sobie zdjęcie ulicy i pytanie, czy znajduje się na nim rower. Model odpowiada „tak”. Jeśli benchmark mówi „nie”, odpowiedź zostanie uznana za błędną. Gdy jednak rower jest wyraźnie widoczny, a adnotator go pominął, poprawny jest model, a nie zbiór testowy. Nagromadzenie takich pomyłek zniekształca ocenę i ranking modeli.
Gdy błędne albo niejednoznaczne etykiety traktuje się jako prawdę, model może wyglądać na halucynujący, kiedy ma rację, lub na trafny, kiedy się myli. Utrudnia to zarówno pomiar problemu, jak i jego diagnozę.
Praca RePOPE: Impact of Annotation Errors on the POPE Benchmark ponownie analizuje benchmark Polling-based Object Probing Evaluation. POPE sprawdza, czy model potrafi powiedzieć, co znajduje się na obrazie, korzystając z etykiet Microsoft COCO, długo uważanych za wystarczająco dokładne.

POPE zmienia ocenę halucynacji w klasyfikację binarną. Zamiast analizować długie podpisy, zadaje pytania „tak/nie”, na przykład „Czy na obrazie znajduje się <obiekt>?”. Obiekty obecne są zestawiane z nieistniejącymi, wybieranymi losowo, według popularności albo współwystępowania. Ogranicza to wpływ sformułowania pytania.

Autorzy RePOPE ponownie sprawdzili etykiety obrazów MSCOCO i znaleźli zaskakująco wiele przypadków błędnych lub niejasnych. Po korekcie zmieniły się rankingi modeli, szczególnie według wyniku F1. Niektóre modele wcześniej wysoko oceniane spadły, a inne awansowały.

Metoda i testy
Wszystkie adnotacje w badanym benchmarku zostały ponownie oznaczone przez dwóch ludzi na każdy przykład. Przypadki o niejasnych granicach kategorii, takie jak miś uznany za niedźwiedzia, motocykl za rower albo pojazd lotniskowy za samochód, wykluczono ze względu na subiektywność.

Inne przykłady obejmowały osoby w tle lub za szybą, krzesła zasłonięte przez tenisistę oraz mały pasek marchewki widoczny w sałatce. Wśród pytań oznaczonych w POPE jako „tak” 9,3% było błędnych, a 13,8% niejednoznacznych. Dla pytań „nie” 1,7% miało złą etykietę, a 4,3% było niejednoznacznych.

Badacze przetestowali szeroki zestaw modeli o otwartych wagach, między innymi InternVL2.5, LLaVA-NeXT, Vicuna, Mistral 7B, Llama, LLaVA-OneVision, Ovis2, PaliGemma i PaliGemma2, porównując oryginalny POPE z poprawionym RePOPE.

Po korekcie etykiet liczba prawdziwie dodatnich odpowiedzi spadła we wszystkich modelach. Wcześniej otrzymywały one punkty za odpowiedzi zgodne jedynie z wadliwymi etykietami. Wyniki fałszywie dodatnie zmieniały się zależnie od wariantu testu.
W losowej części POPE fałszywie dodatnie odpowiedzi niemal się podwoiły dla wielu modeli. Wiele obiektów uznanych za halucynacje faktycznie znajdowało się na zdjęciach, lecz pominięto je w oryginalnych adnotacjach. W części „adversarial”, opartej na obiektach często współwystępujących, liczba fałszywie dodatnich odpowiedzi spadła.
Precyzja i czułość się zmieniły, ale ich rankingi pozostały dość stabilne. Znacznie bardziej wrażliwy był wynik F1, główna miara POPE. W losowym podzbiorze InternVL2.5-8B i 26B spadły z góry rankingu na dół, podczas gdy Ovis2-4B i 8B awansowały.
Autorzy udostępnili poprawione etykiety w serwisie GitHub. Zastrzegają jednak, że ponowne oznaczenie nie usuwa nasycenia benchmarku, ponieważ wiele modeli nadal osiąga ponad 90% odpowiedzi prawdziwie dodatnich i prawdziwie ujemnych. Zalecają używanie RePOPE razem z trudniejszymi testami, takimi jak DASH-B.
Źródła i powiązane odnośniki
- used to improve
- high cost
- supervising
- 'download more RAM' meme
- dependent
- non-ideal circumstances
- problematic pursuit
- concluded
- hallucinations
- RAG-based agents
- Polling-based Object Probing Evaluation
- Microsoft COCO: Common Objects in Context
- binary classification task
- new paper
- F1
- OpenVLM
- InternVL2.5
- LLaVA-NeXT
- Vicuna
- Mistral 7b
- Llama
- LLaVA-OneVision
- Ovis2
- PaliGemma-3B
- PaliGemma2
- released the corrected labels
- DASH-B
- potentially exploitative
Wnioski
Eksperyment był możliwy dzięki niewielkiej skali badanego benchmarku. Sprawdzenie tej samej hipotezy na ogromnych zbiorach wymagałoby pracy na małych fragmentach, które mogą nie być reprezentatywne statystycznie ani spójne znaczeniowo.
Nawet gdyby było to wykonalne, rozwiązanie prowadzi z powrotem do potrzeby lepszych i liczniejszych adnotacji ludzkich. „Lepsze” i „liczniejsze” to jednak dwa odrębne problemy. Platformy oparte na konkurowaniu ceną, takie jak Amazon Mechanical Turk, zwiększają wolumen, lecz mogą wykorzystywać pracowników i dostarczać gorszą jakość.
Można też zlecać pracę w regionach o niższych kosztach. Im bardziej jednak adnotator jest oddalony kulturowo i kontekstowo od docelowego zastosowania, tym mniej prawdopodobne, że model ukształtowany przez jego etykiety odpowie potrzebom danej domeny.
Dlatego jakość adnotacji pozostaje jednym z najbardziej trwałych i nierozwiązanych wyzwań ekonomiki rozwoju uczenia maszynowego.
Artykuł opublikowano po raz pierwszy w środę, 23 kwietnia 2025 r.












