Andersonův úhel
Iluze „Stáhněte si více štítků!“ ve výzkumu umělé inteligence

V současném výzkumu strojového učení se často předpokládá, že samo strojové učení může zlepšit kvalitu anotací datových sad AI, zejména popisků obrázků pro vizuálně-jazykové modely. Tento přístup vychází z vysokých nákladů lidské práce a další zátěže spojené s kontrolou kvality anotací.
Připomíná to internetový vtip „stáhněte si více RAM“ z počátku století, který zesměšňoval představu, že hardwarové omezení lze vyřešit softwarem. Problém anotací bývá podceňován, protože veřejnou i komerční pozornost přitahují nové modely a označování dat se vedle nich jeví jako nepodstatný detail.
Schopnost systémů rozpoznávat a reprodukovat vzory však závisí na kvalitě a konzistenci anotací z reálného světa. Štítky vytvářejí nebo posuzují lidé, často subjektivně a v neideálních podmínkách. Systém, který se učí vzorce z chování anotátorů, nemůže dobře fungovat na datech, jež v lidských příkladech nebyla. Podobné není totožné a přenos ekvivalence mezi doménami zůstává obtížným problémem počítačového vidění.
Řetězec zdrojových dat musí někde skončit. Zde končí u lidského mozku, který provede subjektivní rozlišení a zakóduje je pro umělý systém.
Náklady a kompromisy RAG
Donedávna byly chyby způsobené nedostatečně kontrolovanými anotacemi považovány za přijatelný vedlejší náklad nedokonalých, ale prodejných generativních systémů. Studie ze Singapuru dospěla k závěru, že halucinace, při nichž AI vytváří obsah odporující našemu záměru, mohou být nevyhnutelné a spojené s pojmovou architekturou modelů.
Agenti RAG, kteří ověřují fakta vyhledáváním na internetu, proto získávají na popularitě. Zvyšují však spotřebu zdrojů a prodlevu dotazů. Nová informace dodaná po tréninku navíc nedokáže soupeřit s hlubokými vazbami uloženými ve vrstvách modelu. Bylo by lepší omezit chyby v anotacích už na začátku, i když úplné dokonalosti kvůli lidské subjektivitě dosáhnout nelze.
RePOPE a chyby referenčních štítků
Nová německá práce zkoumá přesnost popisků ve starších, široce používaných datových sadách. Autoři ukazují, že chybné štítky v benchmarku mohou halucinace vizuálně-jazykových modelů skrýt nebo nesprávně vykreslit.

Představme si fotografii ulice a otázku, zda je na ní jízdní kolo. Model odpoví „ano“. Pokud benchmark tvrdí, že tam kolo není, označí model za chybný. Je-li však kolo jasně viditelné a původní anotátor je přehlédl, odpověděl správně model a selhala datová sada. Hromadění těchto omylů zkresluje hodnocení i pořadí modelů.
Pokud se chybné nebo nejednoznačné štítky považují za pravdu, model může vypadat, že halucinuje, i když má pravdu, nebo naopak jako přesný, když se mýlí. Tím se zhoršuje měření i diagnostika problému.
Studie RePOPE: Impact of Annotation Errors on the POPE Benchmark znovu analyzuje Polling-based Object Probing Evaluation. POPE zjišťuje, zda model umí určit, co se na snímku nachází, a vychází ze štítků Microsoft COCO, které byly dlouho pokládány za dostatečně přesné.

POPE převádí hodnocení halucinací na binární klasifikaci. Namísto rozboru dlouhých popisků klade otázky ano/ne, například „Je na obrázku <objekt>?“. Skutečné objekty páruje s neexistujícími, vybranými náhodně, podle četnosti nebo podle společného výskytu. Tím snižuje citlivost na formulaci otázky.

Autoři RePOPE znovu zkontrolovali štítky obrazů MSCOCO a našli překvapivé množství chybných nebo nejasných případů. Po opravě se změnilo pořadí modelů, zejména podle skóre F1. Některé dříve vysoce hodnocené modely klesly a jiné se posunuly vzhůru.

Metoda a testování
Všechny anotace v analyzovaném benchmarku znovu označili dva lidé pro každý příklad. Případy s nejasnými hranicemi kategorií, například plyšový medvídek považovaný za medvěda, motocykl za jízdní kolo nebo letištní vozidlo za automobil, byly kvůli subjektivitě vyřazeny.

Další příklady zahrnovaly osoby v pozadí nebo za sklem, židle zakryté tenisovým hráčem a malý proužek mrkve viditelný v salátu. Mezi otázkami, které POPE označil jako „ano“, bylo 9,3 % chybných a 13,8 % nejednoznačných. U otázek „ne“ mělo 1,7 % nesprávný štítek a 4,3 % bylo nejednoznačných.

Výzkumníci otestovali širokou skupinu modelů s otevřenými vahami, mimo jiné InternVL2.5, LLaVA-NeXT, Vicuna, Mistral 7B, Llama, LLaVA-OneVision, Ovis2, PaliGemma a PaliGemma2. Výsledky původního POPE porovnali s opraveným RePOPE.

Po opravě štítků klesl počet skutečně kladných odpovědí u všech modelů. Dříve získávaly body za odpovědi, které souhlasily pouze s chybnými anotacemi. Počet falešně kladných odpovědí se měnil podle varianty testu.
V náhodné části POPE se falešně kladné odpovědi u mnoha modelů téměř zdvojnásobily. Řada objektů označených za halucinace ve skutečnosti na fotografiích byla, ale původní anotace je vynechaly. V části „adversarial“, založené na často společně se vyskytujících objektech, počet falešně kladných odpovědí naopak klesl.
Přesnost a citlivost se změnily, jejich pořadí však zůstalo poměrně stabilní. Mnohem citlivější bylo hlavní měřítko POPE, skóre F1. V náhodném podsouboru se InternVL2.5-8B a 26B propadly z horních příček, zatímco Ovis2-4B a 8B vystoupaly na vrchol.
Autoři zveřejnili opravené štítky na GitHubu. Upozorňují však, že nové anotace neřeší nasycení benchmarku, protože řada modelů stále dosahuje více než 90 % skutečně kladných i skutečně záporných odpovědí. RePOPE proto doporučují používat společně s obtížnějšími testy, například DASH-B.
Zdroje a související odkazy
- used to improve
- high cost
- supervising
- 'download more RAM' meme
- dependent
- non-ideal circumstances
- problematic pursuit
- concluded
- hallucinations
- RAG-based agents
- Polling-based Object Probing Evaluation
- Microsoft COCO: Common Objects in Context
- binary classification task
- new paper
- F1
- OpenVLM
- InternVL2.5
- LLaVA-NeXT
- Vicuna
- Mistral 7b
- Llama
- LLaVA-OneVision
- Ovis2
- PaliGemma-3B
- PaliGemma2
- released the corrected labels
- DASH-B
- potentially exploitative
Závěr
Experiment byl možný díky malému rozsahu testovaného benchmarku. Ověření stejné hypotézy na obrovských datových sadách by vyžadovalo práci s malými fragmenty, které nemusejí být statisticky reprezentativní ani významově soudržné.
I kdyby to bylo proveditelné, řešení se vrací k potřebě kvalitnějších a početnějších lidských anotací. „Lepší“ a „početnější“ jsou však dva rozdílné problémy. Platformy založené na cenové soutěži, jako Amazon Mechanical Turk, mohou zvýšit objem, ale zároveň mohou pracovníky vykořisťovat a dodávat horší kvalitu.
Úkoly lze zadat také do regionů s nižšími náklady. Čím více je však anotátor kulturně a kontextově vzdálený cílovému použití, tím méně pravděpodobně model vytvořený podle jeho štítků odpoví potřebám dané domény.
Kvalita anotací proto zůstává jednou z nejtrvalejších a nevyřešených výzev ekonomiky vývoje strojového učení.
Článek byl poprvé zveřejněn ve středu 23. dubna 2025.












