Andersonův úhel

Iluze „Stáhněte si více štítků!“ ve výzkumu umělé inteligence

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
ChatGPT-4o: 'A wall on which hundreds of photographs are stuck with thumb-tacks. Each photo depicts a different kind of subject, such as fruit or animals or bridges or buildings or people, etc. Each photo has 2-3 yellow post-it notes attached to it. We are too far away to read anything written on the post-it notes, but we can see that there are dozens and dozens of photos on the wall, and each with several post-it notes tacked on.'

V současném výzkumu strojového učení se často předpokládá, že samo strojové učení může zlepšit kvalitu anotací datových sad AI, zejména popisků obrázků pro vizuálně-jazykové modely. Tento přístup vychází z vysokých nákladů lidské práce a další zátěže spojené s kontrolou kvality anotací.

Připomíná to internetový vtip „stáhněte si více RAM“ z počátku století, který zesměšňoval představu, že hardwarové omezení lze vyřešit softwarem. Problém anotací bývá podceňován, protože veřejnou i komerční pozornost přitahují nové modely a označování dat se vedle nich jeví jako nepodstatný detail.

Schopnost systémů rozpoznávat a reprodukovat vzory však závisí na kvalitě a konzistenci anotací z reálného světa. Štítky vytvářejí nebo posuzují lidé, často subjektivně a v neideálních podmínkách. Systém, který se učí vzorce z chování anotátorů, nemůže dobře fungovat na datech, jež v lidských příkladech nebyla. Podobné není totožné a přenos ekvivalence mezi doménami zůstává obtížným problémem počítačového vidění.

Řetězec zdrojových dat musí někde skončit. Zde končí u lidského mozku, který provede subjektivní rozlišení a zakóduje je pro umělý systém.

Náklady a kompromisy RAG

Donedávna byly chyby způsobené nedostatečně kontrolovanými anotacemi považovány za přijatelný vedlejší náklad nedokonalých, ale prodejných generativních systémů. Studie ze Singapuru dospěla k závěru, že halucinace, při nichž AI vytváří obsah odporující našemu záměru, mohou být nevyhnutelné a spojené s pojmovou architekturou modelů.

Agenti RAG, kteří ověřují fakta vyhledáváním na internetu, proto získávají na popularitě. Zvyšují však spotřebu zdrojů a prodlevu dotazů. Nová informace dodaná po tréninku navíc nedokáže soupeřit s hlubokými vazbami uloženými ve vrstvách modelu. Bylo by lepší omezit chyby v anotacích už na začátku, i když úplné dokonalosti kvůli lidské subjektivitě dosáhnout nelze.

RePOPE a chyby referenčních štítků

Nová německá práce zkoumá přesnost popisků ve starších, široce používaných datových sadách. Autoři ukazují, že chybné štítky v benchmarku mohou halucinace vizuálně-jazykových modelů skrýt nebo nesprávně vykreslit.

Příklady nesprávných popisků objektů v MSCOCO. Zdroj: RePOPE.
Příklady nesprávných popisků objektů v MSCOCO. Zdroj: RePOPE.

Představme si fotografii ulice a otázku, zda je na ní jízdní kolo. Model odpoví „ano“. Pokud benchmark tvrdí, že tam kolo není, označí model za chybný. Je-li však kolo jasně viditelné a původní anotátor je přehlédl, odpověděl správně model a selhala datová sada. Hromadění těchto omylů zkresluje hodnocení i pořadí modelů.

Pokud se chybné nebo nejednoznačné štítky považují za pravdu, model může vypadat, že halucinuje, i když má pravdu, nebo naopak jako přesný, když se mýlí. Tím se zhoršuje měření i diagnostika problému.

Studie RePOPE: Impact of Annotation Errors on the POPE Benchmark znovu analyzuje Polling-based Object Probing Evaluation. POPE zjišťuje, zda model umí určit, co se na snímku nachází, a vychází ze štítků Microsoft COCO, které byly dlouho pokládány za dostatečně přesné.

Příklady halucinací objektů ve vizuálně-jazykových modelech.
Příklady halucinací objektů ve vizuálně-jazykových modelech.

POPE převádí hodnocení halucinací na binární klasifikaci. Namísto rozboru dlouhých popisků klade otázky ano/ne, například „Je na obrázku <objekt>?“. Skutečné objekty páruje s neexistujícími, vybranými náhodně, podle četnosti nebo podle společného výskytu. Tím snižuje citlivost na formulaci otázky.

Příklady snímků z datové sady MSCOCO z roku 2014.
Příklady snímků z datové sady MSCOCO z roku 2014.

Autoři RePOPE znovu zkontrolovali štítky obrazů MSCOCO a našli překvapivé množství chybných nebo nejasných případů. Po opravě se změnilo pořadí modelů, zejména podle skóre F1. Některé dříve vysoce hodnocené modely klesly a jiné se posunuly vzhůru.

Drobné nebo zakryté objekty, které původní anotace přehlédly.
Drobné nebo zakryté objekty, které původní anotace přehlédly.

Metoda a testování

Všechny anotace v analyzovaném benchmarku znovu označili dva lidé pro každý příklad. Případy s nejasnými hranicemi kategorií, například plyšový medvídek považovaný za medvěda, motocykl za jízdní kolo nebo letištní vozidlo za automobil, byly kvůli subjektivitě vyřazeny.

Nejednoznačné případy s nejasnými hranicemi kategorií.
Nejednoznačné případy s nejasnými hranicemi kategorií.

Další příklady zahrnovaly osoby v pozadí nebo za sklem, židle zakryté tenisovým hráčem a malý proužek mrkve viditelný v salátu. Mezi otázkami, které POPE označil jako „ano“, bylo 9,3 % chybných a 13,8 % nejednoznačných. U otázek „ne“ mělo 1,7 % nesprávný štítek a 4,3 % bylo nejednoznačných.

Výsledky nového označení kladných a záporných otázek POPE.
Výsledky nového označení kladných a záporných otázek POPE.

Výzkumníci otestovali širokou skupinu modelů s otevřenými vahami, mimo jiné InternVL2.5, LLaVA-NeXT, Vicuna, Mistral 7B, Llama, LLaVA-OneVision, Ovis2, PaliGemma a PaliGemma2. Výsledky původního POPE porovnali s opraveným RePOPE.

Dopad oprav štítků na výsledky a pořadí podle F1.
Dopad oprav štítků na výsledky a pořadí podle F1.

Po opravě štítků klesl počet skutečně kladných odpovědí u všech modelů. Dříve získávaly body za odpovědi, které souhlasily pouze s chybnými anotacemi. Počet falešně kladných odpovědí se měnil podle varianty testu.

V náhodné části POPE se falešně kladné odpovědi u mnoha modelů téměř zdvojnásobily. Řada objektů označených za halucinace ve skutečnosti na fotografiích byla, ale původní anotace je vynechaly. V části „adversarial“, založené na často společně se vyskytujících objektech, počet falešně kladných odpovědí naopak klesl.

Přesnost a citlivost se změnily, jejich pořadí však zůstalo poměrně stabilní. Mnohem citlivější bylo hlavní měřítko POPE, skóre F1. V náhodném podsouboru se InternVL2.5-8B a 26B propadly z horních příček, zatímco Ovis2-4B a 8B vystoupaly na vrchol.

Autoři zveřejnili opravené štítky na GitHubu. Upozorňují však, že nové anotace neřeší nasycení benchmarku, protože řada modelů stále dosahuje více než 90 % skutečně kladných i skutečně záporných odpovědí. RePOPE proto doporučují používat společně s obtížnějšími testy, například DASH-B.

Zdroje a související odkazy

Závěr

Experiment byl možný díky malému rozsahu testovaného benchmarku. Ověření stejné hypotézy na obrovských datových sadách by vyžadovalo práci s malými fragmenty, které nemusejí být statisticky reprezentativní ani významově soudržné.

I kdyby to bylo proveditelné, řešení se vrací k potřebě kvalitnějších a početnějších lidských anotací. „Lepší“ a „početnější“ jsou však dva rozdílné problémy. Platformy založené na cenové soutěži, jako Amazon Mechanical Turk, mohou zvýšit objem, ale zároveň mohou pracovníky vykořisťovat a dodávat horší kvalitu.

Úkoly lze zadat také do regionů s nižšími náklady. Čím více je však anotátor kulturně a kontextově vzdálený cílovému použití, tím méně pravděpodobně model vytvořený podle jeho štítků odpoví potřebám dané domény.

Kvalita anotací proto zůstává jednou z nejtrvalejších a nevyřešených výzev ekonomiky vývoje strojového učení.

Článek byl poprvé zveřejněn ve středu 23. dubna 2025.

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai