Andersonův úhel
Hodnocení historické přesnosti ImageNet

Nová studie z Google Research a UC Berkeley přidává k dlouhodobé kritice ohledně závislosti počítačového vidění (CV) na datasetu ImageNet a jeho mnoha derivátech. Po pečlivé manuální evaluaci autoři dospěli k závěru, že téměř 50 % chyb, které nejlepší modely dělají na multi-label subsetu ImageNet (kde současné nejlepší modely dosahují přes 97% top-1 přesnosti), nejsou ve skutečnosti chyby.
Z dokumentu:
‘Naše analýza ukazuje, že téměř polovina předpokládaných chyb nejsou ve skutečnosti chyby, a objevujeme nové platné multi-labely, což ukazuje, že bez pečlivé kontroly významně podceňujeme výkon těchto modelů.
‘Na druhé straně jsme také zjistili, že nejlepší modely dneška stále dělají značné množství chyb (40%), které jsou zjevně špatné pro lidské recenzenty.’
Rozsah, ve kterém nesprávné označení datasetů – zejména nesprávné označení datasetů nespecializovanými pracovníky – může ovlivňovat sektor, byl odhalen pečlivým přístupem k evaluaci obrazů a textových párů napříč velkou částí historie ImageNet.

V horním řádku jsou příklady závažnosti chyb: v prvních dvou příkladech nový model jednoduche chybně předpovídá label; ve třetím příkladu nový model identifikuje dříve chybějící multi-label (label, který řeší novou kategorizaci obrázku); ve čtvrtém obrázku v horním řádku je předpověď modelu nejednoznačná, protože obrázek je bee-fly a ne fly. Nicméně, průměrná včela patří do řádu Diptera, a proto by tato výjimka byla téměř nemožné rozpoznat, i pro odborného annotátora. V řádku níže jsou čtyři kategorie chyb s příklady. Původ: https://arxiv.org/pdf/2205.04596.pdf
Vědci zaměstnávali malé množství vyhrazených evaluatorů, kteří pečlivě přezkoumali historické záznamy chyb v datasetu ImageNet, a zjistili, že mnoho z chyb je samo o sobě chybné – objev, který potenciálně reviduje některé špatné hodnocení, které mnoho projektů získalo na ImageNet benchmarcích v průběhu let.
Jak se ImageNet upevňuje v kultuře CV, vědci tvrdí, že zlepšení přesnosti se považují za poskytující klesající návratnost, a že nové modely, které překračují zavedenou přesnost labelů a které navrhují nové (tj. další) labely, mohou být trestány, v podstatě, za nekonformitu.
‘Například,’ autoři pozorují. ‘měli bychom trestat modely za to, že jsou první, kdo předpovídá, že předpečený bagel může být bagel, jako jeden z modelů, které jsme přezkoumali v této práci?’

Z dokumentu, nový model popírá předchozí předpověď, že objekt na fotografii je těsto, a navrhuje, že objekt je ve skutečnosti již bagel).
Z pohledu crowdfundovaného pracovníka, který má za úkol identifikovat takový objekt, je to sémantická a dokonce filozofická otázka, která může být vyřešena pouze pomocí multi-labelingu (což se často vyskytuje v pozdějších podmnožinách a následujících iteracích ImageNet); v tomto případě je objekt skutečně oběma – těstem a alespoň zárodkem bagelu.

Hlavní (nahoře) a vedlejší (dole) chyby, které vyšly najevo při testování vlastních modelů ve výzkumu. Původní ImageNet labely jsou první obrázky vlevo.
Dvě zjevné řešení jsou přiřazovat více zdrojů k označení (což je výzvou, v rámci rozpočtových omezení většiny počítačových vidění výzkumných projektů); a, jak autoři zdůrazňují, pravidelně aktualizovat datasety a label evaluace sub-sad (což, mezi jinými překážkami, riskuje porušit ‘like for like’ historickou kontinuitu benchmarků, a znečišťovat nové výzkumné dokumenty kvalifikacemi a prohlášeními o ekvivalenci).
Jako krok k nápravě situace, vědci vyvinuli novou sub-dataset ImageNet nazvanou ImageNet-Major (ImageNet-M), kterou popisují jako ’68-příklad “hlavní chyba” slice zřejmých chyb, které dělají dnešní nejlepší modely—a slice, kde by modely měly dosáhnout téměř dokonalosti, ale dnes jsou daleko od toho.’
Dokument je nazvaný Kdy se těsto stává bagelem? Analýza zbývajících chyb na ImageNet, a je napsán čtyřmi autory z Google Research, spolu se Sarou Fridovich-Keil z UC Berkeley.
Technický dluh
Zjištění jsou důležitá, protože zbývající chyby identifikované (nebo chybně identifikované) v ImageNet, v 16 letech od jeho vzniku, centrální studie výzkumu, mohou představovat rozdíl mezi nasaditelným modelem a modelem, který je dostatečně chybný, aby nemohl být uvolněn na živá data. Jako vždy, poslední míli je kritická.
Sektor počítačového vidění a image syntézy výzkumu se efektivní ‘auto-vybral’ ImageNet jako benchmark metriku, z důvodu, že raná adoptace, v době, kdy byly high-volume a dobře označené datasety vzácnější, než jsou nyní, produkují tolik výzkumných iniciativ, že testování proti ImageNet se rychle stalo jediným široce aplikovatelným historickým ‘standardem’ pro benchmarkování nových rámců.
Metoda
Hledání ‘zbývajících chyb’ v ImageNet, vědci použili standardní ViT model (schopný dosáhnout přesnosti 89,5%) s 3 miliardami parametrů, Vit-3B, pretrained na JFT-3B a fine-tuned na ImageNet-1K.
Používají ImageNet2012_multilabel dataset, vědci zaznamenali počáteční multi-label přesnost (MLA) ViT-3B jako 96,3%, během které model udělal 676 zjevných chyb. Tyto chyby (a také chyby vyrobené modelem Greedy Soups) autoři hledali.
Pro evaluaci zbývajících 676 chyb, autoři se vyhnuli crowdfundovaným pracovníkům, pozorujíce, že chyby tohoto typu mohou být obtížné pro průměrné annotátory, ale shromáždili panel pěti expertních recenzentů, a vytvořili vyhrazený nástroj, který umožňuje každému recenzentovi vidět na první pohled předpovězenou třídu; předpovězený skóre; ground truth labely; a obrázek sám.

UI postavený pro projekt.
V některých případech, další výzkum byl nezbytný pro řešení sporů mezi panelem, a Google Image search byl použit jako pomocný nástroj.
‘[V] jednom zajímavém, ale ne izolovaném případě, předpověď taxi cabu (bez zjevných indikátorů taxi cabu kromě žluté barvy) byla přítomna na obrázku; jsme určili, že předpověď byla správně taxi cab a ne jen standardní vozidlo, identifikací mostu v pozadí, abychom lokalizovali město, a následným image searchem pro taxi v tomto městě, který vyprodukoval obrázky stejného taxi modelu a designu licence, validující předpověď modelu.’
Po počáteční kontrole chyb nalezených během několika fází výzkumu, autoři formulovali čtyři nové typy chyb: jemná chyba, kde předpovězená třída je podobná ground truth labelu; jemná s out-of-vocabulary (OOV), kde model identifikuje objekt, jehož třída je správná, ale není přítomna v ImageNet; spurious korelace, kde předpovězený label je čten mimo kontext obrázku; a non-prototypická, kde ground truth objekt je specifickým příkladem třídy, která se podobá předpovězenému labelu.
V některých případech, ground truth nebyl sám o sobě ‘pravdivý’:
‘Po kontrole původních 676 chyb [nalezených v ImageNet], jsme zjistili, že 298 byly buď správné, nebo nejasné, nebo určily původní ground truth nesprávné nebo problematické.’
Po vyčerpávajícím a komplexním kolečku experimentů napříč řadou datasetů, sub-sad a validačních sad, autoři zjistili, že dva modely, které studovali, byly ve skutečnosti považovány za správné (lidskými recenzenty) pro polovinu ‘chyb’, které udělaly pomocí konvenčních technik.
Dokument uzavírá:
‘V tomto dokumentu, jsme analyzovali každou zbývající chybu, kterou modely ViT-3B a Greedy Soups dělají na ImageNet multi-label validační sadě.
‘Celkově, jsme zjistili, že: 1) když velký, high-accuracy model dělá novou předpověď, která nebyla provedena jinými modely, skončí jako správná nová multi-label téměř polovinu času; 2) modely s vyšší přesností nedemonstrují zjevný vzorec v našich kategoriích a závažnosti chyb; 3) SOTA modely dneška jsou většinou shodné nebo překračují výkon nejlepšího expertního člověka na human-evaluated multi-label subset; 4) šumivé trénovací data a nespecifikované třídy mohou být faktorem, který omezuje efektivní měření zlepšení v image klasifikaci.’
Poprvé publikováno 15. května 2022.












