Andersonův úhel
Systémy umělých vizí často vlastně „nepohledávají“ vůbec

Systémy umělých vizí mohou vysvětlovat obrázky pomocí stereotypů místo toho, aby skutečně viděly, co je na nich. Pokud odstraníte štítek, jejich údajné vizuální vysvětlení se zhroutí.
Protože přední platformy AI neustále prodělávají peníze v naději na horizont událostí AI, malé úspory v jejich zajištění a službách znamenají obrovské úspory: například každé použití LLM, které může poskytnout odpověď ze své vlastní trénovací matice místo toho, aby provedlo RAG-založenou cestu na web, aby získalo aktuální informace, které budou potřebovat destilace a rafinace, odpovídá rychleji a šetří poskytovateli peníze.
Samozřejmě je pravděpodobnější, že hallucinuje, bez dalších tokenů a energie na kontextualizaci a kontrolu svých předpokladů.
Podobně, i když LLM skutečně dosáhne webu, velmi často cituje vágní, nevhodné nebo dokonce bezvýznamné a nesouvisející URL, protože šetří energii tím, že vyhodnotí pouze metadata pro tyto stránky, místo aby je skutečně četl.
Stejně tak, pokud nahrajete PDF do LLM a chcete o něm diskutovat, LLM může nakonec vymazat obsah PDF z paměti a použít pouze řídká metadata o něm, aby odpověděl na vaše dotazy, aniž by uvedl, že byste měli nahrát jej znovu – což vede k chybám, nesprávným předpokladům a dalšímu hallucinování.
Průmyslové testy
Tyto jsou pragmatické, i když ne zcela poctivé úspory, které jsou uživatelům vnuceny z provozních důvodů. V horním světě sběru dat a trénování modelů, kde musí být zpracovány miliony – dokonce stovky milionů – obrázků en masse a nemohou být ručně anotovány lidmi, je tlak na minimalizaci výdajů energie a času stejně intenzivní.
Jedním z takových „zkratků“ je použití mezilehlého modelu Vision Language, jako je Contrastive Language Image Pretraining (CLIP), který mapuje jak obrázky, tak text do sdíleného sémantického prostoru, takže vizuální koncepty lze porovnávat pomocí jazyka, spíše než explicitních štítků.
Co to znamená? No, představte si dítě, které se učí z milionů popsaných obrázků, dokud nevyvine hrubou představu o tom, které obrázky a slova přirozeně patří spolu.
Problém je, že velmi často byly popisky psány vlastníky webů a jinými sebezainteresovanými subjekty, které byly více zainteresovány v dobrém SEO než v dobrém označování, což vedlo k velké části „šumu“ nebo nesprávného označování.
Přesto obvykle znamená, že jádro slov se spojí s příslušným obrázkem, protože menší počet „nesmyslných“ štítků bude obvykle nucen do outlier ghetta a nebude obvykle spojeno s obrázkem. Takže to více méně funguje, většinu času.
Označování dat se provádí tímto způsobem, protože je to levné a minimálně funkční, ne proto, že je dobré.
Mimo značku
Do tohoto problematického scénáře přichází nová práce z Carnegie Mellon, která jasně ilustruje, že mnoho popisků přiřazených k obrázkům – například CLIP – jsou jednoduše stereotypy založené na odkazu na textový štítek obrázku, spíše než aktivním pohledem na obrázek samotný.
V jednom pozoruhodném příkladu z práce je CLIP spárován s deskriptory generovanými z názvu třídy ImageNet strawberry, poté testován na ImageNet-Sketch, kde je každá jahoda černobílou kresbou – ale deskriptory stále trvají na tom, že ovoce je ‘červené’ a ‘zralé’:

Popisky názvů tříd selhávají na ImageNet-Sketch: jazykové priority říkají ‘červené’ a ‘zralé’, zatímco atributy založené na obrázcích odpovídají černobílé kresbě. Zdroj
Zde CLIP spárován s deskriptory generovanými pouze z názvu třídy strawberry, prostřednictvím GPT-3 nebo vnější znalosti. Tyto nikdy nevidí obrázek, takže se defaultují na kanonické rysy, jako je červené a listnaté. Když se aplikují na monochromatické linkové ilustrace v ImageNet-Sketch, proces selhává.
Naproti tomu atributy odvozené z obrázků samotných vybírají rysy, které zůstávají pravdivé pod posunem, jako tečkované nebo srdcovité.
Tak můžeme vidět, že identifikovaný objekt je inzerován ne pro to, co je, ale, jako by to bylo „pověstí“; přídavná jména „červené“ a „listnaté“ jsou přesná pro subdoménu strawberry, ale přesahují hranice obrázku (instance) v otázce.
Autoři nové práce – nazvané Atributy by měly pocházet z obrázků, ne z názvů tříd: distribučně podmíněný výběr atributů pro modely Vision-Language – argumentují, že toto je trvalý a široce rozšířený problém, a navrhují výběr atributů přímo z obrázků samotných, aby odrážely, co je skutečně viditelné pod distribučním posunem, spíše než spoléhání se na priors názvů tříd.
Autoři uvádějí:
‘Populární cesta k interpretovatelné nulové klasifikaci žádá velký jazykový model (LLM), aby popsal každou třídu a poté CLIP s výslednými deskriptory. Ukazujeme, že tyto deskriptory nesou málo vizuálních důkazů: odstranění názvu třídy z podnětu zhroutí přesnost ImageNet z 59,5% na 15,5%.’
‘Diagnóza je, že deskriptory jsou podmíněny štítkem spíše než obrázky, takže popisují koncept obecně a klamou přesně tehdy, když se data posunou; LLM trvá na tom, že jahody jsou červené, ale každá jahoda v ImageNet-Sketch je černobílá linková kresba.’
‘Proto vybíráme atributy z cílové sbírky obrázků místo toho: ohodnocujeme velký pool atributů proti obrázkům v gemeinsamém prostoru CLIP a uchováváme pouze ty atributy, které nejlépe odpovídají vizuálním obsahům.’
Jimi navrhovaná náprava spočívá v tom, že model zůstává stejný, ale místo spoléhání se na popisky názvů tříd kontroluje pool kandidátních atributů proti obrázkům a uchovává pouze ty atributy, které skutečně odpovídají tomu, co je viditelné.
Náklad této nápravy je zřejmě přijatelný, protože nenavrhuje opětovné vyvolání uložené energie „podvodných“ metod, které vedly k problému v první řadě. Místo toho přidává skórovací průchod nad kandidátními atributy na třídu, takže latence mírně vzroste – ale mnohem méně než retraining nebo plné RAG-stylové potrubí. Teoreticky by náklady na energii měly být přijatelné, váženými proti zlepšení v souladu.
Metoda
Protože metodologie autorů testů je besonders arkan, a protože minimální další užitečné poznatky by byly získány zkoumáním jich v hloubce, budeme, netypicky, pouze zvažovat zkrácený přehled jejich přístupu.
Práce charakterizuje základní problém jako Class-Name Confound: situaci, kdy se zdá, že výkon pochází z významných deskriptorů, ale ve skutečnosti závisí na názvu třídy samotné, s deskriptory přidávajícími málo – a selhávajícími, jakmile je tato podpora odstraněna
Práce poté argumentuje, že toto selhání je nevyhnutelné, protože deskriptory generované z názvu třídy mohou popisovat pouze to, jak věc obvykle vypadá, spíše než to, co je skutečně přítomno v konkrétním obrázku. Jakmile se data odchylují od těchto očekávání, stávají se deskriptory nejenom neužitečnými, ale aktivně klamnými, efektivními hlasováním proti správné odpovědi.
Vyšetřovatelé také zvažovali, zda CLIP možná není schopen detekovat atributy bez pomoci třídových štítků, nebo zda GPT-generované deskriptory jsou příliš obecné, aby byly užitečné. Nicméně, jejich následné experimenty by vyvrátily obě vysvětlení.
Pro řešení tohoto problému byl použit zamrzlý model CLIP pro srovnání obrázků proti velkému poolu kandidátních deskriptorů vytažených z VAW, LSA a GPT-3 výstupů, uchovávající pouze ty atributy, které nejlépe odpovídaly obrázkům, bez vyžadování žádného retrainingu nebo další image-text supervize:

Přehled navrhovaného systému: zamrzlý model CLIP kóduje jak obrázky, tak velký pool kandidátních atributových textů, pomocí kosinové podobnosti pro měření, jak silně každý deskriptor odpovídá vizuálním obsahům. Nejvyšší skórovací atributy jsou poté uchovávány na základě třídy, produkující interpretovatelnou sadu podnětů, zatímco udržují jak image, tak textové kódéry pevné po celou dobu procesu.
Data a testy
Experimenty autorů používaly CLIP s ResNet-50 základem a hodnotily výkon na ImageNet spolu s čtyřmi distribučně posunutými variantami: ImageNetV2; ImageNet-Sketch; ImageNet-A; a ImageNet-R.
Atributy byly vybrány pomocí pouze původních ImageNet trénovacích obrázků – umožňující posunuté datové sady sloužit jako mimo-distribuční test, zda image-odvozené atributy zůstávají užitečné, když vizuální vzhledy se změní:

Top-1 klasifikační přesnost napříč ImageNet a čtyřmi distribučně posunutými benchmarky. Výsledky ukazují, že výkon zůstává široce podobný, když jsou názvy tříd zahrnuty do podnětů, ale zhroutí, když jsou deskriptory nuceni stát na vlastních nohách, naznačující, že většina jejich zdánlivého efektu pochází z názvu třídy samotné. Naopak atributy vybrané přímo z obrázků zůstávají podstatně více informativní napříč všemi testovanými datovými sadami.
Při opětovném výběru atributů ze stejného GPT-generovaného poolu, ale podmíněných na ImageNet obrázcích, se zvýšila přesnost bez názvů tříd z 15,5% na 19,4%. Protože model, atributový pool a hodnocení protokol zůstaly nezměněny, zisk mohl být připsán zcela na image-kondicionovaný výběr.
Výsledek také ukázal, že CLIP může identifikovat atributy bez třídových štítků, a že GPT-generovaný pool již obsahuje užitečné deskriptory. Hlavní selhání se místo toho zdálo ležet v label-kondicionovaném generování, které často selhalo v odhalení atributů, které jsou nejrelevantnější pro obrázky samotné.
Ačkoli autoři pokračují v další sérii rozsáhlých dalších experimentů, musíme odkázat čtenáře na původní materiál pro další podrobnosti o těchto, protože, místo rozšíření rozsahu výsledků, pouze potvrzují centrální hypotézy, které byly dosud nastíněny – že závislost na štítcích může potenciálně podkopat potenciál skutečných obrazových dat v moderních aplikacích počítačového vidění, s levnou závislostí na „reputačním“ pravděpodobnosti jako nebezpečím pro přesnost výsledků.
Závěr
Je zajímavé uvážit dluh, který moderní generativní AI dluží milionům ručně popsaných obrázků, které byly pozřeny do obrovských trawlých datových sad, jako je Common Crawl, na začátku hyperscale éry.
Každé použití image-rozpoznávacího nebo auto-označovacího systému, které se pokusí klasifikovat nebo re-označit starý nebo nový obrázek, původ tohoto vědomí sahá zpět k něčemu, jako je „horký časopis z 70. let!“, v alt štítku some eBay položky v roce 2004, nebo podobné události.
Ačkoli mnoho lidí věří, že zlatý věk klíčového slova byl smeten Googleovým více sofistikovaným algoritmem PageRank téměř před třemi desetiletími, „zeď textu, doufáme, že něco ulpí“ přístup zůstává velmi živý: včera, vedoucí HTML vydání modelu Qwen-Image-3.0, byl atavistický výbuch (může stále být tam!) z klíčového slova šílenství:

HTML kód pro vydání Qwen Image 3 je stěnou klíčového textu, alespoň v době psaní. Zdroj
Bez ohledu na to, zda je tato lavina často NSFW klíčových slov v Qwen Image 3 stránce systematicky tažena z cílových seznamů, nebo ručně psána SEO specialisty, je to příklad syrových původů moderního generativního systému AI, s významem, který často nese obrovskou zátěž sebezájmu, která bude později muset být odstraněna nebo alespoň zohledněna, když takové termíny interferují s nebo brání racionálním systémům a aplikacím.
Poprvé publikováno ve středu, 22. července 2026












