Andersons vinkel
AI-visionssystem är ofta inte riktigt “tittar” alls

AI-visionssystem kan förklara bilder med stereotyper istället för vad de faktiskt ser. Ta bort etiketten, och deras påstådda visuella förklaringar kollapsar.
Sedan frontier AI-plattformar ständigt blöder pengar i hopp om en AI-händelsehorisont, små ekonomier i deras provning och tjänster motsvarar stora besparingar: till exempel varje gång en LLM kan ge ett svar från sin egen tränade matris istället för att göra en RAG-baserad resa till webben för att få aktuella uppgifter som kommer att behöva destilleras och raffineras, ger den snabbare svar och sparar leverantören pengar.
Det är förstås mer troligt att den hallucinerar, utan att spendera extra token och energi på att kontextualisera och kontrollera sina antaganden.
Likaså, även när en LLM faktiskt når ut till webben, kommer den mycket ofta att citera vaga, olämpliga eller till och med meningslösa och orelaterade URL:er, eftersom den sparade energi genom att bara utvärdera metadata för dessa sidor, istället för att faktiskt läsa dem.
På samma sätt, om du laddar upp en PDF till en LLM och vill diskutera den, kan LLM:en så småningom sudda ut PDF-innehållet från sitt minne och använda endast sparse metadata om det för att svara på dina frågor, utan att ens ange att du bör ladda upp det igen – vilket leder till fel, felantaganden och ännu fler hallucinationer.
Industriella tester
Dessa är pragmatiska, om inte helt ärliga, ekonomier som påtvingas användaren av operativa skäl. I den uppströms världen av datainsamling och modellträning, där miljontals bilder måste bearbetas en masse, och inte kan annoteras för hand av människor, är trycket att minimera energi- och tidsutgifter lika intensivt.
En sådan “genväg” är att använda en mellanliggande Vision Language Model som Contrastive Language Image Pretraining (CLIP), som kartlägger både bilder och text till ett delat semantiskt utrymme, så att visuella koncept kan jämföras med hjälp av språk, snarare än explicita etiketter.
Vad betyder det? Tja, föreställ dig ett barn som lär sig från miljontals bildtexter tills de utvecklar en grov uppfattning om vilka bilder och ord som naturligt hör ihop.
Problemet är att etiketterna ofta skrevs av webbplatsägare och andra självservande enheter som var mer intresserade av bra SEO än bra etikettering, vilket ledde till en hel del “brus” eller felaktig etikettering.
Ändå betyder skalan på vilken ett koncept och ett relaterat ord återkommer i stora dataset vanligtvis att de centrala orden kommer att associeras med den korrekta bilden, eftersom det mindre antalet “nonsens”-etiketter normalt kommer att tvingas in i en outlier-getto, och inte kommer att få association med bilden. Så det fungerar mestadels, de flesta gånger.
Dataetikettering görs på detta sätt eftersom det är billigt och minimalt funktionellt, inte för att det är bra.
Off-Label
In i denna besvärliga scenariot kommer en ny artikel från Carnegie Mellon, som illustrerar tydligt att många etiketter som tilldelats bilder – till exempel av CLIP – enbart är stereotyper baserade på att hänvisa till bildens (textbaserade) etikett, snarare än genom att aktivt titta på bilden själv.
I ett slående exempel från artikeln parar CLIP med beskrivningar genererade från ImageNet-klassnamnet jordgubb, och testas sedan på ImageNet-Sketch, där varje jordgubb är en svartvit teckning – men beskrivningarna insisterar fortfarande på att frukten är ‘röd’ och ‘mogen’:

Klassnamnsbeskrivningar misslyckas på ImageNet-Sketch: språkliga prioriteringar säger ‘röd’ och ‘mogen’, medan bildbaserade attribut matchar den svartvita teckningen. Källa
Här är CLIP parat med beskrivningar genererade enbart från klassnamnet jordgubb, via GPT-3 eller extern kunskap. Dessa ser aldrig bilden, så de förlitar sig på kanoniska egenskaper som röd och bladig. När de appliceras på de monokroma linjeteckningarna i ImageNet-Sketch, misslyckas processen.
I kontrast väljer attribut som hämtats från bilderna själva funktioner som förblir sanna under skiftet, som prickad eller hjärtformad.
Således kan vi se att det identifierade objektet marknadsförs inte för vad det är, utan snarare “på ryktet”; adjektiven “röd” och “bladig” är korrekta för underdomänen jordgubb, men överstiger gränserna för bilden (instansen) i fråga.
Författarna till den nya artikeln – med titeln Attribut bör komma från bilder, inte klassnamn: distributionsvillkorsattributselektering för vision-språkmodeller – hävdar att detta är ett ihållande och utbrett problem, och föreslår att attribut ska väljas direkt från bilderna själva, så att de återspeglar vad som faktiskt är synligt under fördelningsskift, snarare än att förlita sig på klassnamns prioriteringar.
Författarna hävdar:
‘En populär väg till tolkningsbar nollskottsklassificering ber en stor språkmodell (LLM) att beskriva varje klassnamn och promptar CLIP med de resulterande beskrivningarna. Vi visar att dessa beskrivningar bär lite visuell bevis för sin egen del: att ta bort klassnamnet från prompten kollapsar ImageNet-precisionen från 59,5% till 15,5%.
‘Diagnosen är att beskrivningarna är villkorsstyrda av etiketten snarare än av bilderna, så de beskriver konceptet i allmänhet och vilseleder exakt när data skiftar; en LLM insisterar på att jordgubbar är röda, men varje jordgubb i ImageNet-Sketch är en färglös linjeteckning.
‘Vi väljer därför attribut från målbildsamlingen istället: vi poängsätter en stor attributpool mot bilderna i CLIP:s gemensamma inbäddning och behåller endast de attribut som bäst matchar bilderna, utan att kräva någon omträning eller ytterligare bild-texttillsyn.’
Deras föreslagna lösning är att modellen förblir densamma, men istället för att förlita sig på klassnamnsbeskrivningar, kontrollerar den en pool av kandidatattribut mot bilderna, och behåller endast de som faktiskt passar vad som är synligt.
Kostnaden för detta är förmodligen acceptabel, eftersom den inte föreslår att återkalla den sparade energin från de “fusk”-metoder som ledde till problemet från första början. Istället lägger den till en poängsättningspass över kandidatattribut per klass, så att fördröjningen ökar något – men långt mindre än omträning eller full RAG-stilpipeliner. I teorin skulle energikostnaden vara acceptabel, vägd mot förbättringen av anpassning.
Metod
Eftersom metodiken i författarnas tester är särskilt arkana, och eftersom minimal ytterligare användbar insikt skulle vinnas genom att undersöka dem i djupet, kommer vi, ovanligt, endast att överväga en förkortad översikt av deras tillvägagångssätt.
Arbetet karakteriserar det centrala problemet som Klassnamnsförvirring: en situation där prestanda verkar komma från meningsfulla beskrivningar, men i verkligheten beror på klassnamnet själv, med beskrivningarna som lägger till lite – och misslyckas så fort det stödet tas bort
Artikeln hävdar sedan att detta misslyckande är oundvikligt, eftersom beskrivningar som genereras från ett klassnamn endast kan beskriva vad en sak vanligtvis ser ut, snarare än vad som faktiskt är närvarande i en specifik bild. Så fort data avviker från dessa förväntningar, blir beskrivningarna inte bara oanvändbara utan aktivt vilseledande, och röstar i princip mot det korrekta svaret.
Forskarna undersökte också om CLIP kanske enbart var dålig på att upptäcka attribut utan stöd av klassetiketter, eller om GPT-genererade beskrivningar var för generiska för att vara användbara. Men deras efterföljande experiment skulle motbevisa båda förklaringarna.
För att hantera detta problem användes en frusen CLIP-modell för att jämföra bilder mot en stor pool av kandidatbeskrivningar hämtade från VAW, LSA och GPT-3-utdata, och endast behålla de attribut som bäst matchade bilderna, utan att kräva någon omträning eller ytterligare bild-texttillsyn:

En översikt av det föreslagna systemet: en frusen CLIP-modell kodar både bilder och en stor pool av kandidatattributtexter, med hjälp av kosinlikhet för att mäta hur starkt varje beskrivning matchar det visuella innehållet. De högst poängsatta attributen behålls sedan på en per-klassbasis, vilket producerar en tolkningsbar uppsättning prompter medan både bild- och textkodare förblir fasta under hela processen.
Data och tester
Författarnas experiment använde CLIP med en ResNet-50-ryggrad och utvärderade prestanda på ImageNet tillsammans med fyra distributionsförskjutna varianter: ImageNetV2; ImageNet-Sketch; ImageNet-A; och ImageNet-R.
Attribut valdes med hjälp av endast de ursprungliga ImageNet-träningsbilderna – vilket tillät de förskjutna dataseten att fungera som en utanför-distribution-test för att avgöra om bildhämtade attribut förblev användbara när visuella utseenden ändrades:

Top-1-klassificeringsnoggrannhet över ImageNet och fyra distributionsförskjutna benchmark. Resultaten visar att prestanda förblir i stort sett lika när klassnamn ingår i prompter, men kollapsar när beskrivningar tvingas stå på egna ben, vilket tyder på att mycket av deras påstådda effektivitet härrör från klassetiketten själv. I kontrast förblir attribut som valts direkt från bilder avsevärt mer informativa över alla testade dataset.
Att välja attribut från samma GPT-genererade pool, men villkorsstyrda av ImageNet-bilder, ökade klassnamnsfri noggrannhet från 15,5% till 19,4%. Eftersom modellen, attributpoolen och utvärderingsprotokollet förblev oförändrade, kunde vinsten tillskrivas helt till bildbaserad selektion.
Resultatet indikerade också att CLIP kan identifiera attribut utan klassetiketter, och att den GPT-genererade poolen redan innehöll användbara beskrivningar. Det huvudsakliga misslyckandet tycktes ligga i etikettvillkorsgenerering, som ofta misslyckades med att avslöja de attribut som var mest relevanta för bilderna själva.
Även om författarna fortsätter med en rad omfattande ytterligare experiment, måste vi hänvisa läsaren till källmaterialet för ytterligare detaljer om dessa, eftersom de, snarare än att utöka omfånget av resultaten, endast bekräftar de centrala hypoteserna som presenterats hittills – att tillit till etiketter potentiellt kan undergräva potentialen för verkliga bilddata i moderna datorseendeapplikationer, med billig tillit till “ryktessannolikhet” som en fara för resultatomsäkerhet.
Slutsats
Det är intressant att överväga den skuld som modern generativ AI har till de miljontals handbeskrivna bilderna som svaldes i stora dataset som Common Crawl, i början av hyperskaleeran.
Varje gång ett bildigenkänningssystem eller autoetiketteringssystem försöker klassificera eller ometikettera en gammal eller ny bild, härrör ursprunget till den kunskapen tillbaka till någon leverantör som skrev ‘Het 1970-talsmagasin!’ i alt-etiketten på någon eBay-lista 2004, eller något liknande.
Även om många tror att den gyllene eran av nyckelordsfyllning sveptes bort av Googles mer avancerade PageRank-algoritm för nästan tre decennier sedan, förblir väggen av text, låt oss hoppas att något fastnar-tillvägagångssättet fortfarande mycket levande: bara igår, i HTML-koden för utgivningssidan för Qwen-Image-3.0-modellen, fanns en atavistisk explosion (den kan fortfarande finnas där!) av nyckelordsfyllningsvansinne:

HTML-koden för utgivningen av Qwen Image 3 är en inte helt SFW-vägg av nyckelords-text, åtminstone vid tidpunkten för skrivandet. Källa
Antingen om denna lavin av ofta NSFW-nyckelord på Qwen Image 3-sidan är dragen systematiskt från mållistor eller skrivna för hand av SEO-experter, är detta ett exempel på de råa ursprunget till det moderna generativa AI-systemet, med mening som ofta bär en enorm nyttolast av självintresse som senare måste rensas eller åtminstone redovisas på något sätt, när sådana termer stör eller hindrar rationella system och tillämpningar.
Publicerad första gången onsdag, 22 juli 2026












