Unghiul lui Anderson

Sistemele de viziune AI nu sunt întotdeauna “într-adevăr” în curs de “examinare”

mm
Adaugă Unite.AI la sursele tale preferate pe Google
AI-generated image (GPT-2): a supermarket bin contains misshapen green apples beneath a sign showing a red apple and the words 'Red, glossy and round.' The image is surrounded by a yellow-and-black border labelled “AI fantasy inside” and “reality outside,” with inward-pointing arrows.

Sistemele de viziune AI pot explica imagini folosind stereotipuri în loc de ceea ce văd în realitate. Dacă se elimină eticheta, explicațiile lor vizuale presupuse se prăbușesc.

 

Deoarece platformele AI de frontieră pierd constant bani în speranța unui orizont de evenimente AI, economiile mici în provisionarea și serviciile lor înseamnă economii uriașe: de exemplu, de fiecare dată când un LLM poate oferi un răspuns din propria sa matrice antrenată, în loc de a face o călătorie RAG pe web pentru a obține informații actuale care vor trebui distilate și rafinate, răspunde mai repede și economisește furnizorului bani.

Desigur, este mult mai probabil să halucineze, fără a cheltui energie suplimentară pentru contextualizarea și verificarea presupunerilor sale.

La fel, chiar și atunci când un LLM ajunge pe web, va cita adesea URL-uri vagi, inadecvate sau chiar inutile și nelegate de subiect, deoarece a economisit energie prin evaluarea doar a metadatelor pentru acele pagini, în loc de a le citi în realitate.

Similar, dacă încărcați un PDF la un LLM și doriți să discutați despre el, LLM-ul poate să șteargă în cele din urmă conținutul PDF-ului din memoria sa și să folosească doar metadatele rare despre el pentru a răspunde la întrebările dvs., fără a menționa că ar trebui să îl încărcați din nou – ceea ce duce la erori, presupuneri greșite și halucinații suplimentare.

Încercări industriale

Acestea sunt economii practice, chiar dacă nu sunt complet oneste, impuse utilizatorului din motive operaționale. În lumea upstream a colectării de date și a antrenării modelului, unde milioane – chiar sute de milioane – de imagini trebuie procesate en masse și nu pot fi notate manual de oameni, presiunea de a minimiza cheltuielile de energie și timp este la fel de intensă.

Una dintre aceste “scurtături” este de a utiliza un model de limbaj vizual intermediar, cum ar fi Contrastive Language Image Pretraining (CLIP), care hărțuiește atât imagini, cât și texte într-un spațiu semantic comun, astfel încât conceptele vizuale pot fi comparate folosind limbajul, în loc de etichete explicite.

Ce înseamnă asta? Ei bine, imaginați-vă un copil care învață de la milioane de imagini cu subtitrări până când dezvoltă un sentiment aproximativ despre care imagini și cuvinte merg împreună în mod natural.

Problema este că adesea subtitrările au fost scrise de proprietarii de site-uri și alte entități care erau mai interesate de un bun SEO decât de o etichetare bună, ceea ce a dus la o cantitate mare de “zgomot” sau etichetare inexactă.

Încă, la scară largă, un concept și un cuvânt asociat recurente în seturi de date uriașe înseamnă de obicei că cuvintele cheie se vor asocia cu imaginea corectă, deoarece numărul mai mic de “nonsens” etichete va fi de obicei forțat într-un ghetou de outlier, și nu va obține de obicei asociere cu imaginea. Așa că, în general, funcționează.

Annotarea datelor se face în acest fel pentru că este ieftină și funcțională minimal, nu pentru că este bună.

Off-Label

În această situație problemată vine o nouă lucrare de la Carnegie Mellon, care ilustrează în mod clar că multe subtitrări atribuite imaginilor – de exemplu, de CLIP – sunt pur și simplu stereotipuri bazate pe referirea la eticheta (bazată pe text) a imaginii, în loc de a o examina activ pe imaginea însăși.

Într-un exemplu izbitor din lucrare, CLIP este asociat cu descriptori generați din numele clasei ImageNet strawberry, apoi testat pe ImageNet-Sketch, unde toate fragilele sunt desene în alb și negru – și totuși descriptorii insistă că fructul este ‘roșu’ și ‘copt’:

Descriptorii de nume de clasă eşuează pe ImageNet-Sketch: priorii lingvistici spun roşu şi copt, în timp ce atributele bazate pe imagine se potrivesc cu desenul în alb şi negru. Sursă - https://arxiv.org/pdf/2607.18695

Descriptorii de nume de clasă eşuează pe ImageNet-Sketch: priorii lingvistici spun ‘roşu’ şi ‘copt’, în timp ce atributele bazate pe imagine se potrivesc cu desenul în alb şi negru. Sursă

Aici, CLIP este asociat cu descriptori generați doar din numele clasei strawberry, prin GPT-3 sau cunoașterea externă. Aceștia nu văd imaginea, așa că se bazează pe trăsături canonice precum roșu și cu frunze. Când se aplică ilustrațiilor monocrome și liniare din ImageNet-Sketch, procesul eşuează.

În schimb, atributele derivate din imaginile însele selectează caracteristici care rămân adevărate sub schimbare, cum ar fi punctate sau în formă de inimă.

Așa putem vedea că obiectul identificat este promovat nu pentru ceea ce este, ci, ca să spunem așa, “prin reputație”; adjectivele “roșu” și “cu frunze” sunt precise pentru subdomeniul strawberry, dar depășesc limitele imaginii (instanței) în cauză.

Autorii lucrării noi – intitulată Atributele ar trebui să vină din imagini, nu din numele de clasă: selecția atributelor condiționate de distribuție pentru modelele de limbaj vizual – susțin că aceasta este o problemă persistentă și răspândită și sugerează selectarea directă a atributelor din imaginile însele, astfel încât acestea să reflecte ceea ce este într-adevăr vizibil sub schimbarea distribuției, în loc de a se baza pe priorii numelor de clasă.

Autorii afirmă:

‘O cale populară către clasificarea zero-shot interpretabilă cere unui model de limbaj mare (LLM) să descrie fiecare nume de clasă și să promoveze CLIP cu descriptorii rezultați. Arătăm că acești descriptori poartă puține dovezi vizuale ale lor: înlăturarea numelui de clasă din promptul de clasificare ImageNet de la 59,5% la 15,5%.

‘Diagnosticul este că descriptorii sunt condiționați de etichetă, mai degrabă decât de imagini, așa că descriu conceptul în general și înșală exact atunci când datele se schimbă; un LLM insistă că fragilele sunt roșii, dar toate fragilele din ImageNet-Sketch sunt desene în alb și negru.

‘Prin urmare, selectăm atribute din colecția țintă de imagini, în loc de a ne baza pe descriptori generați de numele de clasă. Scorăm un mare pool de atribute împotriva imaginilor din spațiul comun al lui CLIP și păstrăm doar atributele cu cel mai bun scor pe clasă.’

Remedierea lor propusă este că modelul rămâne același, dar în loc de a se baza pe descrieri de nume de clasă, verifică un pool de atribute candidate împotriva imaginilor și păstrează doar acele atribute care se potrivesc într-adevăr cu ceea ce este vizibil.

Costul acestuia este, în mod evident, acceptabil, deoarece nu sugerează rechemarea energiei “înșelătoare” care a condus la problema inițială. Mai degrabă, adaugă o trecere de scorare peste atributele candidate pe clasă, astfel încât latența crește ușor – dar mult mai puțin decât reantrenarea sau pipeline-urile RAG complete. În teorie, costul energetic ar fi acceptabil, cântărit împotriva îmbunătățirii alinierii.

Metodă

Deoarece metodologia testelor autorilor este deosebit de arcană, și deoarece nu s-ar obține insighturi utile suplimentare prin examinarea lor în profunzime, vom considera, în mod neobișnuit, doar o vedere de ansamblu a abordării lor.

Lucrarea caracterizează problema de bază ca încurcătură a numelui de clasă: o situație în care performanța pare să provină din descriptori semnificativi, dar în realitate depinde de numele de clasă însuși, cu descriptorii adăugând puțin – și eșuând de îndată ce acest sprijin este înlăturat

Lucrarea susține apoi că acest eșec este inevitabil, deoarece descriptorii generați dintr-un nume de clasă pot descrie doar ceea ce arată de obicei un lucru, și nu ceea ce este prezent într-o imagine particulară. De îndată ce datele se abat de la aceste așteptări, descriptorii devin nu numai inutile, ci și activ înșelătoare, votând efectiv împotriva răspunsului corect.

Cercetătorii au examinat, de asemenea, dacă CLIP ar putea să nu fie bun la detectarea atributelor fără ajutorul etichetelor de clasă, sau dacă descriptorii generați de GPT ar fi prea generici pentru a fi utili. Cu toate acestea, experimentele lor ulterioare au refuzat ambele explicații.

Pentru a aborda această problemă, s-a folosit un model CLIP înghețat pentru a compara imagini cu un mare pool de descriptori candidați, extrase din VAW, LSA și ieșiri GPT-3, păstrând doar acele atribute care se potrivesc cel mai bine cu imaginile, fără a necesita reantrenarea sau supravegherea suplimentară a imaginilor-text:

O vedere de ansamblu a sistemului propus: un model CLIP înghețat codifică atât imagini, cât și un mare pool de texte de atribute candidate, utilizând similaritatea cosinus pentru a măsura cât de puternic se potrivește fiecare descriptor conținutului vizual. Atributele cu cel mai bun scor sunt apoi păstrate pe baza clasei, producând un set interpretabil de prompturi, în timp ce păstrează atât encoderul de imagine, cât și cel de text, fixate pe tot parcursul procesului.

O vedere de ansamblu a sistemului propus: un model CLIP înghețat codifică atât imagini, cât și un mare pool de texte de atribute candidate, utilizând similaritatea cosinus pentru a măsura cât de puternic se potrivește fiecare descriptor conținutului vizual. Atributele cu cel mai bun scor sunt apoi păstrate pe baza clasei, producând un set interpretabil de prompturi, în timp ce păstrează atât encoderul de imagine, cât și cel de text, fixate pe tot parcursul procesului.

Date și teste

Experimentele autorilor au utilizat CLIP cu o spate ResNet-50 și au evaluat performanța pe ImageNet împreună cu patru variante cu schimbare de distribuție: ImageNetV2; ImageNet-Sketch; ImageNet-A; și ImageNet-R.

Atributele au fost selectate utilizând doar imaginile de antrenare ImageNet originale – permițând seturile de date schimbate să servească ca un test din afara distribuției pentru a determina dacă atributele derivate din imagini rămân utile atunci când aspectele vizuale se schimbă:

Precizia de clasificare Top-1 pe ImageNet și patru benchmark-uri cu schimbare de distribuție. Rezultatele arată că performanța rămâne în general similară atunci când numele de clasă sunt incluse în prompturi, dar se prăbușește atunci când descriptorii sunt forțați să stea singuri, sugerând că multă din eficacitatea lor aparentă provine din eticheta de clasă însăși. În schimb, atributele selectate direct din imagini rămân substanțial mai informative în toate seturile de date testate.

Precizia de clasificare Top-1 pe ImageNet și patru benchmark-uri cu schimbare de distribuție. Rezultatele arată că performanța rămâne în general similară atunci când numele de clasă sunt incluse în prompturi, dar se prăbușește atunci când descriptorii sunt forțați să stea singuri, sugerând că multă din eficacitatea lor aparentă provine din eticheta de clasă însăși. În schimb, atributele selectate direct din imagini rămân substanțial mai informative în toate seturile de date testate.

Re-selecționarea atributelor din același pool generat de GPT, dar condiționarea lor pe imaginile ImageNet, a ridicat precizia de clasificare fără nume de clasă de la 15,5% la 19,4%. Deoarece modelul, pool-ul de atribute și protocolul de evaluare au rămas neschimbate, câștigul a putut fi atribuit în întregime selecției condiționate de imagine.

Rezultatul a indicat, de asemenea, că CLIP poate identifica atribute fără etichete de clasă și că pool-ul generat de GPT conține deja descriptori utili. Eșecul principal a părut să se datoreze generării condiționate de etichetă, care a eșuat adesea în a dezvălui atributele cele mai relevante pentru imaginile însele.

Deși autorii continuă cu o serie extinsă de experimente suplimentare, trebuie să trimitem cititorul la materialul sursă pentru mai multe detalii despre acestea, deoarece, în loc de a extinde sfera rezultatelor, ele confirmă doar ipotezele centrale prezentate până acum – că dependența de etichete poate submina potențialul datelor vizuale reale în aplicațiile moderne de vedere computerizată, cu o dependență ieftină de “probabilitatea reputației” ca un pericol pentru acuratețea rezultatelor.

Concluzie

Este interesant de considerat datoria pe care o au sistemele moderne de inteligență artificială generativă față de milioanele de imagini descrise manual care au fost incluse în seturi de date uriașe, cum ar fi Common Crawl, la începutul erei hiperscale.

De fiecare dată când un sistem de recunoaștere a imaginilor sau de etichetare automată încearcă să clasifice sau să re-eticheteze o imagine veche sau nouă, proveniența acestei cunoașteri se datorează unui vânzător care a scris ‘Revistă fierbinte din anii 1970!’ în eticheta alt a unei liste eBay în 2004, sau un eveniment similar.

Deși mulți cred că epoca de aur a umplerii cu cuvinte cheie a fost spălată de algoritmul PageRank mai sofisticat al Google, cu aproape trei decenii în urmă, abordarea zid de text, să sperăm că ceva se lipește rămâne foarte vie: doar ieri, în partea de sus a codului HTML al paginii de lansare a modelului Qwen-Image-3.0, era o explozie de cuvinte cheie (poate fi încă acolo!):

Codul HTML pentru lansarea Qwen Image 3 este un zid de cuvinte cheie, cel puțin la momentul scrierii. Sursă - https://qwen.ai/blog?id=qwen-image-3.0

Codul HTML pentru lansarea Qwen Image 3 este un zid de cuvinte cheie, cel puțin la momentul scrierii. Sursă

Indiferent dacă această avalanșă de cuvinte cheie, adesea neadecvate, din pagina Qwen Image 3 este extrasă sistematic din liste țintă sau scrisă de specialiști SEO, aceasta este un exemplu primar al originilor brute ale sistemului modern de inteligență artificială generativă, cu sensul adesea transportând o încărcătură uriașă de interes propriu care va trebui să fie eliminată sau cel puțin luată în considerare într-un fel, atunci când astfel de termeni interferează cu sau împiedică sisteme și aplicații raționale.

 

Publicat pentru prima dată miercuri, 22 iulie 2026

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai