Unghiul lui Anderson

Lupta IA de a citi ceasurile analogice poate avea o semnificație mai profundă

mm
Adaugă Unite.AI la sursele tale preferate pe Google
ChatGPT-4o and Adobe Firefly.

O nouă lucrare de cercetare a unor oameni de știință din China și Spania a constatat că, chiar și modelele avansate de inteligență artificială multimodală, cum ar fi GPT-4.1, au dificultăți în a citi ora de pe imagini cu ceasuri analogice. Schimbări vizuale mici în ceasuri pot provoca erori majore de interpretare, iar fine-tuningul ajută doar la exemple familiare. Rezultatele ridică îngrijorări cu privire la fiabilitatea acestor modele atunci când se confruntă cu imagini nefamiliare în sarcini din lumea reală.

 

Când oamenii dezvoltă o înțelegere suficient de profundă a unui domeniu, cum ar fi gravitația sau alte principii fizice de bază, trecem dincolo de exemplele specifice și înțelegem abstracțiile subiacente. Acest lucru ne permite să aplicăm cunoștințele creativ în diferite contexte și să recunoaștem noi instanțe, chiar și cele pe care nu le-am văzut niciodată, identificând principiul în acțiune.

Când un domeniu are suficientă importanță, putem începe să îl percepem chiar și acolo unde nu există, așa cum se întâmplă cu pareidolia, determinată de costul ridicat al neînțelegerii unei instanțe reale. Acest mecanism de recunoaștere a pattern-urilor este atât de puternic încât ne face să găsim un spectru mai larg de pattern-uri chiar și acolo unde nu există.

Învățarea unui domeniu încă de la o vârstă fragedă și repetitivă îi conferă o temelie mai profundă și o persistență pe tot parcursul vieții; iar unul dintre primele seturi de date vizuale la care suntem expuși ca copii vine sub forma ceasurilor didactice, unde materialul tipărit sau ceasurile analogice interactive sunt folosite pentru a ne învăța cum să citim ora:

Mijloace de învățământ pentru a ajuta copiii să învețe să citească ora. Sursă: https://www.youtube.com/watch?v=IBBQXBhSNUs

Mijloace de învățământ pentru a ajuta copiii să învețe să citească ora. Sursă: https://www.youtube.com/watch?v=IBBQXBhSNUs

Deși moda în designul ceasurilor poate uneori să ne provoace dificultăți, reziliența acestei măiestrii a domeniului învățat de la o vârstă fragedă este destul de impresionantă, permițându-ne să recunoaștem fețele ceasurilor analogice chiar și în fața unor alegeri de design complexe sau “excentrice”:

Câteva fețe de ceas dificile în moda ceasurilor.

Câteva fețe de ceas dificile în moda ceasurilor.

Oamenii nu au nevoie de mii de exemple pentru a învăța cum funcționează ceasurile; odată ce conceptul de bază este înțeles, putem recunoaște ceasurile în aproape orice formă, chiar și atunci când sunt distorsionate sau abstracte.

Dificultatea pe care o întâmpină modelele de IA în această sarcină, pe de altă parte, evidențiază o problemă mai profundă: puterea lor aparentă poate depinde mai mult de expunerea la volume mari de date decât de înțelegerea adevărată.

Dincolo de jocul de imitație?

Tensiunea dintre performanța la nivel de suprafață și înțelegerea adevărată a apărut repetat în investigațiile recente asupra modelelor mari. Luna trecută, Universitatea Zhejiang și Universitatea Westlake au reînnoit întrebarea într-o lucrare intitulată Oare modelele LLM de nivel PhD într-adevăr înțeleg adunarea elementară? (nu este subiectul acestui articol), concluzionând:

‘În ciuda benchmark-urilor impresionante, modelele arată o dependență critică de recunoașterea pattern-urilor, mai degrabă decât o înțelegere adevărată, demonstrată de eșecurile cu reprezentări simbolice și încălcări ale proprietăților de bază.

‘Furnizarea regulilor explicite care afectează performanța sugerează constrângeri arhitecturale inerente. Aceste insight-uri dezvăluie lacunele de evaluare și subliniază nevoia de arhitecturi capabile de raționament matematic adevărat, dincolo de recunoașterea pattern-urilor.’

Această săptămână, întrebarea reapare, de data aceasta într-o colaborare între Universitatea de Aeronautică și Astronautică din Nanjing și Universitatea Politehnică din Madrid, Spania. Intitulată Au modelele de limbaj multimodal (MLLM) învățat cu adevărat să citească ora pe ceasurile analogice?, lucrarea nouă explorează cât de bine modelele multimodale înțeleg citirea orei.

Deși progresul cercetării este acoperit doar în detalii generale în lucrare, testele inițiale ale cercetătorilor au stabilit că modelul de limbaj multimodal GPT-4.1 al OpenAI a avut dificultăți în a citi corect ora de pe o serie diversă de imagini cu ceasuri, oferind adesea răspunsuri incorecte, chiar și în cazuri simple.

Acest lucru indică o posibilă lacună în setul de date de antrenare al modelului, ridicând nevoia unui set de date mai echilibrat pentru a testa dacă modelul poate învăța cu adevărat conceptul subiacent. Prin urmare, autorii au creat un set de date sintetice de ceasuri analogice, care acoperă în mod uniform fiecare oră posibilă și evită bias-urile obișnuite găsite în imaginile de pe internet:

Un exemplu din setul de date sintetice de ceasuri analogice al cercetătorilor, folosit pentru a ajusta un model GPT în lucrarea nouă. Sursă: https://huggingface.co/datasets/migonsa/analog_watches_finetune

Un exemplu din setul de date sintetice de ceasuri analogice al cercetătorilor, folosit pentru a ajusta un model GPT în lucrarea nouă. Sursă: https://huggingface.co/datasets/migonsa/analog_watches_finetune

Înainte de a ajusta modelul pe noul set de date, GPT-4.1 a eșuat constant în a citi aceste ceasuri. După ce a fost expus la noua colecție, performanța sa s-a îmbunătățit – dar doar atunci când noile imagini semănau cu cele pe care le văzuse deja.

Când forma ceasului sau stilul acelor s-a schimbat, acuratețea a scăzut brusc; chiar și mici ajustări, cum ar fi acuri mai subțiri sau săgeți ( imaginea din dreapta de mai jos), au fost suficiente pentru a-l deruta; iar GPT-4.1 a avut dificultăți suplimentare în a interpreta ceasurile “topite” în stil Dali:

Imagini cu ceasuri cu design standard (stânga), formă distorsionată (mijloc) și acuri modificate (dreapta), alături de orele returnate de GPT-4.1 înainte și după ajustare. Sursă: https://arxiv.org/pdf/2505.10862

Imagini cu ceasuri cu design standard (stânga), formă distorsionată (mijloc) și acuri modificate (dreapta), alături de orele returnate de GPT-4.1 înainte și după ajustare. Sursă: https://arxiv.org/pdf/2505.10862

Autorii deduc că modelele actuale, cum ar fi GPT-4.1, pot învăța citirea ceasurilor în principal prin recunoașterea pattern-urilor vizuale, mai degrabă decât prin înțelegerea unui concept mai profund al timpului, afirmând:

‘[GPT 4.1] eșuează atunci când ceasul este deformat sau atunci când acurile sunt schimbate pentru a fi mai subțiri și a avea o săgeată. Eroarea medie absolută (MAE) în estimarea orei pe 150 de timpuri aleatorii a fost de 232,48s pentru ceasurile inițiale, 1380,69s atunci când forma este deformată și 3726,93s atunci când acurile sunt schimbate.

‘Aceste rezultate sugerează că MLLM nu a învățat să citească ora, ci mai degrabă a memorizat pattern-uri.’

Timp suficient

Majoritatea seturilor de date de antrenare se bazează pe imagini web extrase, care tind să repete anumite ore – în special 10:10, o setare populară în reclamele cu ceasuri:

Un exemplu din lucrarea nouă, care arată prevalența orei 10:10 în imagini cu ceasuri analogice.

Un exemplu din lucrarea nouă, care arată prevalența orei 10:10 în imagini cu ceasuri analogice.

Ca urmare a acestei game limitate de ore reprezentate, modelul poate vedea doar o gamă îngustă de configurații posibile ale ceasurilor, limitându-i capacitatea de a generaliza dincolo de aceste pattern-uri repetitive.

Referitor la motivul pentru care modelele eșuează în a interpreta corect ceasurile distorsionate, lucrarea afirmă:

‘Deși GPT-4.1 performează excepțional de bine cu imagini standard de ceasuri, este surprinzător că modificarea acelor prin subțiere și adăugarea de săgeți conduce la o scădere semnificativă a acurateței sale.

‘Intuitiv, s-ar putea crede că schimbarea vizuală mai complexă – un cadran deformat – ar avea un impact mai mare asupra performanței, dar această modificare pare să aibă un efect relativ mai mic.’

‘Acest lucru ridică o întrebare: cum interpretează MLLM-urile ceasurile și de ce eșuează? O posibilitate este că acurile mai subțiri împiedică capacitatea modelului de a percepe direcția, slăbindu-i înțelegerea orientării spațiale.

‘Alternativ, pot exista alte factori care provoacă confuzie atunci când modelul încearcă să combine acurile de oră, minute și secunde într-o citire corectă a orei.’

Autorii susțin că identificarea cauzei de bază a acestor eșecuri este cheia pentru a face progrese în modelele multimodale: dacă problema se datorează modului în care modelul percepe direcția spațială, ajustarea poate oferi o soluție simplă; dar dacă problema provine dintr-o dificultate mai largă de integrare a mai multor indicii vizuale, aceasta indică o slăbiciune fundamentală în modul în care aceste sisteme procesează informația.

Teste de ajustare

Pentru a testa dacă eșecurile modelului pot fi depășite prin expunere, GPT-4.1 a fost ajustat pe setul de date sintetic menționat anterior. Înainte de ajustare, predicțiile sale erau răspândite pe scară largă, cu erori semnificative în toate tipurile de ceasuri. După ajustarea pe colecția respectivă, acuratețea s-a îmbunătățit semnificativ pe fețele standard de ceasuri și, într-o măsură mai mică, pe cele distorsionate.

Cu toate acestea, ceasurile cu acuri modificate, cum ar fi forme mai subțiri sau săgeți, au continuat să producă erori mari.

Au apărut două moduri distincte de eșec: pe ceasurile normale și distorsionate, modelul a înțeles în mod obișnuit greșit direcția acelor; dar pe ceasurile cu stiluri de acuri modificate, a confundat adesea funcția fiecărui ac, luând acul de oră pentru acul de minute sau invers.

O comparație care ilustrează slăbiciunea inițială a modelului și câștigurile parțiale obținute prin ajustare, arătând timpul prezis versus timpul real, în secunde, pentru 150 de ceasuri selectate aleatoriu. În stânga, înainte de ajustare, predicțiile GPT-4.1 sunt răspândite și adesea departe de valorile corecte, indicate de linia diagonală roșie. În dreapta, după ajustarea pe un set de date sintetice echilibrat, predicțiile se aliniază mult mai strâns cu adevărul de pe teren, deși unele erori rămân.

O comparație care ilustrează slăbiciunea inițială a modelului și câștigurile parțiale obținute prin ajustare, arătând timpul prezis versus timpul real, în secunde, pentru 150 de ceasuri selectate aleatoriu.

Acest lucru sugerează că modelul a învățat să asocieze caracteristici vizuale, cum ar fi grosimea acului, cu roluri specifice și a avut dificultăți atunci când aceste indicii s-au schimbat.

Îmbunătățirea limitată pe designuri nefamiliare ridică îndoieli suplimentare cu privire la faptul că un model de acest tip învață conceptul abstract de citire a orei sau se limitează la îmbunătățirea recunoașterii pattern-urilor.

Semne de mână

Deci, deși ajustarea a îmbunătățit performanța GPT-4.1 pe ceasurile analogice standard, a avut un impact mult mai mic asupra ceasurilor cu acuri mai subțiri sau cu săgeți, ridicând posibilitatea ca eșecurile modelului să provină mai puțin din raționament abstract și mai mult din confuzie cu privire la care ac este care.

Pentru a testa dacă acuratețea s-ar putea îmbunătăți dacă confuzia ar fi eliminată, a fost efectuată o nouă analiză asupra predicțiilor modelului pentru setul de date “acuri modificate”. Rezultatele au fost împărțite în două grupuri: cazuri în care GPT-4.1 a recunoscut corect acul de oră, acul de minute și acul de secunde; și cazuri în care nu a făcut-o.

Predicțiile au fost evaluate pentru Eroare Medie Absolută (MAE) înainte și după ajustare și au fost comparate cu cele de la ceasurile standard; eroarea unghiulară a fost măsurată și pentru fiecare ac, utilizând poziția de pe cadran ca bază:

Comparația erorilor pentru ceasurile cu și fără confuzie a rolului acelor în setul de date cu acuri modificate, înainte și după ajustare.

Comparația erorilor pentru ceasurile cu și fără confuzie a rolului acelor în setul de date cu acuri modificate, înainte și după ajustare.

Confuzia rolurilor acelor a condus la cele mai mari erori. Când GPT-4.1 a confundat acul de oră cu acul de minute sau invers, estimările timpului au fost adesea foarte departe. În contrast, erorile cauzate de greșita judecată a direcției unui ac identificat corect au fost mai mici. Dintre cele trei acuri, acul de oră a arătat cea mai mare eroare unghiulară înainte de ajustare, în timp ce acul de secunde a arătat cea mai mică.

Eroarea unghiulară pe tip de ac pentru predicții cu și fără confuzie a rolului acelor, înainte și după ajustare, în setul de date cu acuri modificate.

Eroarea unghiulară pe tip de ac pentru predicții cu și fără confuzie a rolului acelor, înainte și după ajustare, în setul de date cu acuri modificate.

Pentru a se concentra doar pe erorile direcționale, analiza a fost limitată la cazurile în care modelul a identificat corect funcția fiecărui ac. Dacă modelul ar fi internalizat un concept general de citire a orei, performanța sa pe aceste exemple ar fi trebuit să se potrivească cu acuratețea sa pe ceasurile standard. Nu a fost așa, și acuratețea a rămas în mod vizibil mai slabă.

Pentru a examina dacă forma acului interferează cu simțul direcției modelului, a fost efectuat un al doilea experiment: două seturi noi de date au fost create, fiecare conținând 60 de ceasuri sintetice cu doar un ac de oră, care arăta către o marcă de minut diferită. Un set a folosit designul original al acului, iar celălalt designul modificat. Modelul a fost rugat să numească marca de timp către care arăta acul.

Rezultatele au arătat o scădere ușoară a acurateței cu acurile modificate, dar nu suficient de mare pentru a explica eșecurile generale ale modelului. Un singur element vizual nefamiliar a părut capabil să perturbe interpretarea generală a modelului, chiar și în sarcini pe care le-a efectuat anterior cu succes.

Prezentare generală a performanței GPT-4.1 înainte și după ajustare, pe ceasurile standard, distorsionate și cu acuri modificate, evidențiind câștiguri inegale și slăbiciuni persistente.

Prezentare generală a performanței GPT-4.1 înainte și după ajustare, pe ceasurile standard, distorsionate și cu acuri modificate, evidențiind câștiguri inegale și slăbiciuni persistente.

Concluzie

Deși focusul lucrării poate părea trivial la prima vedere, nu este important în mod special dacă modelele de vizualizare a limbajului vor învăța vreodată să citească ceasurile analogice cu acuratețe de 100%. Ceea ce dă lucrării o greutate este accentul pe o întrebare mai profundă și recurentă: dacă saturarea modelelor cu mai multe (și mai diverse) date poate conduce la felul de înțelegere a domeniului pe care oamenii o dobândesc prin abstracție și generalizare; sau dacă singura cale viabilă este de a inunda domeniul cu suficiente exemple pentru a anticipa fiecare variație probabilă la inferență.

Oricare dintre aceste căi ridică îndoieli cu privire la ceea ce arhitecturile actuale sunt cu adevărat capabile să învețe.

 

Publicat pentru prima dată luni, 19 mai 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai