Unghiul lui Anderson

AI care folosește imagini în raționamentul de tip Chain-of-Thought (CoT)

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Derived from René Magritte, La condition humaine (The Human Condition), 1933. © Photothèque R. Magritte / ADAGP / DACS Images. Collection: National Gallery of Art, Washington. Extended laterally by GPT Image 2.

Gândim adesea în imagini — cel puțin cei mai mulți dintre noi: la oameni, o capacitate redusă de imaginație vizuală a fost asociată de cercetări cu rezultate academice mai slabe. În privința memorării — nevoia noastră de a ține minte lucruri, nu problema temută din AI — puterea semantică considerabilă a imaginilor puternice sau vii este folosită de milenii ca ajutor pentru învățare:

„Templul timpului” al Emmei Willard (1846), o vizualizare educațională care transformă cronologia în spațiu fizic, aranjând perioade și personaje istorice într-o perspectivă arhitecturală care se retrage. Willard a conceput asemenea imagini ca mnemonice vizuale, considerând că reprezentările grafice îi pot ajuta pe elevi să formeze o imagine mentală coerentă a istoriei. Sursa - https://publicdomainreview.org/essay/emma-willard-maps-of-time/

„Templul timpului” al Emmei Willard (1846), o vizualizare educațională care transformă cronologia în spațiu fizic, aranjând perioade și personaje istorice într-o perspectivă arhitecturală care se retrage. Willard a conceput asemenea imagini ca mnemonice vizuale, considerând că reprezentările grafice îi pot ajuta pe elevi să formeze o imagine mentală coerentă a istoriei. Sursa

Totuși, domeniul mnemotehnicii privește asimilarea datelor, nu prelucrarea sau interpretarea lor, unde oamenii diferă considerabil prin „stilurile” de gândire pe care le folosesc.

Personal, gândesc în forme și fac acest lucru de când mă știu — deceniile, anii, ideile și oamenii fiind reprezentați într-un fel prin geometrie relativă și blocuri dinamice de volum. Alții gândesc în primul rând în numere; iar alții în mirosuri sau gusturi.

Pentru AI, gama posibilă de metode sinestezice este mai limitată. În mod firesc, un model lingvistic mare (LLM) poate gândi în text, deoarece acesta este tipul său nativ de codificare, deasupra nivelului de înglobări; iar modelele LLM s-au dovedit capabile să codifice numerele ca noțiuni, nu ca simple valori variabile, demonstrând o înclinație de a „gândi în numere”.

Dar în ce măsură se poate spune despre un LLM că „gândește în forme” sau „gândește în imagini”, așa cum tind oamenii să o facă?

Faptul că același LLM oferă răspunsuri diferite la aceeași întrebare formulată în limbi diferite arată că aceste relații pot fi foarte specifice și fragile și pot fi codificate rigid pentru un anumit text dintr-un domeniu lingvistic (de exemplu, „spaniola”), în loc să se raporteze la un domeniu de nivel superior care transcende limba și totodată o conține*.

Prin urmare, un LLM multimodal (adică un model vizual-lingvistic sau VLM) care poate genera imagini exclusiv pentru propriul său lanț intern de gândire (COT) ar putea avea, în mod logic, un avantaj — sau cel puțin un punct de vedere literalmente alternativ.

Puncte de vedere noi

Pornind de aici, o colaborare recentă de cercetare din Germania a propus un VLM axat pe imagini, numit ReImaGin, care folosește generarea de imagini drept mecanism maleabil de raționament.

Deși lucrările anterioare au „atașat” componente bazate pe imagini, acestea nu erau nici intrinseci, nici esențiale pentru fluxul principal. În schimb, noul sistem al autorilor este conceput să valorifice capabilitățile foarte recente ale modelelor VLM pentru a prelua funcționalitatea unor instrumente specializate și metode, precum percepția adâncimii.

În exemplul de mai jos, preluat din noua lucrare — intitulată Reasoning with Image Generation — AI-ul trebuie să interpreteze două perspective (imaginile din extrema stângă), dintre care niciuna nu conține toate informațiile necesare rezolvării sarcinii. Modelul poate astfel folosi informațiile disponibile pentru a interpreta o imagine mai largă și mai completă a scenei — harta cu subtitlul „Generated Visualization”, a treia imagine din stânga.

Un exemplu din noua lucrare în care ReImaGin generează o hartă văzută de sus pornind de la două perspective incomplete, oferind modelului o reprezentare vizuală unificată pe baza căreia să raționeze. Sursa - https://arxiv.org/pdf/2609.16409

Un exemplu din noua lucrare în care ReImaGin generează o hartă văzută de sus pornind de la două perspective incomplete, oferind modelului o reprezentare vizuală unificată pe baza căreia să raționeze. Sursa

ReImaGin nu este legat de un singur tip de transformare vizuală; poate completa regiuni lipsă din puzzle-uri, elimina ocluziile pentru numărare, trasa traiectorii pentru predicția coliziunilor, combina mai multe perspective în hărți spațiale, transforma trasee întrerupte în linii continue pentru urmărire și genera hărți de adâncime pentru raționamentul spațial.

Mai important, sistemul își poate regla singur utilizarea acestui set intern de instrumente, în linie cu abilitățile emergente recente ale modelelor VLM de a aborda automat anumite provocări cu instrumente potrivite, precum estimarea adâncimii. Cea mai mare parte a funcționalității descrise pentru ReImaGin este activată prin apeluri la instrumentul generate_image, o funcție care poate interveni vizual atunci când este necesar, fără supraveghere sau inițiere umană.

Autorii afirmă:

„Deoarece generate_image acceptă instrucțiuni arbitrare în limbaj natural, agentul poate efectua o gamă vastă de transformări; întrebarea este ce transformare ajută cu adevărat pentru o anumită sarcină.

„Practica [standard] este de a preciza transformarea prin exemple elaborate manual și incluse în context, care demonstrează strategia dorită (de exemplu, generarea unei hărți de adâncime pentru raționamentul asupra adâncimii). Acest lucru necesită efort manual pentru fiecare sarcină și limitează generalizarea la sarcini noi.”

„[Ne] întrebăm dacă asemenea strategii pot fi descoperite automat. Deoarece strategia îi este transmisă agentului prin prompt, descoperirea unei strategii se reduce la optimizarea promptului: implementăm o buclă iterativă în care un model de propunere generează prompturi candidate, le evaluează pe un mic set de dezvoltare și le îmbunătățește pe baza succeselor și eșecurilor observate.”

Testat pe trei modele VLM și șase sarcini de raționament vizual, ReImaGin a depășit în general atât raționamentul fără asistență, cât și instrumentele vizuale specializate, folosind un singur instrument.

Abordarea

ReImaGin funcționează ca o buclă: la fiecare pas, modelul VLM analizează întrebarea, imaginile originale și tot ce a generat deja, apoi decide ce să facă în continuare. Aceasta poate însemna operații obișnuite asupra imaginilor, precum decuparea sau suprapunerea, ori un apel la generate_image, care creează o imagine nouă menită în mod expres să facă problema mai ușor de analizat:

O ilustrare pas cu pas a modului în care ReImaGin raționează asupra problemelor spațiale și a puzzle-urilor vizuale. În ambele exemple, modelul generează o imagine nouă în timpul raționamentului, apoi o folosește drept intrare suplimentară pentru pașii următori către răspuns.

O ilustrare pas cu pas a modului în care ReImaGin raționează asupra problemelor spațiale și a puzzle-urilor vizuale. În ambele exemple, modelul generează o imagine nouă în timpul raționamentului, apoi o folosește drept intrare suplimentară pentru pașii următori către răspuns.

Imaginea generată este apoi transmisă înapoi modelului VLM, devenind parte din materialul disponibil pentru următorul pas de raționament, iar procesul se poate repeta. În imaginea de mai sus vedem aceste aspecte ilustrate pentru sarcina spațială: modelul combină mai întâi două fotografii într-o singură perspectivă, apoi transformă rezultatul într-o hartă văzută de sus înainte de a răspunde la întrebare.

Pentru sarcina de tip puzzle, acesta generează o versiune modificată a puzzle-ului care izolează regiunea lipsă, apoi folosește scăderea convențională a imaginilor pentru a identifica răspunsul.

În acest mod, generarea de imagini devine parte a procesului de raționament în sine, nu un produs final destinat utilizatorului. De fapt, aceste imagini intermediare sunt create exclusiv pentru procesele COT ale AI-ului, nu pentru consumul direct al utilizatorului final.

La fiecare etapă, modelul VLM își alege următoarea acțiune din contextul acumulat până atunci. Acțiunea poate fi un alt pas de raționament, o operație convențională asupra imaginii sau o instrucțiune în limbaj natural adresată funcției generate_image. Orice rezultat al instrumentului ales este adăugat la context, permițând modelului să îl examineze și să decidă dacă îl transformă din nou, folosește alt instrument ori trece la răspunsul final.

Dobândirea autonomiei

O problemă centrală este stabilirea tipului de imagine care ar face cu adevărat o anumită sarcină mai ușoară. ReImaGin decide acest lucru experimentând cu instrucțiuni diferite pentru agent, testând prompturi candidate pe exemple cu răspunsuri cunoscute și folosind încercările reușite și nereușite pentru a obține prompturi mai bune. Iterațiile suplimentare ale acestei bucle produc în cele din urmă strategiile cu cele mai bune performanțe.

Modelul de raționament și generatorul de imagini nu sunt reantrenate în cursul acestui proces; sunt optimizate doar instrucțiunile care guvernează modul în care agentul își folosește instrumentele. Cercetătorii descriu, așadar, procesul drept „descoperire automatizată” a strategiilor de raționament vizual, fără să furnizeze ei înșiși strategii specifice sarcinii sau exemple de raționament.

Configurație și teste

ReImaGin a fost evaluat în șase sarcini de raționament vizual: raționament asupra adâncimii (Blink — identificarea punctului aflat mai aproape de cameră dintre două puncte); completarea puzzle-urilor (Mira — selectarea piesei corecte pentru o regiune lipsă din imagine); numărarea cu ocluzii (CAPTURe — numărarea obiectelor, inclusiv a celor ascunse); predicția coliziunilor (Spatial457 — prezicerea obiectului pe care îl va lovi o țintă în mișcare); raționament spațial (MMSI — determinarea relațiilor dintre obiecte din perspective diferite); și urmărirea traseelor — un nou reper care le cere modelelor să urmeze linii întrerupte ce conectează numere cu litere.

Exemple remarcabile de imagistică vizuală în procesele de tip lanț de gândire, preluate din lucrarea 'MIRA, a Benchmark for Visual Chain-of-Thought'. Sursa - https://arxiv.org/pdf/2511.02779

Exemple remarcabile de imagistică vizuală în procesele de tip lanț de gândire, preluate din lucrarea „MIRA, a Benchmark for Visual Chain-of-Thought”. Sursa

Arhitecturile VLM testate au fost Gemini-3.1-Pro, GPT-5 și modelul cu ponderi deschise Qwen-3.5-27B. Generarea imaginilor a fost realizată în principal de Nano-Banana-Pro, fiind testate și modelele cu ponderi deschise FLUX.2 [dev] și Qwen-Image-Edit-2511. Gemini-3.1-Pro a fost folosit ca selector pentru scalarea la momentul testării a generării de imagini.

Dintre cele două repere folosite pentru comparație, modelul VLM „vanilla”, numit de autorii lucrării „No Tools”, a răspuns direct pe baza solicitării și a imaginilor, fără instrumente sau execuție de cod. În schimb, sistemul din 2024 Visual Sketchpad a oferit în acest caz un set fix de instrumente specializate pentru vedere și manipularea imaginilor, dar fără generare deschisă de imagini.

Pentru sarcina spațială MMSI, ambelor repere li s-a alocat o putere de calcul similară cu ReImaGin, generându-se câte 20 de răspunsuri de la fiecare și folosindu-se răspunsul apărut cel mai des.

Performanța a fost măsurată prin acuratețea la întrebări cu variante multiple pentru toate sarcinile, cu excepția numărării cu ocluzii, evaluată prin eroarea procentuală absolută medie simetrică, comparând numărul de obiecte prezis cu cel real. Rezultatele au fost mediate pe trei rulări și a fost raportată și eroarea standard.

Rezultatele testelor care compară ReImaGin cu No Tools și Visual Sketchpad pe trei modele VLM și șase sarcini de raționament vizual. Scorurile mai mari sunt mai bune, cu excepția numărării cu ocluzii, unde o eroare mai mică este mai bună. ReImaGin a obținut cel mai bun rezultat în majoritatea combinațiilor model-sarcină.

Rezultatele testelor care compară ReImaGin cu No Tools și Visual Sketchpad pe trei modele VLM și șase sarcini de raționament vizual. Scorurile mai mari sunt mai bune, cu excepția numărării cu ocluzii, unde o eroare mai mică este mai bună. ReImaGin a obținut cel mai bun rezultat în majoritatea combinațiilor model-sarcină.

Aceleași exemple de strategii definite de oameni au fost folosite pentru toate cele trei modele. ReImaGin a produs rezultate mai bune decât ambele repere în majoritatea sarcinilor, cu îmbunătățiri deosebit de clare la completarea puzzle-urilor, numărarea cu ocluzii și urmărirea traseelor.

Cu GPT-5, de exemplu, acuratețea la puzzle-uri a crescut de la 29,5% cu No Tools și 16,7% cu Visual Sketchpad la 44,9% cu ReImaGin. Testele de ablație au confirmat că componenta generativă de imagine este esențială pentru performanța sistemului.

Generatoarele de imagini cu ponderi deschise au fost și ele testate în locul Nano-Banana-Pro: FLUX.2 [dev] și Qwen-Image-Edit-2511 au produs rezultate comparabile în unele sarcini mai simple, mai ales la completarea imaginilor, dar au fost mai puțin consecvente la transformări mai solicitante, precum estimarea adâncimii și urmărirea traseelor. S-au obținut rezultate similare atunci când Qwen-3.5-27B a fost folosit ca VLM:

Rezultatele testelor care compară generatoarele de imagini folosind Qwen-3.5-27B ca VLM. Nano-Banana-Pro a obținut cel mai bun rezultat în cinci dintre cele șase sarcini, iar FLUX.2 [dev] și Qwen-Image-Edit-2511 au îmbunătățit rezultatele față de No Tools în mai multe sarcini.

Rezultatele testelor care compară generatoarele de imagini folosind Qwen-3.5-27B ca VLM. Nano-Banana-Pro a obținut cel mai bun rezultat în cinci dintre cele șase sarcini, iar FLUX.2 [dev] și Qwen-Image-Edit-2511 au îmbunătățit rezultatele față de No Tools în mai multe sarcini.

Autorii au efectuat și teste calitative pe patru sarcini:

Exemple calitative din patru sarcini arată cum a fost folosit ReImaGin pentru a extinde raționamentul Gemini-3.1-Pro. În fiecare caz, reprezentări vizuale generate au fost integrate în procesul de raționament pentru a ajuta la rezolvarea sarcinii.

Exemple calitative din patru sarcini arată cum a fost folosit ReImaGin pentru a extinde raționamentul Gemini-3.1-Pro. În fiecare caz, reprezentări vizuale generate au fost integrate în procesul de raționament pentru a ajuta la rezolvarea sarcinii.

ReImaGin nu a fost fiabil în toate cazurile: în unele împrejurări, generatorul de imagini a produs o transformare inexactă, precum un plan de încăpere cu obiecte amplasate greșit; în altele, o imagine generată corect a fost apoi interpretată greșit de modelul VLM.

Într-un audit manual al celor 120 de imagini generate, s-a constatat că 75% au realizat fidel transformarea cerută. Când acest lucru s-a întâmplat, răspunsul final a fost corect în 87% dintre cazuri, față de 43% atunci când imaginea generată era inexactă.

Autorii concluzionează:

„Rezultatele noastre sugerează două concluzii mai generale. În primul rând, generarea de imagini poate funcționa ca un mecanism general de imaginație vizuală în cadrul raționamentului multimodal, reducând nevoia de a proiecta câte un instrument separat pentru fiecare transformare nouă.

„În al doilea rând, eficacitatea acestei abordări depinde nu doar de modelele de bază, ci și de strategia de raționament folosită pentru a decide ce trebuie vizualizat și cum trebuie utilizat rezultatul.

„Câștigurile aduse de descoperirea automată a strategiilor arată că modelele își pot valorifica înțelegerea transformărilor vizuale pentru a descoperi strategii relevante fără strategii specifice sarcinilor ori exemple de raționament scrise de oameni.”

Concluzie

Deciziile de auto-utilizare a instrumentelor de tipul celor cercetate în acest studiu reprezintă o evoluție fascinantă, cu atât mai mult cu cât dezvoltarea modelelor VLM pare să se îndrepte în mod natural spre această abordare. Sunt curios dacă astfel de modele VLM universale vor ajunge să funcționeze la fel de bine ca instrumentele și cadrele specializate, precum ecosistemul Segment, și dacă, prin urmare, cei care se ocupă exclusiv de aceste „sarcini secundare” vor sfârși prin a folosi un baros pentru a sparge o nucă.

Este destul de greu de crezut că modelele VLM ar putea dezvolta disciplina necesară pentru a depăși și a-și menține avansul față de soluții dedicate precum ajustarea fină locală, unde un model întreg este consacrat unei singure sarcini și, în acest proces, devine adesea inutil pentru orice altceva. Timpul va decide.

 

* O posibilă definiție a domeniului imaginilor, pe care îl învățăm cu mult înainte să dobândim orice aptitudini lingvistice.

Publicat inițial luni, 28 septembrie 2026

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai