Angolo di Anderson

Un’IA che usa le immagini nel ragionamento Chain-of-Thought (CoT)

mm
Aggiungi Unite.AI alle tue fonti preferite su Google
Derived from René Magritte, La condition humaine (The Human Condition), 1933. © Photothèque R. Magritte / ADAGP / DACS Images. Collection: National Gallery of Art, Washington. Extended laterally by GPT Image 2.

Pensiamo spesso per immagini — o almeno la maggior parte di noi: negli esseri umani, una ridotta capacità di immaginazione visiva è stata associata dalla ricerca a risultati scolastici inferiori. In termini di memorizzazione — il nostro bisogno di ricordare le cose, non il problema temuto dell’IA —, il notevole potere semantico di immagini forti o vivide viene utilizzato da millenni come supporto all’apprendimento:

Il “Tempio del Tempo” di Emma Willard (1846), una visualizzazione didattica che trasforma la cronologia in spazio fisico, disponendo periodi e personaggi storici all’interno di una prospettiva architettonica in profondità. Willard progettò queste immagini come ausili mnemonici visivi, convinta che le rappresentazioni grafiche potessero aiutare gli studenti a formare un’immagine mentale coerente della storia. Fonte – https://publicdomainreview.org/essay/emma-willard-maps-of-time/

Il “Tempio del Tempo” di Emma Willard (1846), una visualizzazione didattica che trasforma la cronologia in spazio fisico, disponendo periodi e personaggi storici all’interno di una prospettiva architettonica in profondità. Willard progettò queste immagini come ausili mnemonici visivi, convinta che le rappresentazioni grafiche potessero aiutare gli studenti a formare un’immagine mentale coerente della storia. Fonte

Tuttavia, la mnemotecnica riguarda l’acquisizione dei dati, non la loro elaborazione o interpretazione, ambiti nei quali le persone differiscono notevolmente per gli “stili” di pensiero a cui ricorrono.

Personalmente, penso per forme e lo faccio da quando ho memoria: decenni, anni, idee e persone vengono rappresentati in qualche modo tramite geometrie relative e blocchi dinamici di volume. Altri pensano principalmente per numeri; altri ancora per odori o sapori.

Per l’IA, la possibile gamma di metodi sinestetici è più limitata. Naturalmente, un modello linguistico di grandi dimensioni (LLM) può pensare in forma testuale, poiché questo è il suo tipo di codifica nativo al di sopra del livello degli embedding. È stato inoltre dimostrato che gli LLM codificano i numeri come concetti anziché come semplici valori variabili, mostrando una propensione a “pensare per numeri”.

Ma fino a che punto si può dire che un LLM “pensi per forme” o “pensi per immagini” come tendono a fare gli esseri umani?

Il fatto che un LLM fornisca risposte diverse alla stessa domanda formulata in lingue differenti indica che tali relazioni possono essere molto specifiche e fragili, nonché rigidamente legate a un testo preciso all’interno di un dominio linguistico — per esempio lo “spagnolo” — invece di riferirsi a un dominio superiore che trascende e allo stesso tempo contiene il linguaggio.*

Pertanto, un LLM multimodale — ossia un modello visione-linguaggio o VLM — capace di generare immagini esclusivamente per la propria catena di pensiero interna (Chain of Thought, CoT) potrebbe logicamente avere un vantaggio, o almeno un punto di vista letteralmente alternativo.

Nuovi punti di vista

Partendo da questa idea, una recente collaborazione di ricerca tedesca ha proposto un VLM incentrato sulle immagini chiamato ReImaGin, che sfrutta la generazione di immagini come meccanismo di ragionamento duttile.

Sebbene lavori precedenti avessero “aggiunto” componenti basati sulle immagini, tali funzioni non erano né intrinseche né essenziali per il flusso di lavoro principale. Il nuovo sistema degli autori è invece progettato per sfruttare le capacità più recenti dei VLM e sostituire la funzionalità di strumenti specializzati e metodi come la percezione della profondità.

Nell’esempio seguente, tratto dal nuovo articolo intitolato Reasoning with Image Generation, l’IA deve interpretare due viste — le immagini più a sinistra — nessuna delle quali contiene tutte le informazioni necessarie a risolvere un compito. Il modello può quindi usare le informazioni disponibili per ricostruire una rappresentazione più ampia e completa della scena: la mappa con la didascalia “Generated Visualization”, la terza da sinistra nell’immagine sottostante.

Esempio tratto dal nuovo articolo: ReImaGin genera una mappa dall’alto a partire da due viste incomplete, fornendo al modello una rappresentazione visiva unificata sulla quale basare il ragionamento. Fonte – https://arxiv.org/pdf/2609.16409

Esempio tratto dal nuovo articolo: ReImaGin genera una mappa dall’alto a partire da due viste incomplete, fornendo al modello una rappresentazione visiva unificata sulla quale basare il ragionamento. Fonte

ReImaGin non è vincolato a un unico tipo di trasformazione visiva. Può completare regioni mancanti di un puzzle, rimuovere occlusioni per contare gli oggetti, tracciare traiettorie per prevedere collisioni, combinare più viste in mappe spaziali, convertire percorsi tratteggiati in linee continue da seguire e generare mappe di profondità per il ragionamento spaziale.

Ancora più importante, il sistema può regolare autonomamente l’uso di questo insieme interno di strumenti, in linea con le recenti capacità emergenti dei VLM di affrontare automaticamente sfide specifiche con strumenti adatti, come la stima della profondità. Gran parte delle funzionalità descritte di ReImaGin viene attivata tramite chiamate allo strumento generate_image, una funzione che può intervenire visivamente quando necessario, senza supervisione o attivazione umana.

Gli autori affermano:

“Poiché generate_image accetta istruzioni arbitrarie in linguaggio naturale, l’agente può eseguire una vastissima gamma di trasformazioni. La domanda è quale trasformazione sia davvero utile per un determinato compito.”

“La prassi [standard] consiste nello specificare la trasformazione mediante esempi contestuali creati manualmente che dimostrano la strategia desiderata — per esempio, generare una mappa di profondità per ragionare sulla profondità. Ciò richiede lavoro manuale per ogni compito e limita la generalizzazione a nuovi compiti.”

“[Noi] chiediamo se tali strategie possano essere scoperte automaticamente. Poiché la strategia viene comunicata all’agente tramite il prompt, scoprirla si riduce a ottimizzare il prompt: realizziamo un ciclo iterativo nel quale un modello proponente genera prompt candidati, li valuta su un piccolo insieme di sviluppo e li perfeziona in base ai successi e agli insuccessi osservati.”

Testato su tre VLM e sei compiti di ragionamento visivo, ReImaGin ha in generale superato sia il ragionamento non assistito sia gli strumenti specializzati di visione, utilizzando un solo strumento.

L’approccio

ReImaGin funziona come un ciclo: a ogni passaggio, il VLM considera la domanda, le immagini originali e tutto ciò che ha già generato, quindi decide cosa fare in seguito. Può ricorrere a normali operazioni sulle immagini, come il ritaglio o la sovrapposizione, oppure chiamare generate_image, che crea una nuova immagine pensata appositamente per rendere più semplice il ragionamento sul problema:

Illustrazione passo per passo del modo in cui ReImaGin ragiona su problemi spaziali e puzzle visivi. In entrambi gli esempi, il modello genera una nuova immagine durante il ragionamento e poi la usa come input aggiuntivo nei passaggi successivi verso la risposta.

Illustrazione passo per passo del modo in cui ReImaGin ragiona su problemi spaziali e puzzle visivi. In entrambi gli esempi, il modello genera una nuova immagine durante il ragionamento e poi la usa come input aggiuntivo nei passaggi successivi verso la risposta.

L’immagine generata viene quindi reimmessa nel VLM, entrando a far parte del materiale disponibile per il successivo passaggio di ragionamento, e il processo può ripetersi. Nell’immagine precedente vediamo queste fasi applicate al compito spaziale: il modello combina prima due fotografie in un’unica vista, poi trasforma il risultato in una mappa dall’alto prima di rispondere alla domanda.

Per il compito del puzzle, genera una versione modificata che isola la regione mancante e usa poi la sottrazione convenzionale tra immagini per identificare la risposta.

In questo modo, la generazione di immagini diventa parte del processo di ragionamento stesso, anziché un prodotto finale per l’utente. Queste immagini intermedie sono infatti destinate esclusivamente ai processi CoT dell’IA, non alla fruizione diretta dell’utente finale.

A ogni turno, il VLM sceglie autonomamente l’azione successiva in base al contesto accumulato fino a quel momento. Tale azione può essere un altro passaggio di ragionamento, un’operazione convenzionale sulle immagini o un’istruzione in linguaggio naturale a generate_image. Qualunque risultato restituisca lo strumento scelto viene aggiunto al contesto, consentendo al modello di esaminarlo e decidere se trasformarlo di nuovo, usare un altro strumento o procedere alla risposta finale.

Acquisire autonomia

Un problema centrale consiste nel decidere quale tipo di immagine renderebbe realmente più semplice un determinato compito. ReImaGin lo stabilisce sperimentando istruzioni diverse per l’agente, provando prompt candidati su esempi con risposte note e usando sia i tentativi riusciti sia quelli falliti per ottenere prompt migliori. Le iterazioni successive di questo ciclo finiscono per produrre le strategie più efficaci.

Il modello di ragionamento e il generatore di immagini non vengono riaddestrati durante questo processo. Vengono ottimizzate soltanto le istruzioni che regolano il modo in cui l’agente usa i propri strumenti. I ricercatori descrivono quindi il processo come una “scoperta automatizzata” di strategie di ragionamento visivo, senza fornire direttamente strategie specifiche per i singoli compiti o esempi di ragionamento.

Configurazione e test

ReImaGin è stato valutato su sei compiti di ragionamento visivo: ragionamento sulla profondità (Blink — individuare quale di due punti è più vicino alla fotocamera); completamento di puzzle (Mira — selezionare il pezzo corretto per una regione mancante dell’immagine); conteggio con occlusione (CAPTURe — contare gli oggetti, compresi quelli nascosti); previsione delle collisioni (Spatial457 — prevedere quale oggetto verrà colpito da un bersaglio in movimento); ragionamento spaziale (MMSI — determinare le relazioni tra oggetti in viste differenti); e tracciamento dei percorsi, un nuovo benchmark che richiede ai modelli di seguire linee tratteggiate che collegano numeri e lettere.

Esempi notevoli di immagini visive nei processi di catena di pensiero, tratti dall’articolo «MIRA, a Benchmark for Visual Chain-of-Thought». Fonte – https://arxiv.org/pdf/2511.02779

Esempi notevoli di immagini visive nei processi di catena di pensiero, tratti dall’articolo «MIRA, a Benchmark for Visual Chain-of-Thought». Fonte

Le architetture VLM testate sono state Gemini-3.1-Pro, GPT-5 e il modello a pesi aperti Qwen-3.5-27B. La generazione delle immagini è stata affidata principalmente a Nano-Banana-Pro; sono stati inoltre testati i modelli a pesi aperti FLUX.2 [dev] e Qwen-Image-Edit-2511. Gemini-3.1-Pro è stato usato come selettore per il ridimensionamento della generazione di immagini in fase di test.

Dei due sistemi di riferimento usati per il confronto, il VLM convenzionale chiamato “No Tools” dagli autori rispondeva direttamente in base alla richiesta e alle immagini, senza strumenti né esecuzione di codice. Il metodo Visual Sketchpad, presentato nel 2024, offriva invece un insieme fisso di strumenti specializzati per la visione e la manipolazione delle immagini, ma non una generazione di immagini aperta.

Per il compito spaziale MMSI, a entrambi i sistemi di riferimento è stata assegnata una quantità di potenza di calcolo simile a quella di ReImaGin: ciascun sistema ha generato 20 risposte ed è stata utilizzata quella comparsa più spesso.

Le prestazioni sono state misurate tramite l’accuratezza nelle domande a scelta multipla per tutti i compiti tranne il conteggio con occlusione, valutato usando l’errore percentuale assoluto medio simmetrico, confrontando il numero previsto e quello effettivo di oggetti. I risultati sono stati mediati su tre esecuzioni ed è stato riportato anche l’errore standard.

Risultati dei test che confrontano ReImaGin con No Tools e Visual Sketchpad su tre VLM e sei compiti di ragionamento visivo. I punteggi più alti sono migliori, tranne nel conteggio con occlusione, dove è preferibile un errore inferiore. ReImaGin ha ottenuto il miglior risultato nella maggior parte delle combinazioni modello-compito.

Risultati dei test che confrontano ReImaGin con No Tools e Visual Sketchpad su tre VLM e sei compiti di ragionamento visivo. I punteggi più alti sono migliori, tranne nel conteggio con occlusione, dove è preferibile un errore inferiore. ReImaGin ha ottenuto il miglior risultato nella maggior parte delle combinazioni modello-compito.

Per tutti e tre i modelli sono stati utilizzati gli stessi esempi di strategie definiti dagli esseri umani. ReImaGin ha prodotto risultati migliori di entrambi i sistemi di riferimento nella maggior parte dei compiti, con miglioramenti particolarmente evidenti nel completamento di puzzle, nel conteggio con occlusione e nel tracciamento dei percorsi.

Con GPT-5, per esempio, l’accuratezza nei puzzle è aumentata dal 29,5% con No Tools e dal 16,7% con Visual Sketchpad al 44,9% con ReImaGin. I test di ablazione hanno confermato che la componente generativa delle immagini è essenziale per le prestazioni del sistema.

Al posto di Nano-Banana-Pro sono stati testati anche generatori di immagini a pesi aperti. FLUX.2 [dev] e Qwen-Image-Edit-2511 hanno prodotto risultati comparabili in alcuni compiti più semplici, in particolare nell’inpainting, ma sono stati meno costanti nelle trasformazioni più impegnative, come la stima della profondità e il tracciamento dei percorsi. Risultati simili sono stati ottenuti usando Qwen-3.5-27B come VLM:

Risultati dei test che confrontano i generatori di immagini con Qwen-3.5-27B come VLM. Nano-Banana-Pro ha ottenuto il miglior risultato in cinque compiti su sei, mentre FLUX.2 [dev] e Qwen-Image-Edit-2511 hanno migliorato i risultati di No Tools in diversi compiti.

Risultati dei test che confrontano i generatori di immagini con Qwen-3.5-27B come VLM. Nano-Banana-Pro ha ottenuto il miglior risultato in cinque compiti su sei, mentre FLUX.2 [dev] e Qwen-Image-Edit-2511 hanno migliorato i risultati di No Tools in diversi compiti.

Gli autori hanno inoltre condotto test qualitativi su quattro compiti:

Esempi qualitativi relativi a quattro compiti mostrano come ReImaGin sia stato usato per potenziare il ragionamento di Gemini-3.1-Pro. In ciascun caso, rappresentazioni visive generate sono state incorporate nel processo di ragionamento per contribuire alla soluzione del compito.

Esempi qualitativi relativi a quattro compiti mostrano come ReImaGin sia stato usato per potenziare il ragionamento di Gemini-3.1-Pro. In ciascun caso, rappresentazioni visive generate sono state incorporate nel processo di ragionamento per contribuire alla soluzione del compito.

ReImaGin non si è dimostrato affidabile in ogni caso. In alcune situazioni, il generatore di immagini ha prodotto una trasformazione inesatta, come una planimetria con gli oggetti nelle posizioni sbagliate; in altre, un’immagine generata correttamente è stata poi interpretata male dal VLM.

In un controllo manuale di 120 immagini generate, il 75% ha eseguito fedelmente la trasformazione richiesta. Quando ciò avveniva, la risposta finale era corretta nell’87% dei casi, contro il 43% quando l’immagine generata era imprecisa.

Gli autori concludono:

“I nostri risultati suggeriscono due conclusioni più generali. In primo luogo, la generazione di immagini può fungere da meccanismo generale di immaginazione visiva all’interno del ragionamento multimodale, riducendo la necessità di progettare uno strumento separato per ogni nuova trasformazione.”

“In secondo luogo, l’efficacia di questo approccio dipende non solo dai modelli sottostanti, ma anche dalla strategia di ragionamento usata per decidere cosa visualizzare e come utilizzare il risultato.”

“I miglioramenti ottenuti tramite la scoperta automatica delle strategie mostrano che i modelli possono sfruttare la propria comprensione delle trasformazioni visive per individuare strategie pertinenti senza strategie specifiche per il compito o ragionamenti scritti dagli esseri umani.”

Conclusione

Le decisioni autonome sull’uso degli strumenti studiate in questa ricerca rappresentano uno sviluppo affascinante, anche perché l’evoluzione dei VLM sembra orientarsi naturalmente verso questo approccio. Sono curioso di vedere se VLM così generalisti finiranno per eguagliare strumenti e framework dedicati, come l’ecosistema Segment, e se chi si occupa esclusivamente di queste “attività secondarie” finirà quindi per usare un martello pneumatico per rompere una noce.

È piuttosto difficile credere che i VLM possano sviluppare la disciplina necessaria per superare e mantenere un vantaggio su soluzioni dedicate come il fine-tuning locale, nel quale un intero modello viene assegnato a un solo compito e spesso, nel processo, viene reso inutilizzabile per qualsiasi altro. Il tempo lo dirà.

 

* Una possibile definizione dell’ambito delle immagini, che impariamo molto prima di acquisire qualunque capacità linguistica.

Pubblicato per la prima volta lunedì 28 settembre 2026

Scrittore di apprendimento automatico, specialista di dominio nella sintesi di immagini umane. Ex responsabile dei contenuti di ricerca presso Metaphysic.ai, fino alla sua fusione nella Brahma.ai di DNEG.
Sito web: martinanderson.ai
Contatto: martin@martinanderson.ai