Andersons vinkel
AI som bruker bilder i Chain-of-Thought-resonnering (CoT)

Vi tenker ofte i bilder – de fleste av oss gjør i alle fall det: Hos mennesker er en svekket evne til visuell forestilling ifølge forskning forbundet med svakere akademiske resultater. Når det gjelder memorering – vårt behov for å huske ting, ikke AI-problemet – har den betydelige semantiske kraften i sterke eller levende bilder blitt brukt i årtusener som støtte til læring:

Emma Willards «Temple of Time» (1846), en pedagogisk visualisering som gjør kronologi om til fysisk rom og organiserer historiske perioder og personer i et arkitektonisk perspektiv som trekker seg bakover. Willard utformet slike bilder som visuelle huskehjelpemidler, fordi hun mente at grafiske fremstillinger kunne hjelpe elever med å danne et sammenhengende mentalt bilde av historien. Kilde
Mnemoteknikk handler imidlertid om inntak av data, ikke om behandling eller tolkning, der mennesker varierer betydelig i hvilke tankestiler de bruker.
Personlig tenker jeg i former, og det har jeg gjort så lenge jeg kan huske å ha tenkt – tiår, år, ideer og mennesker blir på en eller annen måte representert gjennom relativ geometri og dynamiske volumblokker. Andre tenker hovedsakelig i tall, og atter andre i lukter eller smaker.
For AI er det mulige utvalget av synestesimetoder mer begrenset. En stor språkmodell (LLM) kan naturligvis tenke i tekst, siden dette er dens opprinnelige kodingstype over nivået for embeddings. Det er også vist at LLM-er koder tall som begreper i stedet for rene variabelverdier, noe som viser en tilbøyelighet til å «tenke i tall».
Men i hvilken grad kan man si at en LLM «tenker i former» eller «tenker i bilder», slik mennesker gjerne gjør?
Det at man får ulike svar fra en LLM på det samme spørsmålet stilt på forskjellige språk, viser at disse relasjonene kan være svært spesifikke og skjøre og fast knyttet til en bestemt tekst innenfor et språkdomene – for eksempel «spansk» – i stedet for å rette seg mot et høyere domene som overskrider og samtidig inneholder språk.*
En multimodal LLM – det vil si en visjon-språkmodell eller VLM – som kan generere bilder utelukkende for sin egen interne tankekjede (Chain of Thought, CoT), kan derfor logisk sett ha en fordel eller i det minste bokstavelig talt et alternativt synspunkt.
Nye synsvinkler
Med dette i tankene har et nytt tysk forskningssamarbeid presentert en bildefokusert VLM kalt ReImaGin, som bruker bildegenerering som en formbar resonneringsmekanisme.
Selv om tidligere arbeid har «boltet på» bildebaserte komponenter, var disse funksjonene verken iboende eller nødvendige for den sentrale arbeidsflyten. Forfatternes nye system er derimot utviklet for å utnytte de aller nyeste egenskapene til VLM-er og overta funksjonaliteten til spesialiserte verktøy og metoder, som dybdeoppfatning.
I eksemplet nedenfor fra den nye artikkelen, med tittelen Reasoning with Image Generation, må AI-en tolke to visninger – bildene lengst til venstre – der ingen av dem inneholder all informasjonen som er nødvendig for å løse en oppgave. Modellen kan derfor bruke informasjonen den har til å tolke et bredere og mer fullstendig bilde av scenen: kartet med underteksten «Generated Visualization», det tredje bildet fra venstre nedenfor.

Et eksempel fra den nye artikkelen der ReImaGin genererer et kart sett ovenfra ut fra to ufullstendige visninger, slik at modellen får en samlet visuell representasjon å resonnere ut fra. Kilde
ReImaGin er ikke bundet til én bestemt type visuell transformasjon. Systemet kan fylle ut manglende områder i puslespill, fjerne tildekkinger for å telle objekter, tegne baner for å forutsi kollisjoner, kombinere flere visninger til romlige kart, gjøre stiplede ruter om til sammenhengende linjer som kan følges, og generere dybdekart for dybderesonnering.
Enda viktigere er det at systemet selv kan regulere bruken av dette interne verktøysettet, i tråd med nyere fremvoksende evner hos VLM-er til automatisk å løse bestemte utfordringer med egnede verktøy, som dybdeestimering. Mesteparten av den beskrevne funksjonaliteten i ReImaGin aktiveres gjennom kall til verktøyet generate_image, en funksjon som kan gripe inn visuelt når det er nødvendig, uten menneskelig tilsyn eller aktivering.
Forfatterne skriver:
«Fordi generate_image godtar vilkårlige instruksjoner i naturlig språk, kan agenten utføre et enormt utvalg av transformasjoner. Spørsmålet er hvilken transformasjon som faktisk hjelper i en bestemt oppgave.»
«[Standard]praksisen er å angi transformasjonen gjennom håndlagde eksempler i konteksten som demonstrerer ønsket strategi – for eksempel å generere et dybdekart for dybderesonnering. Dette krever manuelt arbeid for hver oppgave og begrenser generalisering til nye oppgaver.»
«[Vi] spør om slike strategier kan oppdages automatisk. Siden strategien formidles til agenten gjennom prompten, kan strategisøk reduseres til optimalisering av prompten: Vi etablerer en iterativ sløyfe der en forslagsmodell genererer kandidatprompter, evaluerer dem på et lite utviklingssett og forbedrer dem ut fra observerte suksesser og feil.»
ReImaGin ble testet på tvers av tre VLM-er og seks visuelle resonneringsoppgaver og gjorde det generelt bedre enn både resonnering uten hjelp og spesialiserte synsverktøy, samtidig som systemet bare brukte ett verktøy.
Tilnærmingen
ReImaGin fungerer som en sløyfe: I hvert trinn vurderer VLM-en spørsmålet, de opprinnelige bildene og alt den allerede har generert, og bestemmer hva som skal skje videre. Dette kan omfatte vanlige bildeoperasjoner som beskjæring eller overlegg, eller et kall til generate_image, som oppretter et nytt bilde spesielt beregnet på å gjøre problemet lettere å resonnere om:

En trinnvis illustrasjon av hvordan ReImaGin resonnerer seg gjennom romlige problemer og visuelle puslespill. I begge eksemplene genererer modellen et nytt bilde under resonneringen og bruker deretter bildet som ekstra inndata i påfølgende trinn mot svaret.
Det genererte bildet føres deretter tilbake til VLM-en og blir en del av materialet som er tilgjengelig for neste resonneringstrinn, og prosessen kan gjentas. I bildet ovenfor ser vi disse delene illustrert for den romlige oppgaven: Modellen kombinerer først to fotografier til én visning og gjør deretter resultatet om til et kart sett ovenfra før den svarer på spørsmålet.
For puslespilloppgaven genererer den en endret versjon av puslespillet som isolerer det manglende området, og bruker deretter vanlig bildesubtraksjon for å finne svaret.
På denne måten blir bildegenerering en del av selve resonneringsprosessen i stedet for et sluttprodukt for brukeren. Disse mellomliggende bildene er faktisk bare ment for AI-ens CoT-prosesser og ikke for direkte bruk av sluttbrukeren.
I hver runde velger VLM-en selv sin neste handling ut fra konteksten som er samlet så langt. Handlingen kan være et nytt resonneringstrinn, en konvensjonell bildeoperasjon eller en instruksjon i naturlig språk til generate_image. Alt det valgte verktøyet returnerer, legges til konteksten, slik at modellen kan undersøke resultatet og avgjøre om det skal transformeres på nytt, om et annet verktøy skal brukes, eller om den skal gå videre til sitt endelige svar.
Større handlekraft
Et sentralt problem er å avgjøre hva slags type bilde som faktisk vil gjøre en bestemt oppgave enklere. ReImaGin gjør dette ved å eksperimentere med ulike instruksjoner til agenten, teste kandidatprompter på eksempler med kjente svar og bruke vellykkede og mislykkede forsøk til å lage bedre prompter. Flere iterasjoner av denne sløyfen gir til slutt strategiene som fungerer best.
Selve resonneringsmodellen og bildegeneratoren trenes ikke på nytt under prosessen. Bare instruksjonene som styrer hvordan agenten bruker verktøyene sine, optimaliseres. Forskerne beskriver derfor prosessen som «automatisert oppdagelse» av visuelle resonneringsstrategier, uten at de selv leverer oppgavespesifikke strategier eller resonneringseksempler.
Konfigurasjon og tester
ReImaGin ble evaluert på seks visuelle resonneringsoppgaver: dybderesonnering (Blink – avgjøre hvilket av to punkter som er nærmest kameraet); fullføring av puslespill (Mira – velge riktig brikke for et manglende bildeområde); telling med skjulte objekter (CAPTURe – telle objekter, også skjulte objekter); forutsigelse av kollisjoner (Spatial457 – forutsi hvilket objekt et mål i bevegelse vil treffe); romlig resonnering (MMSI – bestemme relasjoner mellom objekter i forskjellige visninger); og sporing av ruter – en ny benchmark som krever at modeller følger stiplede linjer som forbinder tall og bokstaver.

Slående eksempler på visuelle bilder i tankekjedeprosesser fra artikkelen «MIRA, a Benchmark for Visual Chain-of-Thought». Kilde
VLM-grunnmodellene som ble testet, var Gemini-3.1-Pro, GPT-5 og modellen med åpne vekter Qwen-3.5-27B. Bildegenereringen ble hovedsakelig håndtert av Nano-Banana-Pro, mens modellene med åpne vekter FLUX.2 [dev] og Qwen-Image-Edit-2511 også ble testet. Gemini-3.1-Pro ble brukt som velger for skalering av bildegenerering under testing.
Av de to sammenligningsgrunnlagene svarte den vanlige VLM-en, som forfatterne kalte «No Tools», direkte ut fra spørringen og bildene uten verktøy eller kodekjøring. Visual Sketchpad fra 2024 tilbød i dette tilfellet et fast sett med spesialiserte verktøy for datasyn og bildemanipulering, men ingen åpen bildegenerering.
For den romlige MMSI-oppgaven fikk begge sammenligningssystemene omtrent like mye regnekraft som ReImaGin: Hvert system genererte 20 svar, og svaret som forekom oftest, ble brukt.
Ytelsen ble målt som nøyaktighet i flervalgsoppgaver for alle oppgaver unntatt telling med skjulte objekter, som ble vurdert med symmetrisk gjennomsnittlig absolutt prosentfeil ved å sammenligne forventet og faktisk antall objekter. Resultatene ble gjennomsnittsberegnet over tre kjøringer, og standardfeilen ble også rapportert.

Testresultater som sammenligner ReImaGin med No Tools og Visual Sketchpad på tvers av tre VLM-er og seks visuelle resonneringsoppgaver. Høyere poengsum er bedre, bortsett fra ved telling med skjulte objekter, der lavere feil er bedre. ReImaGin oppnådde det beste resultatet i de fleste kombinasjonene av modell og oppgave.
De samme menneskedefinerte strategieksemplene ble brukt på tvers av alle tre modellene. ReImaGin ga bedre resultater enn begge sammenligningssystemene på de fleste oppgaver, med særlig tydelige forbedringer i fullføring av puslespill, telling med skjulte objekter og sporing av ruter.
Med GPT-5 økte for eksempel nøyaktigheten i puslespill fra 29,5% med No Tools og 16,7% med Visual Sketchpad til 44,9% med ReImaGin. Ablasjonstester bekreftet at den generative bildekomponenten er avgjørende for systemets ytelse.
Bildegeneratorer med åpne vekter ble også testet i stedet for Nano-Banana-Pro. FLUX.2 [dev] og Qwen-Image-Edit-2511 ga sammenlignbare resultater på enkelte enklere oppgaver, særlig inpainting, men var mindre stabile ved mer krevende transformasjoner som dybdeestimering og sporing av ruter. Lignende resultater ble oppnådd da Qwen-3.5-27B ble brukt som VLM:
![Testresultater som sammenligner bildegeneratorer med Qwen-3.5-27B som VLM. Nano-Banana-Pro oppnådde best resultat på fem av seks oppgaver, mens FLUX.2 [dev] og Qwen-Image-Edit-2511 ga forbedringer sammenlignet med No Tools på flere oppgaver.](https://www.unite.ai/wp-content/uploads/2026/09/table-6-1.jpg)
Testresultater som sammenligner bildegeneratorer med Qwen-3.5-27B som VLM. Nano-Banana-Pro oppnådde best resultat på fem av seks oppgaver, mens FLUX.2 [dev] og Qwen-Image-Edit-2511 ga forbedringer sammenlignet med No Tools på flere oppgaver.
Forfatterne gjennomførte også kvalitative tester på fire oppgaver:

Kvalitative eksempler fra fire oppgaver viser hvordan ReImaGin ble brukt til å utvide resonneringen til Gemini-3.1-Pro. I hvert tilfelle ble genererte visuelle representasjoner innarbeidet i resonneringsprosessen for å bidra til å løse oppgaven.
ReImaGin var ikke pålitelig i alle tilfeller. I noen situasjoner produserte bildegeneratoren en unøyaktig transformasjon, for eksempel en plantegning med objekter på feil steder. I andre tilfeller ble et korrekt generert bilde senere feiltolket av VLM-en.
I en manuell gjennomgang av 120 genererte bilder ble det funnet at 75% hadde utført den forespurte transformasjonen på en troverdig måte. Når dette var oppnådd, var det endelige svaret riktig i 87% av tilfellene, sammenlignet med 43% når det genererte bildet var unøyaktig.
Forfatterne konkluderer:
«Resultatene våre tyder på to bredere konklusjoner. For det første kan bildegenerering fungere som en generell mekanisme for visuell forestillingsevne innen multimodal resonnering, noe som reduserer behovet for å utvikle et eget verktøy for hver nye transformasjon.»
«For det andre avhenger effektiviteten til denne tilnærmingen ikke bare av de underliggende modellene, men også av resonneringsstrategien som brukes til å avgjøre hva som skal visualiseres, og hvordan resultatet skal brukes.»
«Forbedringene fra automatisk strategioppdagelse viser at modellene kan bruke sin forståelse av visuelle transformasjoner til å finne relevante strategier uten menneskeskrevne oppgavespesifikke strategier eller resonnementer.»
Konklusjon
Selvstendige beslutninger om verktøybruk av typen som undersøkes i denne studien, er en fascinerende utvikling, ikke minst fordi VLM-utviklingen uansett ser ut til å bevege seg naturlig i denne retningen. Jeg er nysgjerrig på om slike allsidige VLM-er til slutt vil yte like godt som dedikerte verktøy og rammeverk som Segment-økosystemet, og om de som utelukkende arbeider med disse «sideoppgavene», dermed kan ende med å skyte spurv med kanoner.
Det er likevel vanskelig å tro at VLM-er kan utvikle disiplinen som kreves for å gå forbi og opprettholde et forsprang på dedikerte løsninger som lokal finjustering, der en hel modell vies til én oppgave og ofte blir ubrukelig til alt annet i prosessen. Tiden vil vise.
* En mulig definisjon av bildedomenet, som vi lærer lenge før vi tilegner oss noen språkferdigheter.
Først publisert mandag 28. september 2026












