Andersons vinkel

AI som använder bilder i Chain-of-Thought-resonemang (CoT)

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Derived from René Magritte, La condition humaine (The Human Condition), 1933. © Photothèque R. Magritte / ADAGP / DACS Images. Collection: National Gallery of Art, Washington. Extended laterally by GPT Image 2.

Vi tänker ofta i bilder – de flesta av oss gör det i alla fall: Hos människor har en nedsatt förmåga till visuell föreställning enligt forskning samband med sämre studieresultat. När det gäller memorering – vårt behov av att minnas saker, inte det omtalade AI-problemet – har den betydande semantiska kraften i starka eller levande bilder använts i årtusenden som stöd för lärande:

Emma Willards ”Temple of Time” (1846), en pedagogisk visualisering som omvandlar kronologi till fysisk rymd och ordnar historiska perioder och personer i ett arkitektoniskt perspektiv som sträcker sig bakåt. Willard utformade sådana bilder som visuella minnesstöd eftersom hon ansåg att grafiska framställningar kunde hjälpa elever att skapa en sammanhängande mental bild av historien. Källa – https://publicdomainreview.org/essay/emma-willard-maps-of-time/

Emma Willards ”Temple of Time” (1846), en pedagogisk visualisering som omvandlar kronologi till fysisk rymd och ordnar historiska perioder och personer i ett arkitektoniskt perspektiv som sträcker sig bakåt. Willard utformade sådana bilder som visuella minnesstöd eftersom hon ansåg att grafiska framställningar kunde hjälpa elever att skapa en sammanhängande mental bild av historien. Källa

Mnemonik handlar dock om inlärning av data snarare än bearbetning eller tolkning, där människor skiljer sig avsevärt åt i vilka tankestilar de använder.

Själv tänker jag i former, och det har jag gjort så länge jag har kunnat tänka – årtionden, år, idéer och människor representeras på något sätt genom relativ geometri och dynamiska volymblock. Andra tänker främst i siffror, och ytterligare andra i dofter eller smaker.

För AI är det möjliga urvalet av synestesimetoder mer begränsat. En stor språkmodell (LLM) kan naturligtvis tänka i text, eftersom detta är dess inbyggda kodningstyp ovanför nivån för inbäddningar. Det har också visats att LLM:er kodar siffror som begrepp snarare än rena variabelvärden, vilket tyder på en benägenhet att ”tänka i siffror”.

Men i vilken utsträckning kan man säga att en LLM ”tänker i former” eller ”tänker i bilder” på det sätt som människor ofta gör?

Det faktum att en LLM ger olika svar på samma fråga som ställs på olika språk visar att dessa relationer kan vara mycket specifika och sköra, och hårdkodade till en viss text inom en språkdomän – exempelvis ”spanska” – i stället för att knytas till en högre domän som överskrider och samtidigt innehåller språket.*

En multimodal LLM – det vill säga en vision-språkmodell eller VLM – som kan skapa bilder enbart för sin egen interna tankekedja (Chain of Thought, CoT) skulle därför logiskt kunna ha en fördel, eller åtminstone bokstavligen ett alternativt perspektiv.

Nya perspektiv

Med detta i åtanke har ett nytt tyskt forskningssamarbete presenterat en bildfokuserad VLM vid namn ReImaGin, som använder bildgenerering som en formbar resonemangsmekanism.

Även om tidigare arbete hade ”skruvat fast” bildbaserade komponenter var dessa funktioner varken inbyggda eller nödvändiga för det centrala arbetsflödet. Författarnas nya system är däremot utformat för att utnyttja VLM:ers allra senaste förmågor och ta över funktionen hos specialiserade verktyg och metoder, såsom djupseende.

I exemplet nedan från den nya artikeln, med titeln Reasoning with Image Generation, måste AI:n tolka två vyer – bilderna längst till vänster – där ingen av dem innehåller all information som behövs för att lösa uppgiften. Modellen kan därför använda den information den har för att tolka en bredare och mer fullständig bild av scenen: kartan med undertexten ”Generated Visualization”, den tredje bilden från vänster nedan.

Ett exempel från den nya artikeln där ReImaGin skapar en karta ovanifrån utifrån två ofullständiga vyer och ger modellen en samlad visuell representation att resonera utifrån. Källa – https://arxiv.org/pdf/2609.16409

Ett exempel från den nya artikeln där ReImaGin skapar en karta ovanifrån utifrån två ofullständiga vyer och ger modellen en samlad visuell representation att resonera utifrån. Källa

ReImaGin är inte bundet till en viss typ av visuell omvandling. Systemet kan fylla i saknade områden i pussel, avlägsna skymmande delar för att räkna objekt, rita banor för att förutse kollisioner, kombinera flera vyer till rumsliga kartor, omvandla streckade vägar till heldragna linjer som kan följas och skapa djupkartor för djupresonemang.

Än viktigare är att systemet självt kan styra användningen av denna interna verktygslåda, i linje med VLM:ers nyligen framväxande förmåga att automatiskt hantera särskilda utmaningar med lämpliga verktyg, exempelvis djupskattning. Merparten av ReImaGins beskrivna funktioner aktiveras genom anrop till verktyget generate_image, en funktion som kan ingripa visuellt vid behov utan mänsklig övervakning eller aktivering.

Författarna skriver:

”Eftersom generate_image accepterar godtyckliga instruktioner i naturligt språk kan agenten utföra ett enormt antal omvandlingar. Frågan är vilken omvandling som faktiskt hjälper för en viss uppgift.”

”[Standard]praxis är att ange omvandlingen med handgjorda exempel i kontexten som visar den önskade strategin – exempelvis att skapa en djupkarta för djupresonemang. Detta kräver manuellt arbete för varje uppgift och begränsar generalisering till nya uppgifter.”

”[Vi] frågar om sådana strategier kan upptäckas automatiskt. Eftersom strategin förmedlas till agenten genom dess prompt kan strategiupptäckt reduceras till optimering av prompten: Vi upprättar en iterativ slinga där en förslagsmodell skapar kandidatprompter, utvärderar dem på en liten utvecklingsmängd och förfinar dem utifrån observerade framgångar och misslyckanden.”

ReImaGin testades med tre VLM:er och sex visuella resonemangsuppgifter och överträffade i allmänhet både resonemang utan hjälp och specialiserade visionsverktyg, samtidigt som det bara använde ett verktyg.

Metoden

ReImaGin fungerar som en slinga: I varje steg betraktar VLM:n frågan, originalbilderna och allt som den redan har skapat, och bestämmer vad den ska göra härnäst. Det kan omfatta vanliga bildoperationer som beskärning eller överlagring, eller ett anrop till generate_image, som skapar en ny bild avsedd just för att göra problemet lättare att resonera kring:

En stegvis illustration av hur ReImaGin resonerar sig igenom rumsliga problem och visuella pussel. I båda exemplen skapar modellen en ny bild under resonemanget och använder sedan bilden som extra indata i senare steg mot svaret.

En stegvis illustration av hur ReImaGin resonerar sig igenom rumsliga problem och visuella pussel. I båda exemplen skapar modellen en ny bild under resonemanget och använder sedan bilden som extra indata i senare steg mot svaret.

Den skapade bilden matas sedan tillbaka till VLM:n och blir en del av materialet som finns tillgängligt för nästa resonemangssteg, varefter processen kan upprepas. I bilden ovan ser vi dessa delar illustrerade för den rumsliga uppgiften: Modellen kombinerar först två fotografier till en enda vy och omvandlar sedan resultatet till en karta ovanifrån innan den besvarar frågan.

För pusseluppgiften skapar den en ändrad version av pusslet som isolerar det saknade området och använder därefter vanlig bildsubtraktion för att identifiera svaret.

På detta sätt blir bildgenerering en del av själva resonemangsprocessen snarare än en slutprodukt för användaren. Dessa mellanliggande bilder är i själva verket endast avsedda för AI:ns CoT-processer och inte för direkt användning av slutanvändaren.

I varje omgång väljer VLM:n själv sin nästa åtgärd utifrån den kontext som har samlats in hittills. Åtgärden kan vara ytterligare ett resonemangssteg, en konventionell bildoperation eller en instruktion i naturligt språk till generate_image. Allt som det valda verktyget returnerar läggs till i kontexten, så att modellen kan granska resultatet och avgöra om det ska omvandlas igen, om ett annat verktyg ska användas eller om den ska gå vidare till sitt slutliga svar.

Ökad handlingsförmåga

Ett centralt problem är att avgöra vilken typ av bild som faktiskt skulle göra en viss uppgift enklare. ReImaGin gör detta genom att experimentera med olika instruktioner till agenten, testa kandidatprompter på exempel med kända svar och använda både lyckade och misslyckade försök för att få fram bättre prompter. Ytterligare varv i denna slinga ger till slut de bäst presterande strategierna.

Själva resonemangsmodellen och bildgeneratorn tränas inte om under processen. Endast instruktionerna som styr hur agenten använder sina verktyg optimeras. Forskarna beskriver därför processen som ”automatiserad upptäckt” av visuella resonemangsstrategier, utan att själva tillhandahålla uppgiftsspecifika strategier eller resonemangsexempel.

Konfiguration och tester

ReImaGin utvärderades på sex visuella resonemangsuppgifter: djupresonemang (Blink – avgöra vilken av två punkter som ligger närmast kameran), pusselkomplettering (Mira – välja rätt bit för ett saknat bildområde), räkning vid skymning (CAPTURe – räkna objekt, även dolda objekt), kollisionsprognos (Spatial457 – förutse vilket objekt ett rörligt mål kommer att träffa), rumsligt resonemang (MMSI – fastställa relationer mellan objekt i olika vyer) och vägspårning, ett nytt benchmark som kräver att modeller följer streckade linjer som förbinder siffror med bokstäver.

Slående exempel på visuella bilder i tankekedjeprocesser från artikeln ”MIRA, a Benchmark for Visual Chain-of-Thought”. Källa – https://arxiv.org/pdf/2511.02779

Slående exempel på visuella bilder i tankekedjeprocesser från artikeln ”MIRA, a Benchmark for Visual Chain-of-Thought”. Källa

De VLM-grundmodeller som testades var Gemini-3.1-Pro, GPT-5 och modellen med öppna vikter Qwen-3.5-27B. Bildgenereringen hanterades främst av Nano-Banana-Pro, medan modellerna med öppna vikter FLUX.2 [dev] och Qwen-Image-Edit-2511 också testades. Gemini-3.1-Pro användes som väljare för skalning av bildgenerering under testningen.

Av de två jämförelsebaslinjerna svarade den vanliga VLM:n, som artikelns författare kallade ”No Tools”, direkt utifrån frågan och bilderna utan verktyg eller kodkörning. Visual Sketchpad från 2024 erbjöd i detta fall en fast uppsättning specialiserade verktyg för datorseende och bildmanipulation, men ingen öppen bildgenerering.

För den rumsliga MMSI-uppgiften fick båda baslinjerna ungefär lika mycket datorkraft som ReImaGin: 20 svar genererades från varje baslinje och det svar som förekom oftast användes.

Prestandan mättes med flervalsnoggrannhet för alla uppgifter utom räkning vid skymning, som bedömdes med symmetriskt genomsnittligt absolut procentfel genom att jämföra förutsagt och faktiskt antal objekt. Resultaten beräknades som medelvärde över tre körningar, och standardfelet rapporterades också.

Testresultat som jämför ReImaGin med No Tools och Visual Sketchpad för tre VLM:er och sex visuella resonemangsuppgifter. Högre poäng är bättre, utom vid räkning av skymda objekt, där ett lägre fel är bättre. ReImaGin uppnådde bäst resultat i de flesta kombinationer av modell och uppgift.

Testresultat som jämför ReImaGin med No Tools och Visual Sketchpad för tre VLM:er och sex visuella resonemangsuppgifter. Högre poäng är bättre, utom vid räkning av skymda objekt, där ett lägre fel är bättre. ReImaGin uppnådde bäst resultat i de flesta kombinationer av modell och uppgift.

Samma människodefinierade strategiexempel användes för alla tre modellerna. ReImaGin gav bättre resultat än båda baslinjerna i de flesta uppgifter, med särskilt tydliga förbättringar för pusselkomplettering, räkning vid skymning och vägspårning.

Med GPT-5 ökade exempelvis pusselnoggrannheten från 29,5% med No Tools och 16,7% med Visual Sketchpad till 44,9% med ReImaGin. Ablationstester bekräftade att den generativa bildkomponenten är avgörande för systemets prestanda.

Bildgeneratorer med öppna vikter testades också i stället för Nano-Banana-Pro. FLUX.2 [dev] och Qwen-Image-Edit-2511 gav jämförbara resultat i vissa enklare uppgifter, särskilt inpainting, men var mindre konsekventa i mer krävande omvandlingar som djupskattning och vägspårning. Liknande resultat erhölls när Qwen-3.5-27B användes som VLM:

Testresultat som jämför bildgeneratorer med Qwen-3.5-27B som VLM. Nano-Banana-Pro uppnådde bäst resultat i fem av sex uppgifter, medan FLUX.2 [dev] och Qwen-Image-Edit-2511 förbättrade resultaten jämfört med No Tools i flera uppgifter.

Testresultat som jämför bildgeneratorer med Qwen-3.5-27B som VLM. Nano-Banana-Pro uppnådde bäst resultat i fem av sex uppgifter, medan FLUX.2 [dev] och Qwen-Image-Edit-2511 förbättrade resultaten jämfört med No Tools i flera uppgifter.

Författarna genomförde också kvalitativa tester på fyra uppgifter:

Kvalitativa exempel från fyra uppgifter visar hur ReImaGin användes för att stärka Gemini-3.1-Pros resonemang. I varje fall införlivades genererade visuella representationer i resonemangsprocessen för att hjälpa till att lösa uppgiften.

Kvalitativa exempel från fyra uppgifter visar hur ReImaGin användes för att stärka Gemini-3.1-Pros resonemang. I varje fall införlivades genererade visuella representationer i resonemangsprocessen för att hjälpa till att lösa uppgiften.

ReImaGin var inte tillförlitligt i alla fall. I vissa situationer skapade bildgeneratorn en felaktig omvandling, till exempel en planritning där objekt låg på fel platser. I andra fall misstolkades en korrekt genererad bild senare av VLM:n.

Vid en manuell granskning av 120 genererade bilder visade det sig att 75% troget hade utfört den begärda omvandlingen. När detta lyckades var det slutliga svaret korrekt i 87% av fallen, jämfört med 43% när den genererade bilden var felaktig.

Författarna drar slutsatsen:

”Våra resultat pekar på två bredare slutsatser. För det första kan bildgenerering fungera som en allmän mekanism för visuell föreställningsförmåga inom multimodalt resonemang, vilket minskar behovet av att utveckla ett separat verktyg för varje ny omvandling.”

”För det andra beror metodens effektivitet inte bara på de underliggande modellerna utan också på den resonemangsstrategi som används för att bestämma vad som ska visualiseras och hur resultatet ska användas.”

”Förbättringarna från automatisk strategiupptäckt visar att modellerna kan använda sin förståelse av visuella omvandlingar för att hitta relevanta strategier utan människoskrivna uppgiftsspecifika strategier eller resonemang.”

Slutsats

Självständiga beslut om verktygsanvändning av det slag som undersöks i denna studie är en fascinerande utveckling, inte minst eftersom VLM-utvecklingen ändå tycks röra sig naturligt i den riktningen. Jag är nyfiken på om sådana allmänna VLM:er till slut kommer att prestera lika bra som särskilda verktyg och ramverk, exempelvis Segment-ekosystemet, och om de som uteslutande arbetar med dessa ”sidouppgifter” därmed kan komma att skjuta mygg med kanon.

Det är ändå svårt att tro att VLM:er skulle kunna utveckla den disciplin som krävs för att gå om och behålla ett försprång framför särskilda lösningar som lokal finjustering, där en hel modell ägnas åt en enda uppgift och ofta blir oanvändbar för allt annat under processen. Tiden får utvisa.

 

* En möjlig definition av bilddomänen, som vi lär oss långt innan vi får några språkliga färdigheter.

Först publicerad måndagen den 28 september 2026

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai