Andersons hoek

AI die beelden gebruikt bij Chain-of-Thought-redeneren (CoT)

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
Derived from René Magritte, La condition humaine (The Human Condition), 1933. © Photothèque R. Magritte / ADAGP / DACS Images. Collection: National Gallery of Art, Washington. Extended laterally by GPT Image 2.

We denken vaak in beelden — de meesten van ons althans: bij mensen is een verminderd vermogen tot visuele verbeelding volgens onderzoek gekoppeld aan slechtere schoolprestaties. Bij het onthouden van informatie — onze behoefte om dingen te herinneren, niet het gevreesde AI-probleem — wordt de aanzienlijke semantische kracht van sterke of levendige beelden al millennia gebruikt als hulpmiddel bij het leren:

Emma Willards ‘Temple of Time’ (1846), een educatieve visualisatie die chronologie omzet in fysieke ruimte en historische perioden en personen rangschikt binnen een terugwijkend architectonisch perspectief. Willard ontwierp zulke beelden als visuele geheugensteunen, omdat ze geloofde dat grafische voorstellingen leerlingen konden helpen een samenhangend mentaal beeld van de geschiedenis te vormen. Bron – https://publicdomainreview.org/essay/emma-willard-maps-of-time/

Emma Willards ‘Temple of Time’ (1846), een educatieve visualisatie die chronologie omzet in fysieke ruimte en historische perioden en personen rangschikt binnen een terugwijkend architectonisch perspectief. Willard ontwierp zulke beelden als visuele geheugensteunen, omdat ze geloofde dat grafische voorstellingen leerlingen konden helpen een samenhangend mentaal beeld van de geschiedenis te vormen. Bron

Het vakgebied van de mnemoniek gaat echter over de opname van gegevens en niet over verwerking of interpretatie, waarbij mensen sterk verschillen in de denkstijlen waarop ze terugvallen.

Persoonlijk denk ik in vormen, en dat doe ik zolang ik me kan herinneren: decennia, jaren, ideeën en mensen worden op de een of andere manier weergegeven door relatieve geometrie en dynamische volumeblokken. Anderen denken voornamelijk in getallen; weer anderen in geuren of smaken.

Voor AI is het mogelijke scala aan synesthesiemethoden beperkter. Een groot taalmodel (LLM) kan uiteraard in tekst denken, omdat dit boven het niveau van embeddings zijn eigen coderingstype is. Van LLM’s is bovendien aangetoond dat ze getallen als concepten coderen in plaats van als zuivere variabele waarden, wat wijst op een neiging om ‘in getallen te denken’.

Maar in hoeverre kan van een LLM worden gezegd dat het ‘in vormen’ of ‘in beelden’ denkt, zoals mensen vaak doen?

Het feit dat een LLM op dezelfde vraag in verschillende talen andere antwoorden geeft, betekent dat die relaties zeer specifiek en kwetsbaar kunnen zijn en vast aan specifieke tekst gekoppeld kunnen zijn binnen een taaldomein — bijvoorbeeld ‘Spaans’ — in plaats van een hoger domein aan te spreken dat taal overstijgt en tegelijk bevat.*

Daarom zou een multimodaal LLM — een Vision Language Model of VLM — dat beelden kan genereren uitsluitend voor zijn eigen interne gedachteketen (Chain of Thought, CoT) logischerwijs een voordeel kunnen hebben, of op zijn minst letterlijk een ander gezichtspunt.

Nieuwe gezichtspunten

Met dit in gedachten heeft een recente Duitse onderzoekssamenwerking een beeldgericht VLM voorgesteld met de naam ReImaGin, dat beeldgeneratie inzet als een vormbaar redeneermechanisme.

Hoewel eerder werk beeldgebaseerde onderdelen had ‘aangebouwd’, waren die functies niet intrinsiek of essentieel voor de centrale workflow. Het nieuwe systeem van de auteurs is daarentegen ontworpen om de zeer recente mogelijkheden van VLM’s te benutten en de functie over te nemen van gespecialiseerde hulpmiddelen en methoden, zoals dieptewaarneming.

In het onderstaande voorbeeld uit de nieuwe publicatie, getiteld Reasoning with Image Generation, moet de AI twee aanzichten interpreteren — de twee afbeeldingen uiterst links — die geen van beide alle informatie bevatten die nodig is om een taak op te lossen. Het model kan de beschikbare informatie daarom gebruiken om een ruimer en vollediger beeld van de scène te interpreteren: de kaart met het onderschrift ‘Generated Visualization’, hieronder de derde afbeelding van links.

Een voorbeeld uit de nieuwe publicatie waarin ReImaGin uit twee onvolledige aanzichten een kaart van bovenaf genereert, zodat het model een uniforme visuele voorstelling krijgt van waaruit het kan redeneren. Bron – https://arxiv.org/pdf/2609.16409

Een voorbeeld uit de nieuwe publicatie waarin ReImaGin uit twee onvolledige aanzichten een kaart van bovenaf genereert, zodat het model een uniforme visuele voorstelling krijgt van waaruit het kan redeneren. Bron

ReImaGin is niet aan één bepaald type visuele transformatie gebonden. Het kan ontbrekende puzzelgebieden aanvullen, occlusies verwijderen om objecten te tellen, trajecten tekenen voor botsingsvoorspellingen, meerdere aanzichten combineren tot ruimtelijke kaarten, gestippelde paden omzetten in doorgetrokken lijnen om ze te volgen en dieptekaarten genereren voor diepteredenering.

Belangrijker is dat het systeem zijn eigen gebruik van deze interne gereedschapsset kan regelen, in lijn met recente opkomende mogelijkheden van VLM’s om bepaalde uitdagingen automatisch met geschikte hulpmiddelen aan te pakken, zoals diepteschatting. De meeste beschreven functies van ReImaGin worden opgeroepen met het hulpmiddel generate_image, een functie die waar nodig visueel kan ingrijpen zonder menselijk toezicht of menselijke activering.

De auteurs schrijven:

‘Omdat generate_image willekeurige instructies in natuurlijke taal accepteert, kan de agent een enorm scala aan transformaties uitvoeren. De vraag is welke transformatie bij een bepaalde taak werkelijk helpt.’

‘De [standaard]praktijk is om de transformatie te specificeren met handmatig gemaakte voorbeelden in de context die de gewenste strategie demonstreren — bijvoorbeeld een dieptekaart genereren voor diepteredenering. Dit vraagt handmatig werk per taak en beperkt de generalisatie naar nieuwe taken.’

‘[Wij] vragen of zulke strategieën automatisch kunnen worden ontdekt. Omdat de strategie via de prompt aan de agent wordt overgebracht, komt het ontdekken van een strategie neer op het optimaliseren van de prompt: we zetten een iteratieve lus op waarin een voorstelmodel kandidaatprompts genereert, die op een kleine ontwikkelset beoordeelt en ze verfijnt op basis van waargenomen successen en mislukkingen.’

ReImaGin werd getest met drie VLM’s en zes visuele redeneertaken en presteerde met slechts één hulpmiddel in het algemeen beter dan zowel redeneren zonder hulp als gespecialiseerde vision-tools.

De aanpak

ReImaGin werkt als een lus: bij elke stap bekijkt het VLM de vraag, de oorspronkelijke beelden en alles wat het al heeft gegenereerd, en beslist het wat vervolgens moet gebeuren. Dat kan een gewone beeldbewerking zijn, zoals bijsnijden of overlappen, of een aanroep van generate_image, dat een nieuwe afbeelding maakt die specifiek bedoeld is om gemakkelijker over het probleem te kunnen redeneren:

Een stapsgewijze illustratie van hoe ReImaGin ruimtelijke problemen en visuele puzzels doorredeneert. In beide voorbeelden genereert het model tijdens het redeneren een nieuwe afbeelding en gebruikt die vervolgens als extra invoer voor latere stappen naar het antwoord.

Een stapsgewijze illustratie van hoe ReImaGin ruimtelijke problemen en visuele puzzels doorredeneert. In beide voorbeelden genereert het model tijdens het redeneren een nieuwe afbeelding en gebruikt die vervolgens als extra invoer voor latere stappen naar het antwoord.

De gegenereerde afbeelding wordt vervolgens teruggevoerd naar het VLM en wordt onderdeel van het materiaal dat voor de volgende redeneerstap beschikbaar is. Het proces kan zich daarna herhalen. In de bovenstaande afbeelding zijn deze aspecten voor de ruimtelijke taak te zien: het model combineert eerst twee foto’s tot één aanzicht en verandert dat resultaat vervolgens in een kaart van bovenaf voordat het de vraag beantwoordt.

Voor de puzzeltaak genereert het een aangepaste versie van de puzzel waarin het ontbrekende gebied wordt geïsoleerd, en gebruikt het daarna conventionele beeldaftrekking om het antwoord te bepalen.

Zo wordt beeldgeneratie onderdeel van het redeneerproces zelf en geen eindproduct voor de gebruiker. Deze tussenliggende beelden zijn uitsluitend bedoeld voor de CoT-processen van de AI en niet voor rechtstreekse consumptie door de eindgebruiker.

In elke ronde kiest het VLM zijn eigen volgende actie uit de tot dan toe opgebouwde context. Die actie kan een volgende redeneerstap zijn, een conventionele beeldbewerking of een instructie in natuurlijke taal aan generate_image. Alles wat het gekozen hulpmiddel teruggeeft, wordt aan de context toegevoegd. Het model kan het resultaat daardoor bekijken en beslissen of het dat opnieuw moet transformeren, een ander hulpmiddel moet gebruiken of moet doorgaan naar het definitieve antwoord.

Meer zelfstandigheid

Een centraal probleem is bepalen welk soort afbeelding een bepaalde taak werkelijk gemakkelijker zou maken. ReImaGin beslist dit door met verschillende instructies voor de agent te experimenteren, kandidaatprompts te testen op voorbeelden met bekende antwoorden en geslaagde en mislukte pogingen te gebruiken om betere prompts te verkrijgen. Verdere iteraties van deze lus leveren uiteindelijk de best presterende strategieën op.

Het redeneermodel en de beeldgenerator zelf worden tijdens dit proces niet opnieuw getraind. Alleen de instructies die bepalen hoe de agent zijn hulpmiddelen gebruikt, worden geoptimaliseerd. De onderzoekers beschrijven het proces daarom als ‘geautomatiseerde ontdekking’ van visuele redeneerstrategieën, zonder zelf taakspecifieke strategieën of redeneervoorbeelden aan te leveren.

Configuratie en tests

ReImaGin werd geëvalueerd op zes visuele redeneertaken: diepteredenering (Blink — bepalen welk van twee punten dichter bij de camera ligt), puzzelvoltooiing (Mira — het juiste stukje kiezen voor een ontbrekend beeldgebied), tellen bij occlusie (CAPTURe — objecten tellen, ook verborgen objecten), botsingsvoorspelling (Spatial457 — voorspellen welk object door een bewegend doel zal worden geraakt), ruimtelijk redeneren (MMSI — relaties tussen objecten in verschillende aanzichten bepalen) en pad volgen, een nieuwe benchmark waarbij modellen gestippelde lijnen moeten volgen die cijfers met letters verbinden.

Opvallende voorbeelden van visuele beelden in gedachteketenprocessen uit de publicatie ‘MIRA, a Benchmark for Visual Chain-of-Thought’. Bron – https://arxiv.org/pdf/2511.02779

Opvallende voorbeelden van visuele beelden in gedachteketenprocessen uit de publicatie ‘MIRA, a Benchmark for Visual Chain-of-Thought’. Bron

De geteste VLM-basismodellen waren Gemini-3.1-Pro, GPT-5 en het open-weights-model Qwen-3.5-27B. Voor de beeldgeneratie werd voornamelijk Nano-Banana-Pro gebruikt; daarnaast werden de open-weights-modellen FLUX.2 [dev] en Qwen-Image-Edit-2511 getest. Gemini-3.1-Pro werd gebruikt als selector voor het schalen van beeldgeneratie tijdens de test.

Van de twee vergelijkingsbaselines beantwoordde het gewone VLM, door de auteurs ‘No Tools’ genoemd, vragen rechtstreeks op basis van de query en de afbeeldingen, zonder hulpmiddelen of code-uitvoering. Visual Sketchpad uit 2024 bood in dit geval een vaste reeks gespecialiseerde hulpmiddelen voor computervisie en beeldmanipulatie, maar geen vrije beeldgeneratie.

Voor de ruimtelijke MMSI-taak kregen beide baselines ongeveer evenveel rekenkracht als ReImaGin: van elke baseline werden 20 antwoorden gegenereerd en het vaakst voorkomende antwoord werd gebruikt.

De prestaties werden voor alle taken behalve tellen bij occlusie gemeten aan de hand van nauwkeurigheid bij meerkeuzevragen. Tellen bij occlusie werd beoordeeld met de symmetrische gemiddelde absolute procentuele fout, waarbij voorspelde en werkelijke aantallen objecten werden vergeleken. De resultaten werden gemiddeld over drie runs en ook de standaardfout werd gerapporteerd.

Testresultaten waarin ReImaGin wordt vergeleken met No Tools en Visual Sketchpad bij drie VLM’s en zes visuele redeneertaken. Hogere scores zijn beter, behalve bij tellen onder occlusie, waar een lagere fout beter is. ReImaGin behaalde het beste resultaat bij de meerderheid van de model-taakcombinaties.

Testresultaten waarin ReImaGin wordt vergeleken met No Tools en Visual Sketchpad bij drie VLM’s en zes visuele redeneertaken. Hogere scores zijn beter, behalve bij tellen onder occlusie, waar een lagere fout beter is. ReImaGin behaalde het beste resultaat bij de meerderheid van de model-taakcombinaties.

Bij alle drie de modellen werden dezelfde door mensen gedefinieerde strategievoorbeelden gebruikt. ReImaGin leverde bij de meeste taken betere resultaten dan beide baselines, met bijzonder duidelijke verbeteringen bij puzzelvoltooiing, tellen bij occlusie en paden volgen.

Met GPT-5 steeg de puzzelnauwkeurigheid bijvoorbeeld van 29,5% met No Tools en 16,7% met Visual Sketchpad naar 44,9% met ReImaGin. Ablatietests bevestigden dat de generatieve beeldcomponent essentieel is voor de prestaties van het systeem.

Er werden ook open-weights-beeldgeneratoren getest in plaats van Nano-Banana-Pro. FLUX.2 [dev] en Qwen-Image-Edit-2511 leverden bij enkele eenvoudigere taken vergelijkbare resultaten, met name bij inpainting, maar waren minder consistent bij veeleisender transformaties zoals diepteschatting en paden volgen. Vergelijkbare resultaten werden verkregen toen Qwen-3.5-27B als VLM werd gebruikt:

Testresultaten waarin beeldgeneratoren worden vergeleken met Qwen-3.5-27B als VLM. Nano-Banana-Pro behaalde het beste resultaat bij vijf van de zes taken, terwijl FLUX.2 [dev] en Qwen-Image-Edit-2511 bij verschillende taken beter presteerden dan No Tools.

Testresultaten waarin beeldgeneratoren worden vergeleken met Qwen-3.5-27B als VLM. Nano-Banana-Pro behaalde het beste resultaat bij vijf van de zes taken, terwijl FLUX.2 [dev] en Qwen-Image-Edit-2511 bij verschillende taken beter presteerden dan No Tools.

De auteurs voerden ook kwalitatieve tests uit voor vier taken:

Kwalitatieve voorbeelden voor vier taken laten zien hoe ReImaGin werd gebruikt om het redeneervermogen van Gemini-3.1-Pro te versterken. In elk geval werden gegenereerde visuele voorstellingen in het redeneerproces opgenomen om de taak te helpen oplossen.

Kwalitatieve voorbeelden voor vier taken laten zien hoe ReImaGin werd gebruikt om het redeneervermogen van Gemini-3.1-Pro te versterken. In elk geval werden gegenereerde visuele voorstellingen in het redeneerproces opgenomen om de taak te helpen oplossen.

ReImaGin was niet in alle gevallen betrouwbaar. In sommige omstandigheden produceerde de beeldgenerator een onjuiste transformatie, zoals een plattegrond met objecten op de verkeerde plaatsen. In andere gevallen werd een correct gegenereerde afbeelding daarna verkeerd gelezen door het VLM.

Bij een handmatige controle van 120 gegenereerde afbeeldingen bleek 75% de gevraagde transformatie getrouw te hebben uitgevoerd. Wanneer dat lukte, was het definitieve antwoord in 87% van de gevallen correct, tegenover 43% wanneer de gegenereerde afbeelding onnauwkeurig was.

De auteurs concluderen:

‘Onze resultaten wijzen op twee bredere conclusies. Ten eerste kan beeldgeneratie binnen multimodaal redeneren dienen als een algemeen mechanisme voor visuele verbeelding, waardoor er minder behoefte is om voor elke nieuwe transformatie een afzonderlijk hulpmiddel te ontwikkelen.’

‘Ten tweede hangt de effectiviteit van deze aanpak niet alleen af van de onderliggende modellen, maar ook van de redeneerstrategie waarmee wordt bepaald wat moet worden gevisualiseerd en hoe het resultaat moet worden gebruikt.’

‘De verbeteringen door automatische strategieontdekking laten zien dat de modellen hun begrip van visuele transformaties kunnen benutten om relevante strategieën te ontdekken zonder door mensen geschreven taakspecifieke strategieën of redeneringen.’

Conclusie

Beslissingen over zelfstandig gebruik van hulpmiddelen zoals die in dit onderzoek zijn onderzocht, vormen een fascinerende ontwikkeling, niet in de laatste plaats omdat de ontwikkeling van VLM’s sowieso op natuurlijke wijze in deze richting lijkt te evolueren. Ik ben benieuwd of zulke universele VLM’s uiteindelijk even goed zullen presteren als speciale hulpmiddelen en raamwerken zoals het Segment-ecosysteem, en of degenen die zich uitsluitend met deze ‘neventaken’ bezighouden uiteindelijk een kanon gebruiken om een mug te doden.

Het is tamelijk moeilijk te geloven dat VLM’s de vereiste discipline kunnen ontwikkelen om speciale oplossingen zoals lokale fijnafstemming in te halen en een voorsprong te behouden. Daarbij wordt een heel model aan één taak gewijd en wordt het tijdens dat proces vaak onbruikbaar voor elke andere toepassing. De tijd zal het leren.

 

* Een verdedigbare definitie van het domein van beeldvorming, dat we lang leren voordat we enige taalvaardigheid opdoen.

Voor het eerst gepubliceerd op maandag 28 september 2026

Schrijver over machine learning, domeinspecialist in menselijke beeldsynthetisatie. Voormalig hoofd van onderzoekscontent bij Metaphysic.ai, tot de ontbinding ervan in DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai