Andersons vinkel
AI, der bruger billeder i Chain-of-Thought-ræsonnering (CoT)

Vi tænker ofte i billeder – de fleste af os gør i hvert fald: Hos mennesker er en nedsat evne til visuel forestilling ifølge forskning forbundet med dårligere akademiske resultater. Når det gælder memorering – vores behov for at huske ting, ikke AI-problemet – er den betydelige semantiske kraft i stærke eller levende billeder blevet brugt i årtusinder som hjælp til indlæring:

Emma Willards ‘Temple of Time’ (1846), en undervisningsvisualisering, der forvandler kronologi til fysisk rum og placerer historiske perioder og personer i et arkitektonisk perspektiv, der trækker sig tilbage. Willard udformede sådanne billeder som visuelle huskemidler, fordi hun mente, at grafiske fremstillinger kunne hjælpe elever med at danne et sammenhængende mentalt billede af historien. Kilde
Mnemoteknik handler dog om indtagelse af data frem for behandling eller fortolkning, hvor mennesker varierer betydeligt i de tankestile, de gør brug af.
Personligt tænker jeg i former, og det har jeg gjort, så længe jeg har tænkt: Årtier, år, idéer og mennesker bliver på en eller anden måde repræsenteret gennem relativ geometri og dynamiske volumenblokke. Andre tænker primært i tal, og atter andre i lugte eller smage.
For AI er det mulige udvalg af synæstetiske metoder mere begrænset. En stor sprogmodel (LLM) kan naturligvis tænke i tekst, da dette er dens oprindelige kodningstype over niveauet for embeddings. Det er desuden blevet vist, at LLM’er koder tal som begreber frem for rene variabelværdier, hvilket viser en tilbøjelighed til at “tænke i tal”.
Men i hvilken grad kan man sige, at en LLM “tænker i former” eller “tænker i billeder”, sådan som mennesker ofte gør?
At man får forskellige svar fra en LLM på det samme spørgsmål stillet på forskellige sprog, viser, at disse relationer kan være meget specifikke og skrøbelige og fast knyttet til en bestemt tekst i et sprogligt domæne – for eksempel “spansk” – i stedet for at adressere et højere domæne, som overskrider og samtidig indeholder sprog.*
Derfor kan en multimodal LLM – det vil sige en vision-sprogmodel eller VLM – der kan generere billeder udelukkende til sin egen interne tankekæde (Chain of Thought, CoT), logisk set have en fordel eller i det mindste bogstaveligt talt et alternativt synspunkt.
Nye synsvinkler
Med dette in mente har et nyt tysk forskningssamarbejde præsenteret en billedfokuseret VLM ved navn ReImaGin, som anvender billedgenerering som en formbar ræsonneringsmekanisme.
Selv om tidligere arbejde har “boltet” billedbaserede komponenter på, var disse funktioner hverken indbyggede eller nødvendige for den centrale arbejdsgang. Forfatternes nye system er derimod udviklet til at udnytte VLM’ers helt nye evner til at overtage funktionaliteten fra specialiserede værktøjer og metoder, såsom dybdeopfattelse.
I eksemplet nedenfor fra den nye artikel med titlen Reasoning with Image Generation skal AI’en fortolke to synsvinkler – billederne længst til venstre – hvoraf ingen rummer alle de oplysninger, der er nødvendige for at løse en opgave. Modellen kan derfor bruge de oplysninger, den har, til at fortolke et bredere og mere komplet billede af scenen: Kortet med underteksten “Generated Visualization”, det tredje billede fra venstre nedenfor.

Et eksempel fra den nye artikel, hvor ReImaGin genererer et kort set ovenfra ud fra to ufuldstændige synsvinkler og giver modellen en samlet visuel repræsentation at ræsonnere ud fra. Kilde
ReImaGin er ikke bundet til én bestemt type visuel transformation. Systemet kan udfylde manglende områder i puslespil, fjerne skjulte områder for at tælle objekter, tegne baner til forudsigelse af sammenstød, kombinere flere synsvinkler til rumlige kort, omdanne stiplede ruter til sammenhængende linjer, der kan følges, og generere dybdekort til dybderæsonnering.
Vigtigere er det, at systemet selv kan regulere sin brug af dette interne værktøjssæt, i tråd med VLM’ers nye evner til automatisk at håndtere bestemte udfordringer med passende værktøjer, såsom dybdeestimering. Det meste af ReImaGins beskrevne funktionalitet aktiveres gennem kald til værktøjet generate_image, en funktion, der kan gribe visuelt ind efter behov uden menneskeligt tilsyn eller aktivering.
Forfatterne skriver:
“Fordi generate_image accepterer vilkårlige instruktioner i naturligt sprog, kan agenten udføre et enormt udvalg af transformationer. Spørgsmålet er, hvilken transformation der faktisk hjælper ved en given opgave.”
“[Standard]praksis er at specificere transformationen gennem håndlavede eksempler i konteksten, som demonstrerer den ønskede strategi – for eksempel at generere et dybdekort til dybderæsonnering. Det kræver manuelt arbejde for hver opgave og begrænser generalisering til nye opgaver.”
“[Vi] spørger, om sådanne strategier kan opdages automatisk. Da strategien formidles til agenten gennem dens prompt, kan opdagelse af en strategi reduceres til optimering af prompten: Vi etablerer et iterativt kredsløb, hvor en forslagsmodel genererer kandidatprompter, evaluerer dem på et lille udviklingssæt og forbedrer dem ud fra observerede succeser og fejl.”
ReImaGin blev testet på tværs af tre VLM’er og seks visuelle ræsonneringsopgaver og klarede sig generelt bedre end både ræsonnering uden hjælpemidler og specialiserede synsværktøjer, samtidig med at systemet kun brugte ét værktøj.
Tilgangen
ReImaGin fungerer som et kredsløb: Ved hvert trin overvejer VLM’en spørgsmålet, de oprindelige billeder og alt, hvad den allerede har genereret, og beslutter, hvad der skal ske derefter. Det kan omfatte almindelige billedoperationer som beskæring eller overlejring eller et kald til generate_image, som skaber et nyt billede, der specifikt skal gøre problemet lettere at ræsonnere over:

En trinvis illustration af, hvordan ReImaGin ræsonnerer sig gennem rumlige problemer og visuelle puslespil. I begge eksempler genererer modellen et nyt billede under ræsonneringen og bruger derefter billedet som ekstra input til de efterfølgende trin frem mod svaret.
Det genererede billede føres derefter tilbage til VLM’en og bliver en del af det materiale, der er til rådighed for næste ræsonneringstrin, hvorefter processen kan gentages. På billedet ovenfor ser vi disse dele illustreret for den rumlige opgave: Modellen kombinerer først to fotografier til én samlet visning og omdanner derefter resultatet til et kort set ovenfra, før den besvarer spørgsmålet.
Til puslespilsopgaven genererer den en ændret version af puslespillet, der isolerer det manglende område, og bruger derefter almindelig billedsubtraktion til at finde svaret.
På denne måde bliver billedgenerering en del af selve ræsonneringsprocessen i stedet for et slutprodukt til brugeren. Disse mellemliggende billeder er faktisk udelukkende beregnet til AI’ens CoT-processer og ikke til direkte brug for slutbrugeren.
Ved hver omgang vælger VLM’en selv sin næste handling ud fra den hidtil akkumulerede kontekst. Handlingen kan være endnu et ræsonneringstrin, en traditionel billedoperation eller en instruktion i naturligt sprog til generate_image. Alt, hvad det valgte værktøj returnerer, føjes til konteksten, så modellen kan undersøge resultatet og beslutte, om det skal transformeres igen, om et andet værktøj skal anvendes, eller om den skal gå videre til sit endelige svar.
Større handlekraft
Et centralt problem er at beslutte, hvilken slags billede der rent faktisk ville gøre en bestemt opgave lettere. ReImaGin afgør dette ved at eksperimentere med forskellige instruktioner til agenten, teste kandidatprompter på eksempler med kendte svar og bruge vellykkede og mislykkede forsøg til at opnå bedre prompter. Yderligere iterationer af dette kredsløb frembringer til sidst de mest effektive strategier.
Selve ræsonneringsmodellen og billedgeneratoren genoptrænes ikke under processen. Det er kun instruktionerne, der styrer, hvordan agenten bruger sine værktøjer, som optimeres. Forskerne beskriver derfor processen som “automatisk opdagelse” af visuelle ræsonneringsstrategier, uden at de selv leverer opgavespecifikke strategier eller ræsonneringseksempler.
Konfiguration og test
ReImaGin blev evalueret på seks visuelle ræsonneringsopgaver: dybderæsonnering (Blink – at afgøre, hvilket af to punkter der er tættest på kameraet), færdiggørelse af puslespil (Mira – at vælge den rigtige brik til et manglende billedområde), optælling med skjulte objekter (CAPTURe – at tælle objekter, inklusive skjulte objekter), forudsigelse af sammenstød (Spatial457 – at forudsige, hvilket objekt et bevægeligt mål vil ramme), rumlig ræsonnering (MMSI – at bestemme relationer mellem objekter på tværs af forskellige synsvinkler) og rutesporing – en ny benchmark, hvor modeller skal følge stiplede linjer, der forbinder tal med bogstaver.

Slående eksempler på visuelle billeder i tankekædeprocesser fra artiklen ‘MIRA, a Benchmark for Visual Chain-of-Thought’. Kilde
De testede VLM-grundmodeller var Gemini-3.1-Pro, GPT-5 og modellen med åbne vægte Qwen-3.5-27B. Billedgenereringen blev primært udført af Nano-Banana-Pro, mens modellerne med åbne vægte FLUX.2 [dev] og Qwen-Image-Edit-2511 også blev testet. Gemini-3.1-Pro blev brugt som udvælger til skalering af billedgenerering under testen.
Af de to sammenligningsgrundlag besvarede den almindelige VLM, som artiklens forfattere kaldte “No Tools”, spørgsmål direkte ud fra forespørgslen og billederne uden værktøjer eller kodekørsel. Visual Sketchpad fra 2024 tilbød i dette tilfælde et fast sæt specialiserede værktøjer til syn og billedmanipulation, men ingen åben billedgenerering.
Til den rumlige MMSI-opgave fik begge sammenligningssystemer omtrent samme mængde computerkraft som ReImaGin: Der blev genereret 20 svar fra hvert system, og det svar, der optrådte oftest, blev anvendt.
Ydelsen blev målt ved hjælp af nøjagtighed i multiple choice for alle opgaver undtagen optælling med skjulte objekter, som blev vurderet med den symmetriske gennemsnitlige absolutte procentfejl ved at sammenligne forudsagte og faktiske antal objekter. Resultaterne blev beregnet som gennemsnit af tre kørsler, og standardfejlen blev også rapporteret.

Testresultater, der sammenligner ReImaGin med No Tools og Visual Sketchpad på tværs af tre VLM’er og seks visuelle ræsonneringsopgaver. Højere point er bedre undtagen ved optælling med skjulte objekter, hvor en lavere fejl er bedre. ReImaGin opnåede det bedste resultat i de fleste kombinationer af model og opgave.
De samme menneskedefinerede strategieksempler blev brugt på tværs af alle tre modeller. ReImaGin leverede bedre resultater end begge sammenligningssystemer på de fleste opgaver, med særligt tydelige forbedringer ved færdiggørelse af puslespil, optælling med skjulte objekter og rutesporing.
Med GPT-5 steg nøjagtigheden i puslespil for eksempel fra 29,5% med No Tools og 16,7% med Visual Sketchpad til 44,9% med ReImaGin. Ablationstest bekræftede, at den generative billedkomponent er afgørende for systemets ydeevne.
Der blev også testet billedgeneratorer med åbne vægte i stedet for Nano-Banana-Pro. FLUX.2 [dev] og Qwen-Image-Edit-2511 leverede sammenlignelige resultater på nogle enklere opgaver, især inpainting, men var mindre stabile ved mere krævende transformationer som dybdeestimering og rutesporing. Lignende resultater blev opnået, da Qwen-3.5-27B blev brugt som VLM:
![Testresultater, der sammenligner billedgeneratorer med Qwen-3.5-27B som VLM. Nano-Banana-Pro opnåede det bedste resultat på fem ud af seks opgaver, mens FLUX.2 [dev] og Qwen-Image-Edit-2511 forbedrede resultaterne i forhold til No Tools på flere opgaver.](https://www.unite.ai/wp-content/uploads/2026/09/table-6-1.jpg)
Testresultater, der sammenligner billedgeneratorer med Qwen-3.5-27B som VLM. Nano-Banana-Pro opnåede det bedste resultat på fem ud af seks opgaver, mens FLUX.2 [dev] og Qwen-Image-Edit-2511 forbedrede resultaterne i forhold til No Tools på flere opgaver.
Forfatterne udførte også kvalitative test på fire opgaver:

Kvalitative eksempler på tværs af fire opgaver viser, hvordan ReImaGin blev brugt til at udvide Gemini-3.1-Pros ræsonnering. I hvert tilfælde blev genererede visuelle repræsentationer indarbejdet i ræsonneringsprocessen for at hjælpe med at løse opgaven.
ReImaGin var ikke pålidelig i alle tilfælde. I nogle situationer fremstillede billedgeneratoren en unøjagtig transformation, såsom en plantegning med objekter på de forkerte steder. I andre tilfælde blev et korrekt genereret billede efterfølgende aflæst forkert af VLM’en.
Ved en manuel gennemgang af 120 genererede billeder viste det sig, at 75% trofast havde udført den ønskede transformation. Når det lykkedes, var det endelige svar korrekt i 87% af tilfældene sammenlignet med 43%, når det genererede billede var unøjagtigt.
Forfatterne konkluderer:
“Vores resultater peger på to bredere konklusioner. For det første kan billedgenerering fungere som en generel mekanisme for visuel forestillingsevne inden for multimodal ræsonnering, hvilket reducerer behovet for at udvikle et særskilt værktøj til hver ny transformation.”
“For det andet afhænger denne tilgangs effektivitet ikke kun af de underliggende modeller, men også af den ræsonneringsstrategi, der bruges til at beslutte, hvad der skal visualiseres, og hvordan resultatet skal anvendes.”
“Forbedringerne fra automatisk strategiopdagelse viser, at modellerne kan udnytte deres forståelse af visuelle transformationer til at opdage relevante strategier uden menneskeskrevne opgavespecifikke strategier eller ræsonneringer.”
Konklusion
Selvstændige beslutninger om værktøjsbrug af den type, som denne undersøgelse ser på, er en fascinerende udvikling, ikke mindst fordi VLM-udviklingen tilsyneladende helt naturligt bevæger sig i denne retning. Jeg er nysgerrig efter at se, om sådanne alsidige VLM’er med tiden vil klare sig lige så godt som dedikerede værktøjer og rammeværk såsom Segment-økosystemet, og om dem, der udelukkende arbejder med disse “sideopgaver”, derfor ender med at skyde gråspurve med kanoner.
Det er dog svært at tro, at VLM’er kan udvikle den nødvendige disciplin til at overhale og bevare et forspring i forhold til dedikerede løsninger som lokal finjustering, hvor en hel model helliges én opgave og ofte bliver ubrugelig til alt andet i processen. Tiden må vise det.
* En mulig definition af billeddomænet, som vi lærer længe før, vi tilegner os sproglige færdigheder.
Først udgivet mandag den 28. september 2026












