Andersons Blickwinkel
KI, die Bildsprache für Chain-of-Thought-(CoT)-Schlussfolgerungen nutzt

Wir denken oft in Bildern – nun ja, die meisten von uns: Bei Menschen ist eine eingeschränkte Fähigkeit zur visuellen Vorstellung laut Forschungsergebnissen mit geringerer akademischer Leistung verbunden. Beim Einprägen von Informationen – unserem Bedürfnis, uns Dinge zu merken, nicht dem KI-Schreckgespenst – wird die beträchtliche semantische Kraft starker oder lebhafter Bilder seit Jahrtausenden als Lernhilfe genutzt:

Emma Willards „Temple of Time“ (1846), eine pädagogische Visualisierung, die Chronologie in physischen Raum überträgt und historische Epochen und Persönlichkeiten in einer perspektivisch zurückweichenden Architektur anordnet. Willard entwarf solche Bilder als visuelle Gedächtnisstützen, weil sie glaubte, grafische Darstellungen könnten Schülern helfen, ein zusammenhängendes geistiges Bild der Geschichte zu entwickeln. Quelle
Das Gebiet der Mnemotechnik befasst sich allerdings mit der Aufnahme von Daten und nicht mit ihrer Verarbeitung oder Interpretation. In den Denkstilen, auf die Menschen zurückgreifen, gibt es erhebliche Unterschiede.
Ich persönlich denke in Formen und tue das, seit ich denken kann: Jahrzehnte, Jahre, Ideen und Menschen werden für mich auf irgendeine Weise durch relative Geometrie und dynamische Volumenblöcke dargestellt. Andere denken vor allem in Zahlen, wieder andere in Gerüchen oder Geschmäckern.
Bei KI ist die mögliche Bandbreite synästhetischer Methoden begrenzter. Natürlich kann ein Large Language Model (LLM) in Text denken, denn dies ist oberhalb der Ebene der Einbettungen sein nativer Codierungstyp. Zudem wurde gezeigt, dass LLMs Zahlen als Konzepte und nicht als reine Variablenwerte codieren, was auf eine Neigung zum „Denken in Zahlen“ hindeutet.
Doch inwieweit kann man sagen, dass ein LLM „in Formen“ oder „in Bildern“ denkt, wie Menschen es häufig tun?
Die Tatsache, dass ein LLM auf dieselbe Frage in verschiedenen Sprachen unterschiedliche Antworten liefert, zeigt, dass diese Beziehungen sehr spezifisch und fragil sein können. Sie sind möglicherweise fest an bestimmten Text innerhalb eines Sprachbereichs, etwa „Spanisch“, gebunden, statt einen übergeordneten Bereich anzusprechen, der Sprache übersteigt und zugleich enthält.*
Ein multimodales LLM, also ein Vision Language Model (VLM), das Bilder ausschließlich für seine interne Gedankenkette (Chain of Thought, CoT) erzeugen kann, könnte daher logischerweise im Vorteil sein oder zumindest buchstäblich einen anderen Blickwinkel haben.
Neue Blickwinkel
Vor diesem Hintergrund hat eine neue Forschungskooperation aus Deutschland ein bildorientiertes VLM namens ReImaGin vorgestellt, das Bilderzeugung als formbaren Schlussfolgerungsmechanismus nutzt.
Frühere Arbeiten hatten bildbasierte Komponenten lediglich „angeschraubt“; diese Funktionen waren weder intrinsisch noch für den Kernablauf unverzichtbar. Das neue System der Autoren ist dagegen so konzipiert, dass es die jüngsten Fähigkeiten von VLMs nutzt, um die Funktion spezialisierter Werkzeuge und Methoden zu übernehmen, etwa die Tiefenwahrnehmung.
Im folgenden Beispiel aus der neuen Studie mit dem Titel Reasoning with Image Generation muss die KI zwei Ansichten interpretieren (die beiden Bilder ganz links), von denen keine allein alle zur Lösung einer Aufgabe nötigen Informationen enthält. Das Modell kann die vorhandenen Informationen daher nutzen, um ein umfassenderes und vollständigeres Bild der Szene zu erschließen – die Karte mit der Unterzeile „Generated Visualization“, unten an dritter Stelle von links.

Beispiel aus der neuen Studie: ReImaGin erzeugt aus zwei unvollständigen Ansichten eine Karte aus der Vogelperspektive und verschafft dem Modell damit eine einheitliche visuelle Darstellung für seine Schlussfolgerungen. Quelle
ReImaGin ist nicht auf eine bestimmte Art visueller Transformation beschränkt. Das System kann fehlende Puzzlebereiche vervollständigen, Verdeckungen entfernen, um Objekte zu zählen, Bahnen zur Kollisionsvorhersage zeichnen, mehrere Ansichten zu räumlichen Karten zusammenführen, gestrichelte Wege zum Nachverfolgen in durchgezogene Linien umwandeln und Tiefenkarten für räumliche Schlussfolgerungen erzeugen.
Noch wichtiger ist, dass das System den Einsatz seines internen Werkzeugsatzes selbst steuern kann. Das entspricht den jüngst aufkommenden Fähigkeiten von VLMs, bestimmte Herausforderungen automatisch mit passenden Werkzeugen wie der Tiefenschätzung zu bearbeiten. Der Großteil der beschriebenen Funktionen von ReImaGin wird durch Aufrufe des Werkzeugs generate_image aktiviert, einer Funktion, die bei Bedarf visuell eingreifen kann, ohne menschliche Aufsicht oder Auslösung.
Die Autoren erklären:
„Da generate_image beliebige natürlichsprachliche Anweisungen akzeptiert, kann der Agent eine enorme Bandbreite von Transformationen durchführen. Die Frage ist, welche Transformation bei einer bestimmten Aufgabe tatsächlich hilft.“
„In der [üblichen] Praxis wird die Transformation durch manuell erstellte Beispiele im Kontext spezifiziert, die die gewünschte Strategie demonstrieren, etwa die Erzeugung einer Tiefenkarte für Tiefenschlussfolgerungen. Dies erfordert für jede Aufgabe manuelle Arbeit und begrenzt die Verallgemeinerung auf neue Aufgaben.“
„[Wir] fragen, ob solche Strategien automatisch entdeckt werden können. Da die Strategie dem Agenten über seinen Prompt vermittelt wird, lässt sich die Strategiesuche auf die Optimierung des Prompts reduzieren: Wir richten eine iterative Schleife ein, in der ein Vorschlagsmodell mögliche Prompts erzeugt, sie anhand eines kleinen Entwicklungssatzes bewertet und auf Grundlage beobachteter Erfolge und Misserfolge verfeinert.“
ReImaGin wurde mit drei VLMs und sechs Aufgaben zum visuellen Schlussfolgern getestet und übertraf mit nur einem Werkzeug weitgehend sowohl das Schlussfolgern ohne Hilfsmittel als auch spezialisierte Bildverarbeitungswerkzeuge.
Der Ansatz
ReImaGin arbeitet als Schleife: Bei jedem Schritt betrachtet das VLM die Frage, die ursprünglichen Bilder und alles, was es bereits erzeugt hat, und entscheidet, was als Nächstes zu tun ist. Dazu können gewöhnliche Bildoperationen wie Zuschneiden oder Überlagern ebenso gehören wie ein Aufruf von generate_image, das ein neues Bild erzeugt, um die gedankliche Bearbeitung des Problems gezielt zu erleichtern:

Schrittweise Darstellung, wie ReImaGin räumliche Probleme und visuelle Rätsel durchdenkt. In beiden Beispielen erzeugt das Modell während des Schlussfolgerns ein neues Bild und verwendet dieses anschließend als zusätzliche Eingabe für weitere Schritte zur Antwort.
Das erzeugte Bild wird dann an das VLM zurückgegeben und wird Teil des Materials, das für den nächsten Schlussfolgerungsschritt zur Verfügung steht. Dieser Prozess kann sich wiederholen. Im obigen Bild sind diese Schritte für die räumliche Aufgabe zu sehen: Das Modell kombiniert zunächst zwei Fotos zu einer einzigen Ansicht und wandelt das Ergebnis anschließend in eine Karte aus der Vogelperspektive um, bevor es die Frage beantwortet.
Für die Puzzleaufgabe erzeugt es eine veränderte Fassung des Puzzles, die den fehlenden Bereich isoliert, und identifiziert die Antwort dann mit herkömmlicher Bildsubtraktion.
Auf diese Weise wird die Bilderzeugung selbst Teil des Schlussfolgerungsprozesses und nicht zu einem Endprodukt für den Nutzer. Tatsächlich sind diese Zwischenbilder ausschließlich für die CoT-Prozesse der KI bestimmt und nicht für den direkten Gebrauch durch den Endnutzer.
In jedem Durchgang wählt das VLM aus dem bis dahin angesammelten Kontext selbst seine nächste Aktion. Diese kann ein weiterer Schlussfolgerungsschritt, eine herkömmliche Bildoperation oder eine natürlichsprachliche Anweisung an generate_image sein. Was das gewählte Werkzeug zurückgibt, wird dem Kontext hinzugefügt. So kann das Modell das Ergebnis prüfen und entscheiden, ob es erneut transformiert, ein anderes Werkzeug verwendet oder zur endgültigen Antwort übergeht.
Mehr Eigenständigkeit
Ein zentrales Problem besteht darin zu entscheiden, welche Art von Bild eine bestimmte Aufgabe tatsächlich vereinfachen würde. ReImaGin löst dies, indem es mit verschiedenen Anweisungen an den Agenten experimentiert, mögliche Prompts an Beispielen mit bekannten Antworten testet und aus erfolgreichen wie gescheiterten Versuchen bessere Prompts ableitet. Weitere Durchläufe dieser Schleife bringen schließlich die leistungsfähigsten Strategien hervor.
Das Schlussfolgerungsmodell und der Bildgenerator selbst werden während dieses Prozesses nicht neu trainiert. Optimiert werden nur die Anweisungen, die regeln, wie der Agent seine Werkzeuge nutzt. Die Forscher beschreiben den Prozess daher als „automatisierte Entdeckung“ visueller Schlussfolgerungsstrategien, ohne selbst aufgabenspezifische Strategien oder Schlussfolgerungsbeispiele vorzugeben.
Konfiguration und Tests
ReImaGin wurde bei sechs Aufgaben zum visuellen Schlussfolgern bewertet: Tiefenschlussfolgerung (Blink – Erkennen, welcher von zwei Punkten näher an der Kamera liegt), Puzzlevervollständigung (Mira – Auswahl des richtigen Teils für einen fehlenden Bildbereich), Zählen verdeckter Objekte (CAPTURe – Zählen von Objekten einschließlich verborgener Objekte), Kollisionsvorhersage (Spatial457 – Vorhersage, welches Objekt ein bewegliches Ziel treffen wird), räumliches Schlussfolgern (MMSI – Bestimmung der Beziehungen zwischen Objekten in verschiedenen Ansichten) und Pfadverfolgung – ein neuer Benchmark, bei dem Modelle gestrichelten Linien folgen müssen, die Zahlen mit Buchstaben verbinden.

Aus der Studie „MIRA, a Benchmark for Visual Chain-of-Thought“: eindrucksvolle Beispiele für visuelle Darstellungen in Chain-of-Thought-Prozessen. Quelle
Als VLM-Grundmodelle wurden Gemini-3.1-Pro, GPT-5 und das Open-Weights-Modell Qwen-3.5-27B getestet. Die Bilderzeugung übernahm hauptsächlich Nano-Banana-Pro; zusätzlich wurden die Open-Weights-Modelle FLUX.2 [dev] und Qwen-Image-Edit-2511 geprüft. Gemini-3.1-Pro diente als Auswahlmodell für die Skalierung der Bildgenerierung zur Testzeit.
Von den zwei Vergleichsgrundlagen beantwortete das von den Autoren als „No Tools“ bezeichnete unveränderte VLM die Anfrage direkt anhand von Text und Bildern, ohne Werkzeuge oder Codeausführung. Der Ansatz Visual Sketchpad aus dem Jahr 2024 bot dagegen einen festen Satz spezialisierter Werkzeuge für Bildverarbeitung und Bildmanipulation, aber keine offene Bilderzeugung.
Für die räumliche MMSI-Aufgabe erhielten beide Vergleichssysteme ungefähr dieselbe Rechenleistung wie ReImaGin: Jedes System erzeugte 20 Antworten, und die am häufigsten auftretende Antwort wurde verwendet.
Die Leistung wurde bei allen Aufgaben außer dem Zählen verdeckter Objekte anhand der Genauigkeit bei Multiple-Choice-Fragen gemessen. Diese Zählaufgabe wurde mit dem symmetrischen mittleren absoluten prozentualen Fehler bewertet, wobei vorhergesagte und tatsächliche Objektzahlen verglichen wurden. Die Ergebnisse wurden über drei Durchläufe gemittelt; außerdem wurde der Standardfehler angegeben.

Testergebnisse zum Vergleich von ReImaGin mit No Tools und Visual Sketchpad bei drei VLMs und sechs Aufgaben zum visuellen Schlussfolgern. Höhere Werte sind besser, außer beim Zählen verdeckter Objekte, wo ein niedrigerer Fehler besser ist. ReImaGin erzielte bei der Mehrzahl der Modell-Aufgaben-Kombinationen das beste Ergebnis.
Bei allen drei Modellen wurden dieselben von Menschen definierten Strategiebeispiele verwendet. ReImaGin erzielte bei den meisten Aufgaben bessere Ergebnisse als beide Vergleichssysteme, mit besonders deutlichen Gewinnen bei Puzzlevervollständigung, Zählen verdeckter Objekte und Pfadverfolgung.
Bei GPT-5 stieg die Puzzle-Genauigkeit beispielsweise von 29,5 % mit No Tools und 16,7 % mit Visual Sketchpad auf 44,9 % mit ReImaGin. Ablationstests bestätigten, dass die generative Bildkomponente für die Leistung des Systems unverzichtbar ist.
Anstelle von Nano-Banana-Pro wurden außerdem Open-Weights-Bildgeneratoren getestet: FLUX.2 [dev] und Qwen-Image-Edit-2511 erzielten bei einigen einfacheren Aufgaben, insbesondere beim Inpainting, vergleichbare Ergebnisse. Bei anspruchsvolleren Transformationen wie Tiefenschätzung und Pfadverfolgung waren sie jedoch weniger zuverlässig. Ähnliche Ergebnisse ergaben sich, als Qwen-3.5-27B als VLM eingesetzt wurde:
![Testergebnisse zum Vergleich von Bildgeneratoren mit Qwen-3.5-27B als VLM. Nano-Banana-Pro erzielte bei fünf von sechs Aufgaben das beste Ergebnis, während FLUX.2 [dev] und Qwen-Image-Edit-2511 bei mehreren Aufgaben Verbesserungen gegenüber No Tools erreichten.](https://www.unite.ai/wp-content/uploads/2026/09/table-6-1.jpg)
Testergebnisse zum Vergleich von Bildgeneratoren mit Qwen-3.5-27B als VLM. Nano-Banana-Pro erzielte bei fünf von sechs Aufgaben das beste Ergebnis, während FLUX.2 [dev] und Qwen-Image-Edit-2511 bei mehreren Aufgaben Verbesserungen gegenüber No Tools erreichten.
Die Autoren führten außerdem qualitative Tests mit vier Aufgaben durch:

Qualitative Beispiele aus vier Aufgaben zeigen, wie ReImaGin eingesetzt wurde, um die Schlussfolgerungen von Gemini-3.1-Pro zu erweitern. In jedem Fall wurden erzeugte visuelle Darstellungen in den Schlussfolgerungsprozess einbezogen, um die Aufgabe zu lösen.
ReImaGin war nicht in jedem Fall zuverlässig: In manchen Situationen erzeugte der Bildgenerator eine fehlerhafte Transformation, etwa einen Grundriss mit Gegenständen an den falschen Positionen. In anderen Fällen wurde ein korrekt erzeugtes Bild anschließend vom VLM falsch interpretiert.
Bei einer manuellen Prüfung von 120 erzeugten Bildern stellte sich heraus, dass 75 % die angeforderte Transformation getreu ausgeführt hatten. Wenn dies gelang, war die endgültige Antwort in 87 % der Fälle korrekt, verglichen mit 43 %, wenn das erzeugte Bild ungenau war.
Die Autoren folgern:
„Unsere Ergebnisse legen zwei weiter gefasste Schlussfolgerungen nahe. Erstens kann Bilderzeugung als allgemeiner Mechanismus visueller Vorstellungskraft innerhalb multimodaler Schlussfolgerungen dienen und den Bedarf verringern, für jede neue Transformation ein eigenes Werkzeug zu entwickeln.“
„Zweitens hängt die Wirksamkeit dieses Ansatzes nicht nur von den zugrunde liegenden Modellen ab, sondern auch von der Schlussfolgerungsstrategie, mit der entschieden wird, was visualisiert und wie das Ergebnis verwendet werden soll.“
„Die Verbesserungen durch automatische Strategieentdeckung zeigen, dass die Modelle ihr Verständnis visueller Transformationen nutzen können, um relevante Strategien ohne von Menschen verfasste aufgabenspezifische Strategien oder Schlussfolgerungsbeispiele zu entdecken.“
Fazit
Entscheidungen über den selbstständigen Einsatz von Werkzeugen, wie sie in dieser Studie untersucht wurden, sind eine faszinierende Entwicklung – nicht zuletzt, weil sich die VLM-Entwicklung offenbar ohnehin auf natürliche Weise in diese Richtung bewegt. Ich bin gespannt, ob solche universellen VLMs letztlich ebenso gut abschneiden werden wie spezialisierte Werkzeuge und Frameworks, etwa das Segment-Ökosystem, und ob jene, die ausschließlich solche „Nebenaufgaben“ bearbeiten, am Ende mit Kanonen auf Spatzen schießen.
Es ist jedoch schwer vorstellbar, dass VLMs die nötige Disziplin entwickeln könnten, um spezialisierte Lösungen wie lokales Fine-Tuning zu überholen und ihren Vorsprung zu halten. Dabei wird ein ganzes Modell einer einzigen Aufgabe gewidmet und dadurch für andere Zwecke oft unbrauchbar. Die Zeit wird es zeigen.
* Eine vertretbare Definition für den Bereich der Bildvorstellung, den wir lange vor dem Erwerb jeglicher Sprachfähigkeiten kennenlernen.
Erstveröffentlichung am Montag, 28. September 2026












