Andersonův úhel
AI využívající obrazové představy v uvažování Chain-of-Thought (CoT)

Často myslíme v obrazech — alespoň většina z nás: u lidí byla snížená schopnost vizuální představivosti podle výzkumu spojena s horšími studijními výsledky. Pokud jde o zapamatování — naši potřebu pamatovat si věci, nikoli o strašáka v oblasti AI — značná sémantická síla výrazných či živých obrazů se po tisíciletí používá jako pomůcka při učení:

„Temple of Time“ Emmy Willardové (1846), vzdělávací vizualizace, která převádí chronologii do fyzického prostoru a uspořádává historická období a osobnosti v ustupující architektonické perspektivě. Willardová takové obrazy navrhovala jako vizuální mnemotechnické pomůcky, protože věřila, že grafická znázornění mohou studentům pomoci vytvořit si soudržný mentální obraz historie. Zdroj
Oblast mnemotechniky se však týká příjmu dat, nikoli jejich zpracování nebo interpretace, v nichž se lidé značně liší podle „stylů“ myšlení, ze kterých vycházejí.
Já osobně myslím v tvarech a dělám to tak dlouho, jak vůbec přemýšlím — desetiletí, roky, myšlenky a lidé jsou určitým způsobem zastoupeni relativní geometrií a dynamickými bloky objemu. Jiní myslí především v číslech, další zase ve vůních nebo chutích.
U AI je možný rozsah synestetických metod omezenější. Velký jazykový model (LLM) může přirozeně myslet v textu, protože jde o jeho nativní typ kódování nad úrovní embeddingů. Zároveň se ukázalo, že modely LLM kódují čísla jako pojmy, nikoli jako pouhé hodnoty proměnných, což dokládá sklon „myslet v číslech“.
Do jaké míry lze ale o modelu LLM říci, že „myslí v tvarech“ nebo „myslí v obrazech“, jak to obvykle dělají lidé?
Skutečnost, že na stejnou otázku položenou v různých jazycích dostaneme od LLM různé odpovědi, naznačuje, že tyto vztahy mohou být velmi specifické a křehké a mohou být pevně zakódované pro konkrétní text v určité jazykové doméně — například ve „španělštině“ — místo aby se vztahovaly k doméně vyšší úrovně, která jazyk přesahuje, ale zároveň jej obsahuje*.
Multimodální LLM — tedy vizuálně-jazykový model neboli VLM — schopný vytvářet obrazy výhradně pro svůj vlastní interní řetězec myšlenek (COT) by proto mohl mít logickou výhodu, nebo alespoň doslova jiný úhel pohledu.
Nové úhly pohledu
S touto myšlenkou představila nedávná výzkumná spolupráce z Německa obrazově zaměřený model VLM nazvaný ReImaGin, který využívá generování obrazů jako tvárný mechanismus uvažování.
Předchozí práce sice k systémům „připojovaly“ obrazové součásti, ty však nebyly vlastní ani nezbytné pro základní pracovní postup. Nový systém autorů je naproti tomu navržen tak, aby využil velmi nedávných schopností modelů VLM a převzal funkce specializovaných nástrojů a metod, jako je vnímání hloubky.
V níže uvedeném příkladu z nového článku nazvaného Reasoning with Image Generation musí AI interpretovat dva pohledy — obrázky úplně vlevo — z nichž ani jeden neobsahuje všechny informace potřebné k vyřešení úkolu. Model proto může dostupné informace využít k vytvoření širšího a úplnějšího obrazu scény — mapy s podtitulkem „Generated Visualization“, která je níže třetí zleva.

Příklad z nového článku, v němž ReImaGin vytváří pohledovou mapu shora ze dvou neúplných pohledů a poskytuje modelu jednotné vizuální znázornění, z něhož může vycházet při uvažování. Zdroj
ReImaGin není vázán na jediný typ vizuální transformace. Dokáže doplňovat chybějící oblasti skládaček, odstraňovat zakrytí kvůli počítání, kreslit trajektorie pro předpověď kolizí, spojovat více pohledů do prostorových map, převádět přerušované trasy na souvislé čáry pro sledování a vytvářet hloubkové mapy pro uvažování o hloubce.
Ještě důležitější je, že systém dokáže používání této vnitřní sady nástrojů regulovat sám, v souladu s nedávno se objevujícími schopnostmi modelů VLM automaticky řešit konkrétní problémy vhodnými nástroji, jako je odhad hloubky. Většina popsaných funkcí ReImaGin se vyvolává voláním nástroje generate_image, který může podle potřeby vizuálně zasáhnout bez lidského dohledu či spuštění.
Autoři uvádějí:
„Protože generate_image přijímá libovolné instrukce v přirozeném jazyce, může agent provádět obrovské množství transformací; otázkou je, která transformace pro daný úkol skutečně pomůže.
„[Standardním] postupem je určit transformaci ručně vytvořenými příklady v kontextu, které předvedou požadovanou strategii — například vytvoření hloubkové mapy pro uvažování o hloubce. To vyžaduje manuální práci pro každý úkol a omezuje zobecnění na nové úkoly.“
„[Ptáme] se, zda lze takové strategie objevovat automaticky. Protože se strategie agentovi předává prostřednictvím promptu, lze její objevování převést na optimalizaci promptu: zavádíme iterační smyčku, v níž návrhový model generuje kandidátní prompty, vyhodnocuje je na malé vývojové sadě a zdokonaluje je podle pozorovaných úspěchů a neúspěchů.“
Při testování na třech modelech VLM a šesti úlohách vizuálního uvažování ReImaGin s použitím jediného nástroje obecně překonal jak uvažování bez pomoci, tak specializované vizuální nástroje.
Přístup
ReImaGin pracuje jako smyčka: v každém kroku model VLM posoudí otázku, původní obrázky i vše, co již vytvořil, a rozhodne se, co udělá dál. Může jít o běžné obrazové operace, například oříznutí či překrytí, nebo o volání generate_image, které vytvoří nový obrázek určený právě k tomu, aby se o problému dalo snadněji uvažovat:

Postupné znázornění toho, jak ReImaGin uvažuje o prostorových problémech a vizuálních skládačkách. V obou příkladech model během uvažování vytvoří nový obrázek a poté jej využije jako další vstup pro následné kroky vedoucí k odpovědi.
Vytvořený obrázek je následně vrácen modelu VLM a stává se součástí materiálu dostupného pro další krok uvažování, takže se proces může opakovat. Na obrázku výše vidíme tyto prvky na prostorovém úkolu: model nejprve spojí dvě fotografie do jediného pohledu a poté výsledek převede na mapu shora, než na otázku odpoví.
U úlohy se skládačkou vytvoří upravenou verzi, která oddělí chybějící oblast, a pak pomocí běžného odečítání obrazů určí odpověď.
Generování obrazů se tak stává součástí samotného procesu uvažování, nikoli konečným produktem pro uživatele. Tyto mezilehlé obrazy jsou totiž určeny výhradně pro procesy COT umělé inteligence, nikoli k přímému prohlížení koncovým uživatelem.
V každém tahu si model VLM sám vybírá další akci z dosud nashromážděného kontextu. Může jít o další krok uvažování, běžnou obrazovou operaci nebo instrukci v přirozeném jazyce pro generate_image. Cokoli zvolený nástroj vrátí, je přidáno do kontextu, takže model může výsledek prozkoumat a rozhodnout se, zda jej znovu transformuje, použije jiný nástroj, nebo přejde ke konečné odpovědi.
Získávání autonomie
Zásadním problémem je rozhodnout, jaký druh obrazu by konkrétní úlohu skutečně usnadnil. ReImaGin to určuje experimentováním s různými instrukcemi pro agenta, testováním kandidátních promptů na příkladech se známými odpověďmi a využitím úspěšných i neúspěšných pokusů k získání lepších promptů. Další iterace této smyčky nakonec vytvoří nejvýkonnější strategie.
Samotný model uvažování ani generátor obrazů se během tohoto procesu znovu netrénují; optimalizují se pouze instrukce řídící způsob, jakým agent používá své nástroje. Výzkumníci proto proces popisují jako „automatizované objevování“ strategií vizuálního uvažování, aniž by sami poskytovali strategie pro konkrétní úkoly nebo příklady uvažování.
Konfigurace a testy
ReImaGin byl hodnocen na šesti úlohách vizuálního uvažování: uvažování o hloubce (Blink — určení, který ze dvou bodů je blíže kameře); doplňování skládaček (Mira — výběr správného dílu pro chybějící oblast obrázku); počítání se zakrytím (CAPTURe — počítání objektů včetně skrytých); předpověď kolizí (Spatial457 — předpověď, do kterého objektu narazí pohybující se cíl); prostorové uvažování (MMSI — určování vztahů mezi objekty v různých pohledech); a sledování tras — nový benchmark, který vyžaduje, aby modely sledovaly přerušované čáry spojující čísla s písmeny.

Z článku „MIRA, a Benchmark for Visual Chain-of-Thought“: pozoruhodné příklady vizuálních představ v procesech řetězce myšlenek. Zdroj
Testovanými základními modely VLM byly Gemini-3.1-Pro, GPT-5 a model s otevřenými vahami Qwen-3.5-27B. Generování obrazů zajišťoval především Nano-Banana-Pro, ale testovány byly také modely s otevřenými vahami FLUX.2 [dev] a Qwen-Image-Edit-2511. Gemini-3.1-Pro sloužil jako selektor při škálování generování obrazů v době testování.
Ze dvou základních systémů použitých ke srovnání odpovídal „běžný“ model VLM, který autoři článku označili jako „No Tools“, přímo z dotazu a obrázků bez nástrojů či spouštění kódu. Systém Visual Sketchpad z roku 2024 v tomto případě nabízel pevnou sadu specializovaných nástrojů pro vidění a manipulaci s obrazy, ale žádné otevřené generování obrazů.
U prostorové úlohy MMSI dostaly oba základní systémy podobné množství výpočetních prostředků jako ReImaGin: z každého bylo vygenerováno 20 odpovědí a použila se ta, která se objevila nejčastěji.
Výkon byl u všech úloh kromě počítání se zakrytím měřen přesností odpovědí s výběrem možností. Počítání se zakrytím se hodnotilo pomocí symetrické střední absolutní procentní chyby porovnáním předpovězeného a skutečného počtu objektů. Výsledky byly zprůměrovány ze tří běhů a uvedena byla také standardní chyba.

Výsledky testů porovnávající ReImaGin s No Tools a Visual Sketchpad na třech modelech VLM a šesti úlohách vizuálního uvažování. Vyšší skóre je lepší s výjimkou Počítání se zakrytím, kde je lepší nižší chyba. ReImaGin dosáhl nejlepšího výsledku ve většině kombinací modelu a úlohy.
U všech tří modelů byly použity stejné příklady strategií definovaných lidmi. ReImaGin dosáhl ve většině úloh lepších výsledků než oba základní systémy, přičemž obzvlášť zřetelný přínos vykázal při doplňování skládaček, počítání se zakrytím a sledování tras.
Například u GPT-5 vzrostla přesnost řešení skládaček z 29,5 % s No Tools a 16,7 % s Visual Sketchpad na 44,9 % s ReImaGin. Ablační testy potvrdily, že generativní obrazová složka je pro výkon systému nezbytná.
Namísto Nano-Banana-Pro byly testovány také obrazové generátory s otevřenými vahami. FLUX.2 [dev] a Qwen-Image-Edit-2511 poskytly srovnatelné výsledky v některých jednodušších úlohách, zejména při doplňování obrazů, ale byly méně konzistentní u náročnějších transformací, jako je odhad hloubky a sledování tras. Podobné výsledky byly získány, když byl jako VLM použit Qwen-3.5-27B:
![Výsledky testů porovnávající generátory obrazů s Qwen-3.5-27B jako modelem VLM. Nano-Banana-Pro dosáhl nejlepšího výsledku v pěti ze šesti úloh, zatímco FLUX.2 [dev] a Qwen-Image-Edit-2511 zlepšily oproti No Tools výsledky v několika úlohách.](https://www.unite.ai/wp-content/uploads/2026/09/table-6-1.jpg)
Výsledky testů porovnávající generátory obrazů s Qwen-3.5-27B jako modelem VLM. Nano-Banana-Pro dosáhl nejlepšího výsledku v pěti ze šesti úloh, zatímco FLUX.2 [dev] a Qwen-Image-Edit-2511 zlepšily oproti No Tools výsledky v několika úlohách.
Autoři také provedli kvalitativní testy čtyř úloh:

Kvalitativní příklady ve čtyřech úlohách ukazují, jak byl ReImaGin použit k rozšíření uvažování modelu Gemini-3.1-Pro. V každém případě byla vytvořená vizuální znázornění zapojena do procesu uvažování, aby pomohla vyřešit úkol.
ReImaGin nebyl spolehlivý v každém případě: někdy generátor obrazů vytvořil nepřesnou transformaci, například půdorys s objekty na chybných místech; jindy model VLM následně chybně přečetl přesně vytvořený obraz.
Při ruční kontrole 120 vygenerovaných snímků se zjistilo, že 75 % věrně provedlo požadovanou transformaci. Když se to podařilo, byla konečná odpověď správná v 87 % případů, oproti 43 % v případě nepřesného vytvořeného obrazu.
Autoři uzavírají:
„Naše výsledky naznačují dva obecnější závěry. Za prvé může generování obrazů sloužit jako obecný mechanismus vizuální představivosti v rámci multimodálního uvažování a snížit potřebu vytvářet pro každou novou transformaci samostatný nástroj.
„Za druhé závisí účinnost tohoto přístupu nejen na základních modelech, ale také na strategii uvažování, která rozhoduje, co vizualizovat a jak výsledek použít.
„Přínosy automatického objevování strategií ukazují, že modely dokážou využít své porozumění vizuálním transformacím k nalezení vhodných strategií bez lidsky vytvořených strategií pro konkrétní úkoly nebo příkladů uvažování.“
Závěr
Rozhodnutí o samostatném používání nástrojů, jaká zkoumá tato studie, představují fascinující vývoj, zejména proto, že se vývoj modelů VLM zřejmě přirozeně ubírá tímto směrem. Zajímá mě, zda takové univerzální modely VLM nakonec dosáhnou stejného výkonu jako specializované nástroje a rámce, například ekosystém Segment, a zda ti, kteří se zabývají výhradně těmito „vedlejšími úlohami“, nakonec nebudou používat palici na rozlousknutí oříšku.
Je poměrně těžké uvěřit, že by modely VLM dokázaly získat disciplínu potřebnou k překonání specializovaných řešení, jako je místní dolaďování, a udržení náskoku před nimi. V takovém případě je celý model vyhrazen jediné úloze a často se přitom stane nepoužitelným pro cokoli jiného. Čas ukáže.
* Jedna z možných definic domény obrazových představ, kterou se učíme dávno předtím, než si osvojíme jakékoli jazykové dovednosti.
Poprvé publikováno v pondělí 28. září 2026












