Kąt Andersona
AI wykorzystująca obrazy w rozumowaniu Chain-of-Thought (CoT)

Często myślimy obrazami — przynajmniej większość z nas: u ludzi ograniczona zdolność do wyobraźni wzrokowej została w badaniach powiązana z gorszymi wynikami w nauce. Jeśli chodzi o zapamiętywanie — naszą potrzebę pamiętania rzeczy, a nie problem budzący obawy w AI — znaczna moc semantyczna wyrazistych lub żywych obrazów jest wykorzystywana od tysiącleci jako pomoc w nauce:

„Temple of Time” Emmy Willard (1846), wizualizacja edukacyjna, która przekształca chronologię w fizyczną przestrzeń, rozmieszczając okresy i postacie historyczne w cofającej się perspektywie architektonicznej. Willard tworzyła takie obrazy jako wzrokowe pomoce pamięciowe, wierząc, że przedstawienia graficzne mogą pomóc uczniom zbudować spójny mentalny obraz historii. Źródło
Mnemotechnika dotyczy jednak przyswajania danych, a nie ich przetwarzania czy interpretowania, w których ludzie znacznie różnią się pod względem wykorzystywanych stylów myślenia.
Osobiście myślę kształtami i robię to, odkąd sięgam pamięcią: dekady, lata, idee i ludzie są w jakiś sposób reprezentowani przez względną geometrię i dynamiczne bryły objętości. Inni myślą przede wszystkim liczbami, a jeszcze inni zapachami lub smakami.
W przypadku AI możliwy zakres metod synestezyjnych jest bardziej ograniczony. Duży model językowy (LLM) może naturalnie myśleć tekstem, ponieważ jest to jego rodzimy typ kodowania powyżej poziomu osadzeń. Wykazano również, że modele LLM kodują liczby jako pojęcia, a nie czyste wartości zmiennych, co wskazuje na skłonność do „myślenia liczbami”.
Ale w jakim stopniu można powiedzieć, że model LLM „myśli kształtami” lub „myśli obrazami” tak, jak zwykle robią to ludzie?
Fakt, że model LLM daje różne odpowiedzi na to samo pytanie przedstawione w różnych językach, wskazuje, że relacje te mogą być bardzo konkretne i kruche oraz na stałe związane z określonym tekstem w domenie językowej — na przykład „hiszpańskiej” — zamiast odwoływać się do domeny wyższego poziomu, która przekracza język, a jednocześnie go zawiera.*
Dlatego multimodalny LLM — czyli model wizji i języka, VLM — potrafiący generować obrazy wyłącznie na potrzeby własnego wewnętrznego łańcucha myśli (Chain of Thought, CoT) mógłby logicznie mieć przewagę lub przynajmniej dosłownie alternatywny punkt widzenia.
Nowe punkty widzenia
Mając to na uwadze, niedawna niemiecka współpraca badawcza przedstawiła skoncentrowany na obrazie model VLM o nazwie ReImaGin, który wykorzystuje generowanie obrazów jako plastyczny mechanizm rozumowania.
Choć wcześniejsze prace „dokładały” komponenty oparte na obrazach, funkcje te nie były ani wewnętrzne, ani niezbędne dla głównego przepływu pracy. Nowy system autorów został natomiast zaprojektowany tak, aby wykorzystywać najnowsze możliwości modeli VLM i przejmować funkcjonalność wyspecjalizowanych narzędzi oraz metod, takich jak postrzeganie głębi.
W poniższym przykładzie z nowej publikacji zatytułowanej Reasoning with Image Generation AI musi zinterpretować dwa widoki — skrajne obrazy po lewej — z których żaden nie zawiera wszystkich informacji potrzebnych do rozwiązania zadania. Model może więc wykorzystać posiadane informacje, aby odtworzyć szerszy i pełniejszy obraz sceny: mapę z podpisem „Generated Visualization”, trzecią od lewej poniżej.

Przykład z nowej publikacji, w którym ReImaGin generuje mapę z góry na podstawie dwóch niepełnych widoków, dając modelowi jednolitą reprezentację wizualną służącą do rozumowania. Źródło
ReImaGin nie jest ograniczony do jednego rodzaju transformacji wizualnej. System może uzupełniać brakujące obszary układanek, usuwać zasłonięcia w celu policzenia obiektów, rysować trajektorie do przewidywania kolizji, łączyć wiele widoków w mapy przestrzenne, zamieniać przerywane ścieżki w ciągłe linie do śledzenia oraz generować mapy głębi do rozumowania przestrzennego.
Co ważniejsze, system może sam regulować użycie tego wewnętrznego zestawu narzędzi, zgodnie z nowymi możliwościami modeli VLM, które automatycznie rozwiązują określone wyzwania za pomocą odpowiednich narzędzi, takich jak szacowanie głębi. Większość opisanej funkcjonalności ReImaGin uruchamiana jest poprzez wywołania narzędzia generate_image, funkcji zdolnej interweniować wizualnie w razie potrzeby, bez nadzoru lub wywołania przez człowieka.
Autorzy stwierdzają:
„Ponieważ generate_image przyjmuje dowolne instrukcje w języku naturalnym, agent może wykonywać ogromny zakres transformacji. Pytanie brzmi, która transformacja naprawdę pomaga w danym zadaniu”.
„[Standardową] praktyką jest określenie transformacji za pomocą ręcznie przygotowanych przykładów w kontekście, które demonstrują pożądaną strategię — na przykład wygenerowanie mapy głębi do rozumowania o głębi. Wymaga to pracy ręcznej dla każdego zadania i ogranicza uogólnianie na nowe zadania”.
„[Pytamy], czy takie strategie można odkrywać automatycznie. Ponieważ strategia jest przekazywana agentowi przez jego prompt, odkrycie strategii sprowadza się do optymalizacji promptu: tworzymy iteracyjną pętlę, w której model propozycji generuje prompty kandydujące, ocenia je na małym zbiorze rozwojowym i udoskonala na podstawie zaobserwowanych sukcesów i porażek”.
Testowany na trzech modelach VLM i sześciu zadaniach rozumowania wizualnego ReImaGin ogólnie przewyższył zarówno rozumowanie bez pomocy, jak i specjalistyczne narzędzia wizyjne, wykorzystując tylko jedno narzędzie.
Podejście
ReImaGin działa w pętli: na każdym etapie model VLM analizuje pytanie, obrazy źródłowe i wszystko, co już wygenerował, a następnie decyduje, co zrobić dalej. Może to obejmować zwykłe operacje na obrazach, takie jak kadrowanie lub nakładanie, albo wywołanie generate_image, które tworzy nowy obraz specjalnie po to, aby ułatwić rozumowanie nad problemem:

Ilustracja krok po kroku pokazująca, jak ReImaGin rozumuje nad problemami przestrzennymi i wizualnymi układankami. W obu przykładach model generuje nowy obraz podczas rozumowania, a następnie wykorzystuje go jako dodatkowe dane wejściowe w kolejnych krokach prowadzących do odpowiedzi.
Wygenerowany obraz jest następnie ponownie przekazywany do modelu VLM i staje się częścią materiału dostępnego w kolejnym kroku rozumowania, po czym proces może się powtórzyć. Na powyższym obrazie widzimy te etapy w zadaniu przestrzennym: model najpierw łączy dwa zdjęcia w jeden widok, a następnie przekształca wynik w mapę z góry, zanim odpowie na pytanie.
W zadaniu z układanką generuje zmienioną wersję układanki, która izoluje brakujący obszar, po czym wykorzystuje tradycyjne odejmowanie obrazów do znalezienia odpowiedzi.
W ten sposób generowanie obrazów staje się częścią samego procesu rozumowania, a nie produktem końcowym dla użytkownika. Te obrazy pośrednie są przeznaczone wyłącznie do procesów CoT sztucznej inteligencji, a nie do bezpośredniego oglądania przez użytkownika końcowego.
W każdej turze model VLM sam wybiera kolejne działanie na podstawie dotychczas zgromadzonego kontekstu. Działaniem może być kolejny krok rozumowania, konwencjonalna operacja na obrazie lub instrukcja w języku naturalnym dla generate_image. Wszystko, co zwróci wybrane narzędzie, jest dodawane do kontekstu, dzięki czemu model może sprawdzić wynik i zdecydować, czy ponownie go przekształcić, użyć innego narzędzia czy przejść do ostatecznej odpowiedzi.
Zyskiwanie sprawczości
Głównym problemem jest ustalenie, jaki rodzaj obrazu rzeczywiście ułatwiłby dane zadanie. ReImaGin rozstrzyga to, eksperymentując z różnymi instrukcjami dla agenta, testując prompty kandydujące na przykładach o znanych odpowiedziach i wykorzystując udane oraz nieudane próby do uzyskiwania lepszych promptów. Kolejne iteracje tej pętli ostatecznie tworzą najskuteczniejsze strategie.
Sam model rozumowania i generator obrazów nie są podczas tego procesu ponownie trenowane. Optymalizowane są wyłącznie instrukcje regulujące sposób korzystania przez agenta z narzędzi. Badacze opisują więc proces jako „automatyczne odkrywanie” strategii rozumowania wizualnego, bez samodzielnego dostarczania strategii dla konkretnych zadań lub przykładów rozumowania.
Konfiguracja i testy
ReImaGin oceniono w sześciu zadaniach rozumowania wizualnego: rozumowanie o głębi (Blink — określenie, który z dwóch punktów znajduje się bliżej kamery); uzupełnianie układanki (Mira — wybór właściwego elementu do brakującego obszaru obrazu); liczenie z zasłonięciami (CAPTURe — liczenie obiektów, również ukrytych); przewidywanie kolizji (Spatial457 — przewidywanie, w który obiekt uderzy poruszający się cel); rozumowanie przestrzenne (MMSI — określanie relacji między obiektami w różnych widokach); oraz śledzenie ścieżek — nowy benchmark wymagający od modeli podążania za przerywanymi liniami łączącymi cyfry z literami.

Uderzające przykłady obrazów wizualnych w procesach łańcucha myśli z publikacji „MIRA, a Benchmark for Visual Chain-of-Thought”. Źródło
Testowanymi modelami bazowymi VLM były Gemini-3.1-Pro, GPT-5 oraz model o otwartych wagach Qwen-3.5-27B. Generowaniem obrazów zajmował się przede wszystkim Nano-Banana-Pro, a modele o otwartych wagach FLUX.2 [dev] i Qwen-Image-Edit-2511 również zostały przetestowane. Gemini-3.1-Pro wykorzystano jako selektor do skalowania generowania obrazów podczas testu.
Spośród dwóch metod bazowych użytych do porównania zwykły model VLM, nazwany przez autorów „No Tools”, odpowiadał bezpośrednio na podstawie zapytania i obrazów, bez narzędzi lub wykonywania kodu. Metoda Visual Sketchpad z 2024 roku oferowała w tym przypadku stały zestaw wyspecjalizowanych narzędzi do widzenia komputerowego i manipulacji obrazami, ale bez otwartego generowania obrazów.
W zadaniu przestrzennym MMSI obie metody bazowe otrzymały moc obliczeniową zbliżoną do ReImaGin: z każdej wygenerowano 20 odpowiedzi i użyto tej, która pojawiała się najczęściej.
Wydajność mierzono dokładnością odpowiedzi wielokrotnego wyboru dla wszystkich zadań poza liczeniem z zasłonięciami, które oceniano za pomocą symetrycznego średniego bezwzględnego błędu procentowego, porównując przewidywaną i rzeczywistą liczbę obiektów. Wyniki uśredniono z trzech uruchomień, a także podano błąd standardowy.

Wyniki testów porównujących ReImaGin z No Tools i Visual Sketchpad na trzech modelach VLM i sześciu zadaniach rozumowania wizualnego. Wyższe wyniki są lepsze, poza liczeniem z zasłonięciami, gdzie lepszy jest niższy błąd. ReImaGin osiągnął najlepszy wynik w większości kombinacji modelu i zadania.
We wszystkich trzech modelach wykorzystano te same przykłady strategii zdefiniowane przez ludzi. ReImaGin osiągnął lepsze wyniki od obu metod bazowych w większości zadań, ze szczególnie wyraźnymi korzyściami w uzupełnianiu układanek, liczeniu z zasłonięciami i śledzeniu ścieżek.
Na przykład w GPT-5 dokładność rozwiązywania układanek wzrosła z 29,5% dla No Tools i 16,7% dla Visual Sketchpad do 44,9% dla ReImaGin. Testy ablacyjne potwierdziły, że generatywny komponent obrazu ma kluczowe znaczenie dla wydajności systemu.
Zamiast Nano-Banana-Pro testowano także generatory obrazów o otwartych wagach. FLUX.2 [dev] i Qwen-Image-Edit-2511 osiągały porównywalne wyniki w niektórych prostszych zadaniach, szczególnie w inpaintingu, ale były mniej stabilne w bardziej wymagających transformacjach, takich jak szacowanie głębi i śledzenie ścieżek. Podobne wyniki uzyskano, gdy jako VLM wykorzystano Qwen-3.5-27B:
![Wyniki testów porównujących generatory obrazów z Qwen-3.5-27B jako VLM. Nano-Banana-Pro osiągnął najlepszy wynik w pięciu z sześciu zadań, natomiast FLUX.2 [dev] i Qwen-Image-Edit-2511 poprawiły wyniki względem No Tools w kilku zadaniach.](https://www.unite.ai/wp-content/uploads/2026/09/table-6-1.jpg)
Wyniki testów porównujących generatory obrazów z Qwen-3.5-27B jako VLM. Nano-Banana-Pro osiągnął najlepszy wynik w pięciu z sześciu zadań, natomiast FLUX.2 [dev] i Qwen-Image-Edit-2511 poprawiły wyniki względem No Tools w kilku zadaniach.
Autorzy przeprowadzili także testy jakościowe w czterech zadaniach:

Przykłady jakościowe z czterech zadań pokazują, jak ReImaGin został użyty do poszerzenia rozumowania Gemini-3.1-Pro. W każdym przypadku wygenerowane reprezentacje wizualne włączono do procesu rozumowania, aby pomóc w rozwiązaniu zadania.
ReImaGin nie był niezawodny w każdej sytuacji. W niektórych przypadkach generator obrazów tworzył niedokładną transformację, na przykład plan pomieszczenia z obiektami w niewłaściwych miejscach. W innych poprawnie wygenerowany obraz był następnie błędnie odczytywany przez model VLM.
W ręcznym audycie 120 wygenerowanych obrazów stwierdzono, że 75% wiernie wykonało żądaną transformację. Gdy tak się stało, odpowiedź końcowa była poprawna w 87% przypadków, w porównaniu z 43% wtedy, gdy wygenerowany obraz był niedokładny.
Autorzy podsumowują:
„Nasze wyniki wskazują na dwa szersze wnioski. Po pierwsze, generowanie obrazów może działać jako ogólny mechanizm wyobraźni wizualnej w rozumowaniu multimodalnym, zmniejszając potrzebę projektowania oddzielnego narzędzia do każdej nowej transformacji”.
„Po drugie, skuteczność tego podejścia zależy nie tylko od modeli bazowych, ale także od strategii rozumowania używanej do decydowania, co zwizualizować i jak wykorzystać wynik”.
„Korzyści z automatycznego odkrywania strategii pokazują, że modele mogą wykorzystać swoje rozumienie transformacji wizualnych do znajdowania odpowiednich strategii bez pisanych przez ludzi strategii dla konkretnych zadań lub przykładów rozumowania”.
Podsumowanie
Samodzielne decyzje dotyczące użycia narzędzi, takie jak badane w tej pracy, są fascynującym kierunkiem rozwoju, zwłaszcza że rozwój modeli VLM wydaje się naturalnie zmierzać w tę stronę. Jestem ciekaw, czy tak wszechstronne modele VLM będą ostatecznie działać równie dobrze jak wyspecjalizowane narzędzia i struktury, na przykład ekosystem Segment, oraz czy osoby zajmujące się wyłącznie tymi „zadaniami pobocznymi” nie skończą z armatą do zabijania muchy.
Trudno jednak uwierzyć, że modele VLM mogłyby rozwinąć dyscyplinę potrzebną do wyprzedzenia i utrzymania przewagi nad wyspecjalizowanymi rozwiązaniami, takimi jak lokalne dostrajanie, w którym cały model zostaje przeznaczony do jednego zadania i często staje się przy tym bezużyteczny do innych zastosowań. Czas pokaże.
* Możliwa definicja domeny obrazowania, której uczymy się na długo przed nabyciem jakichkolwiek umiejętności językowych.
Po raz pierwszy opublikowano w poniedziałek 28 września 2026 roku












