Взгляд Anderson

ИИ, использующий изображения в рассуждениях Chain-of-Thought (CoT)

mm
Добавьте Unite.AI в избранные источники в Google
Derived from René Magritte, La condition humaine (The Human Condition), 1933. © Photothèque R. Magritte / ADAGP / DACS Images. Collection: National Gallery of Art, Washington. Extended laterally by GPT Image 2.

Мы часто думаем образами — по крайней мере большинство из нас: исследования показали, что у людей сниженная способность к визуальному воображению связана с более низкой успеваемостью. Что касается запоминания — нашей потребности помнить сведения, а не опасения по поводу ИИ — значительная смысловая сила ярких и выразительных образов тысячелетиями использовалась как средство обучения:

«Храм времени» Эммы Уиллард (1846) — образовательная визуализация, превращающая хронологию в физическое пространство и располагающая исторические периоды и личности в уходящей вдаль архитектурной перспективе. Уиллард создавала такие изображения как визуальные мнемонические средства, полагая, что графические представления помогают учащимся сформировать целостную мысленную картину истории. Источник - https://publicdomainreview.org/essay/emma-willard-maps-of-time/

«Храм времени» Эммы Уиллард (1846) — образовательная визуализация, превращающая хронологию в физическое пространство и располагающая исторические периоды и личности в уходящей вдаль архитектурной перспективе. Уиллард создавала такие изображения как визуальные мнемонические средства, полагая, что графические представления помогают учащимся сформировать целостную мысленную картину истории. Источник

Однако мнемоника относится к усвоению данных, а не к их обработке или интерпретации, где люди значительно различаются по используемым «стилям» мышления.

Лично я мыслю формами и делаю это столько, сколько вообще себя помню: десятилетия, годы, идеи и люди каким-то образом представлены относительной геометрией и динамическими объёмными блоками. Другие мыслят прежде всего числами, а кто-то — запахами или вкусами.

Для ИИ возможный спектр методов синестезии более ограничен. Большая языковая модель (LLM), естественно, может мыслить текстом, поскольку это её исходный тип кодирования над уровнем эмбеддингов. Также было показано, что LLM кодируют числа как понятия, а не как чистые значения переменных, проявляя склонность «мыслить числами».

Но в какой мере можно сказать, что LLM «мыслит формами» или «мыслит изображениями» так, как склонны делать люди?

Тот факт, что на один и тот же вопрос, заданный на разных языках, LLM даёт разные ответы, показывает, что такие связи могут быть очень специфичными и хрупкими, а также жёстко привязанными к конкретному тексту в пределах одной языковой области — например, «испанского» — вместо того чтобы относиться к области более высокого уровня, которая превосходит язык и одновременно его содержит*.

Следовательно, мультимодальная LLM — то есть визуально-языковая модель, или VLM — способная создавать изображения исключительно для собственной внутренней цепочки рассуждений (COT), логически может получить преимущество — или по крайней мере буквально иную точку зрения.

Новые точки зрения

Исходя из этого, недавняя исследовательская группа из Германии предложила ориентированную на изображения VLM под названием ReImaGin, которая использует генерацию изображений как гибкий механизм рассуждения.

Хотя в предыдущих работах к системам «прикручивали» компоненты на основе изображений, эти функции не были ни внутренними, ни обязательными для основного процесса. Новая система авторов, напротив, рассчитана на использование самых последних возможностей VLM, чтобы заменить и перенять функциональность специализированных инструментов и методов, таких как восприятие глубины.

В приведённом ниже примере из новой статьи под названием Reasoning with Image Generation ИИ должен интерпретировать два вида — крайние изображения слева, — причём ни один из них не содержит всей информации, необходимой для решения задачи. Поэтому модель может использовать имеющиеся сведения, чтобы представить более широкую и полную картину сцены — карту с подзаголовком «Generated Visualization», третье изображение слева внизу.

Пример из новой статьи: ReImaGin создаёт карту вида сверху по двум неполным ракурсам, предоставляя модели единое визуальное представление для дальнейшего рассуждения. Источник - https://arxiv.org/pdf/2609.16409

Пример из новой статьи: ReImaGin создаёт карту вида сверху по двум неполным ракурсам, предоставляя модели единое визуальное представление для дальнейшего рассуждения. Источник

ReImaGin не привязана к одному типу визуального преобразования. Она может заполнять недостающие области головоломки, устранять перекрытия для подсчёта, рисовать траектории для предсказания столкновений, объединять несколько видов в пространственные карты, превращать пунктирные пути в сплошные линии для отслеживания и создавать карты глубины для рассуждения о глубине.

Ещё важнее то, что система способна сама регулировать использование этого внутреннего набора инструментов в соответствии с недавно появившейся у VLM способностью автоматически решать отдельные задачи подходящими средствами, например оценкой глубины. Большинство описанных функций ReImaGin вызывается через инструмент generate_image — функцию, которая при необходимости может вмешиваться визуально без контроля или команды человека.

Авторы пишут:

«Поскольку generate_image принимает произвольные инструкции на естественном языке, агент может выполнять огромное разнообразие преобразований; вопрос заключается в том, какое преобразование действительно поможет в конкретной задаче.

«[Стандартная] практика состоит в том, чтобы задавать преобразование с помощью созданных вручную контекстных примеров, демонстрирующих нужную стратегию — например, создание карты глубины для рассуждения о глубине. Это требует ручной работы для каждой задачи и ограничивает обобщение на новые задачи».

«[Мы] спрашиваем, можно ли обнаруживать такие стратегии автоматически. Поскольку стратегия передаётся агенту через его промпт, обнаружение стратегии сводится к оптимизации промпта: мы создаём итерационный цикл, в котором модель-предложитель генерирует кандидаты промптов, оценивает их на небольшом наборе разработки и совершенствует с учётом наблюдаемых успехов и неудач».

В испытаниях на трёх VLM и шести задачах визуального рассуждения ReImaGin с помощью одного инструмента в целом превзошла как рассуждение без поддержки, так и специализированные инструменты компьютерного зрения.

Подход

ReImaGin работает циклически: на каждом шаге VLM рассматривает вопрос, исходные изображения и всё, что уже было создано, а затем решает, что делать дальше. Это могут быть обычные операции с изображением, такие как обрезка или наложение, либо вызов generate_image, создающий новое изображение специально для того, чтобы облегчить рассуждение над задачей:

Пошаговая иллюстрация того, как ReImaGin рассуждает над пространственными задачами и визуальными головоломками. В обоих примерах модель создаёт новое изображение в процессе рассуждения, а затем использует его как дополнительный вход для последующих шагов к ответу.

Пошаговая иллюстрация того, как ReImaGin рассуждает над пространственными задачами и визуальными головоломками. В обоих примерах модель создаёт новое изображение в процессе рассуждения, а затем использует его как дополнительный вход для последующих шагов к ответу.

Созданное изображение затем возвращается в VLM, становясь частью материала, доступного для следующего шага рассуждения, и процесс может повторяться. На изображении выше эти элементы показаны для пространственной задачи: модель сначала объединяет две фотографии в единый вид, затем превращает результат в карту сверху и только после этого отвечает на вопрос.

В задаче с головоломкой модель создаёт изменённую версию головоломки, изолирующую недостающую область, а затем применяет обычное вычитание изображений, чтобы определить ответ.

Таким образом, генерация изображений становится частью самого процесса рассуждения, а не конечным продуктом для пользователя. Эти промежуточные изображения предназначены исключительно для COT-процессов ИИ и не рассчитаны на непосредственное восприятие конечным пользователем.

На каждом этапе VLM самостоятельно выбирает следующее действие из накопленного контекста. Это может быть ещё один шаг рассуждения, обычная операция с изображением или инструкция на естественном языке для generate_image. Любой результат выбранного инструмента добавляется к контексту, позволяя модели изучить его и решить, следует ли снова преобразовать изображение, использовать другой инструмент или перейти к окончательному ответу.

Обретение самостоятельности

Главная проблема — определить, какой именно тип изображения действительно облегчит конкретную задачу. ReImaGin решает это, экспериментируя с различными инструкциями для агента, проверяя промпты-кандидаты на примерах с известными ответами и используя удачные и неудачные попытки для получения лучших промптов. Последующие итерации этого цикла в итоге создают наиболее эффективные стратегии.

Сама модель рассуждения и генератор изображений в ходе этого процесса не переобучаются; оптимизируются только инструкции, определяющие, как агент использует свои инструменты. Поэтому исследователи называют этот процесс «автоматическим обнаружением» стратегий визуального рассуждения, не предоставляя самостоятельно ни стратегий для конкретных задач, ни примеров рассуждения.

Конфигурация и испытания

ReImaGin оценивали в шести задачах визуального рассуждения: рассуждение о глубине (Blink — определение того, какая из двух точек ближе к камере); завершение головоломки (Mira — выбор правильного фрагмента для недостающей области изображения); подсчёт с перекрытиями (CAPTURe — подсчёт объектов, включая скрытые); предсказание столкновений (Spatial457 — прогноз того, в какой объект врежется движущаяся цель); пространственное рассуждение (MMSI — определение связей между объектами в разных видах); и отслеживание пути — новый тест, в котором модели должны прослеживать пунктирные линии, соединяющие числа с буквами.

Из статьи 'MIRA, a Benchmark for Visual Chain-of-Thought': яркие примеры визуальных образов в процессах цепочки рассуждений. Источник - https://arxiv.org/pdf/2511.02779

Из статьи «MIRA, a Benchmark for Visual Chain-of-Thought»: яркие примеры визуальных образов в процессах цепочки рассуждений. Источник

В качестве базовых VLM испытывались Gemini-3.1-Pro, GPT-5 и модель с открытыми весами Qwen-3.5-27B. За генерацию изображений в основном отвечала Nano-Banana-Pro, но также испытывались модели с открытыми весами FLUX.2 [dev] и Qwen-Image-Edit-2511. Gemini-3.1-Pro использовалась как селектор для масштабирования генерации изображений во время тестирования.

Из двух базовых подходов для сравнения «обычная» VLM, которую авторы статьи назвали «No Tools», отвечала непосредственно на основе запроса и изображений, без инструментов и выполнения кода. Система Visual Sketchpad 2024 года в данном случае предлагала фиксированный набор специализированных инструментов зрения и обработки изображений, но не допускала свободной генерации изображений.

Для пространственной задачи MMSI обеим базовым системам предоставили примерно столько же вычислительных ресурсов, сколько ReImaGin: от каждой генерировали 20 ответов и выбирали тот, который встречался чаще всего.

Производительность во всех задачах, кроме подсчёта с перекрытиями, измерялась точностью ответов с несколькими вариантами. Подсчёт с перекрытиями оценивали по симметричной средней абсолютной процентной ошибке, сравнивая прогнозируемое и фактическое количество объектов. Результаты усреднялись по трём запускам; также сообщалась стандартная ошибка.

Результаты испытаний, сравнивающие ReImaGin с No Tools и Visual Sketchpad на трёх VLM и шести задачах визуального рассуждения. Чем выше результат, тем лучше, за исключением Подсчёта с Перекрытиями, где лучше меньшая ошибка. ReImaGin показала лучший результат в большинстве сочетаний модели и задачи.

Результаты испытаний, сравнивающие ReImaGin с No Tools и Visual Sketchpad на трёх VLM и шести задачах визуального рассуждения. Чем выше результат, тем лучше, за исключением Подсчёта с Перекрытиями, где лучше меньшая ошибка. ReImaGin показала лучший результат в большинстве сочетаний модели и задачи.

На всех трёх моделях использовались одни и те же примеры стратегий, заданные людьми. В большинстве задач ReImaGin показала лучшие результаты, чем обе базовые системы, с особенно явным улучшением при завершении головоломок, подсчёте с перекрытиями и отслеживании пути.

Например, на GPT-5 точность решения головоломок выросла с 29,5% у No Tools и 16,7% у Visual Sketchpad до 44,9% с ReImaGin. Абляционные тесты подтвердили, что генеративный компонент изображений необходим для производительности системы.

Вместо Nano-Banana-Pro также испытывались генераторы изображений с открытыми весами: FLUX.2 [dev] и Qwen-Image-Edit-2511 давали сопоставимые результаты в некоторых более простых задачах, особенно при восстановлении изображений, но были менее стабильны при более сложных преобразованиях, таких как оценка глубины и отслеживание пути. Сходные результаты были получены, когда в качестве VLM использовалась Qwen-3.5-27B:

Результаты испытаний генераторов изображений с Qwen-3.5-27B в качестве VLM. Nano-Banana-Pro показала лучший результат в пяти из шести задач, а FLUX.2 [dev] и Qwen-Image-Edit-2511 улучшили показатели No Tools в нескольких задачах.

Результаты испытаний генераторов изображений с Qwen-3.5-27B в качестве VLM. Nano-Banana-Pro показала лучший результат в пяти из шести задач, а FLUX.2 [dev] и Qwen-Image-Edit-2511 улучшили показатели No Tools в нескольких задачах.

Авторы также провели качественные испытания на четырёх задачах:

Качественные примеры по четырём задачам показывают, как ReImaGin использовалась для расширения возможностей рассуждения Gemini-3.1-Pro. В каждом случае созданные визуальные представления включались в процесс рассуждения, чтобы помочь решить задачу.

Качественные примеры по четырём задачам показывают, как ReImaGin использовалась для расширения возможностей рассуждения Gemini-3.1-Pro. В каждом случае созданные визуальные представления включались в процесс рассуждения, чтобы помочь решить задачу.

ReImaGin была надёжна не во всех случаях: иногда генератор изображений создавал неточное преобразование — например, план помещения с объектами в неверных местах; в других случаях VLM затем неверно считывала точно созданное изображение.

При ручной проверке 120 сгенерированных изображений выяснилось, что 75% точно выполнили запрошенное преобразование. Когда это удавалось, итоговый ответ был верным в 87% случаев, по сравнению с 43%, когда созданное изображение оказывалось неточным.

Авторы заключают:

«Наши результаты позволяют сделать два более общих вывода. Во-первых, генерация изображений может выступать общим механизмом визуального воображения в мультимодальном рассуждении, уменьшая необходимость создавать отдельный инструмент для каждого нового преобразования.

«Во-вторых, эффективность этого подхода зависит не только от базовых моделей, но и от стратегии рассуждения, используемой для решения, что визуализировать и как применять результат.

«Преимущества автоматического обнаружения стратегий показывают, что модели могут использовать своё понимание визуальных преобразований для поиска подходящих стратегий без созданных человеком стратегий для конкретных задач или примеров рассуждения».

Заключение

Решения о самостоятельном использовании инструментов, подобные исследованным в этой работе, представляют собой увлекательное развитие, тем более что эволюция VLM и без того естественным образом движется в этом направлении. Мне интересно, смогут ли такие универсальные VLM в конечном итоге работать столь же хорошо, как специализированные инструменты и платформы, например экосистема Segment, и не окажется ли поэтому, что занимающиеся исключительно такими «побочными задачами» используют кувалду, чтобы расколоть орех.

Трудно поверить, что VLM смогут выработать дисциплину, необходимую для того, чтобы превзойти и удержать лидерство над специализированными решениями вроде локальной тонкой настройки, где вся модель отдаётся одной задаче и в процессе часто становится бесполезной для любой другой. Время покажет.

 

* Возможное определение области образов, которую мы осваиваем задолго до приобретения любых языковых навыков.

Впервые опубликовано в понедельник, 28 сентября 2026 года

mm

Автор в области машинного обучения, специалист по синтезу человеческих изображений. Бывший руководитель отдела исследовательского контента в Metaphysic.ai, до его объединения с Brahma.ai от DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai