Взгляд Anderson
Пазлы Джигсо Улучшают Визуальное Рассуждение ИИ

Новые исследования показывают, что модели ИИ могут стать умнее в распознавании изображений, решая пазлы Джигсо. Перестановка перемешанных изображений, видео и 3D-сцен помогает им улучшить свои визуальные навыки без необходимости дополнительных данных, меток или инструментов.
В настоящее время в спешке продвигать Мультимодальные Большие Языковые Модели (МБЯМ) впереди конкурентов (или хотя бы остаться на три выпуска впереди ближайшего соперника), есть мало легких побед и нет бесплатных обедов.
Хотя многие из впечатляющих китайских открытых выпусков 2025 года, как сообщается, имеют ниже затраты на разработку и эксплуатацию, западные выпуски склонны бросать больше на проблему: больше объема данных, больше мощности вывода, больше электричества (хотя не, как мы недавно отметили, больше фактических человеческих аннотаторов, поскольку это слишком дорого даже для $трлн+ масштаба генерации ИИ).
В научной литературе большинство якобы ‘бесплатных’ подходов к эволюции архитектур ИИ склонны предлагать только незначительные инкрементные улучшения; или же улучшения в областях, которые не являются наиболее критически преследуемыми. Тем не менее, поиск ранее неоткрытых ‘фундаментальных принципов’, которые могли бы ускорить темп развития, слишком заманчив, чтобы отказаться от него.
Сборка Пазла
Хотя это не совсем в том же категории, новое академическое сотрудничество между китайскими учреждениями утверждает, что оно определило, что заставляя МБЯМ решать пазлы Джигсо улучшает их производительность заметно, даже хотя этот подход к обучению с подкреплением ранее показал относительно плохие результаты в этой области, и даже хотя для этого не требуется дополнительных систем, вспомогательных моделей или других ‘прикрепленных’ процессов:

Визуальный Джигсо – это самоконтролируемый пост-обучающий каркас, который улучшает визуально-ориентированные навыки в мультимодальных больших языковых моделях. Обучаясь на задачах Джигсо через изображения, видео и 3D-данные, модели получают более четкое мелкозернистое, пространственное и композиционное восприятие в изображениях, более сильное временное рассуждение в видео и повышенное понимание геометрии в 3D-сценах. Радарные графики на изображении выше показывают постоянные выигрыши над базовой Qwen2.5-VL, с масштабами значений, скорректированными для каждого бенчмарка для ясности. Источник: https://arxiv.org/pdf/2509.25190
Система, разработанная исследователями, называется Визуальный Джигсо, и включает в себя обучение существующих МБЯМ на материале, который был фрагментирован и случайно разбросан, как пазл. Авторы разработали три модальности для этого подхода: изображение, видео и 3D (т.е. CGI-стиль мешей), и обнаружили, что умеренная адаптация одного и того же процесса принесла пользу всем трем доменам:

Представление трех задач Визуального Джигсо. В задаче Джигсо для изображений изображение делится на фрагменты, перемешивается, и модель предсказывает правильную компоновку; в задаче Джигсо для видео клипы перемешиваются, и модель восстанавливает их порядок во времени; в задаче Джигсо для 3D-точек с разными глубинами перемешиваются, и модель ранжирует их от ближайшего к дальнему. Выходные данные модели оцениваются по отношению к эталонным данным, с частичным кредитом, данным за частично правильные решения.
Метод обучения Визуального Джигсо помогает моделям ИИ улучшать понимание визуальной информации, заставляя их собирать эти перемешанные изображения, видеоклипы или 3D-данные.
Процесс основан на словах, а не на изображениях, и поэтому нет необходимости для модели генерировать изображения или использовать какие-либо дополнительные визуальные компоненты. Этот метод вписывается в систему, называемую Обучение с подкреплением из верифицируемых наград (RLVR), где модель получает награду за правильные ответы на основе ясных, автоматических правил; и где, следовательно, не требуется человеческая маркировка.
Этот важный факт на самом деле трудно понять из новой статьи: что система собирает пазл семантически, через описания, и не в том виде, в котором люди учатся решать такие пазлы:

Из дополнительного материала новой статьи, пример задачи RL, иллюстрирующий текстовую природу этого дополнительного процесса обучения. Изображения, которые были бы показаны МБЯМ, не изображены здесь.
Хотя МБЯМ обрабатывают обширные визуально-ориентированные задачи, они являются языково-ориентированными архитектурами, а не предназначены для генерации изображений, видео или представлений форм, таких как 3D-меши.

Примеры из задачи Джигсо для изображений. Каждый ряд показывает перемешанные фрагменты, которые модель должна переставить в их исходную компоновку, с правильной компоновкой, показанной справа.
В любом случае, этот тип обучения выполняется после основной фазы обучения, когда модель уже имеет некоторую способность понимать изображения.
Предыдущие подходы, такие как статья 2017 года швейцарских Непervised Learning of Visual Representations by Solving Jigsaw Puzzles использовали этот тип подхода к обучению с подкреплением с относительно меньшим успехом на свёрточных нейронных сетях (СНС), заметно другой тип архитектуры по сравнению с современным МБЯМ.

Из выпуска 2017 года ‘Непervised Learning of Visual Representations by Solving Jigsaw Puzzles ‘, ранний пример использования фрагментации в качестве награды для нейронной системы. Источник: https://arxiv.org/pdf/1603.09246
В тестах Визуальный Джигсо привел к тому, что авторы утверждают, что это последовательные и измеримые улучшения в широком диапазоне бенчмарков: задача Джигсо для изображений улучшила мелкозернистое восприятие, понимание пространственной компоновки и композиционное рассуждение; задача Джигсо для видео усилила способность модели отслеживать временные последовательности и рассуждать о порядке событий; и задача Джигсо для 3D усилила понимание, основанное на глубине, и пространственное рассуждение, используя только RGB-D входы.
По всем трем модальностям статья повторяет, что новый метод превзошел несколько конкурентных бенчмарков, несмотря на то, что не требует архитектурных изменений, дополнительных визуальных модулей или дополнительных контролируемых данных:
‘Обширные эксперименты демонстрируют существенные улучшения в мелкозернистом восприятии, временном рассуждении и 3D-пространственном понимании. Наши результаты подчеркивают потенциал самоконтролируемых визуально-ориентированных задач в пост-обучении МБЯМ и направлены на вдохновение дальнейших исследований по визуально-ориентированным задачам-предшественникам.’
Новая статья называется Визуальный Джигсо Пост-Обучение Улучшает МБЯМ, и исходит от шести исследователей из Наньянского технологического университета, Университета Линкёпинга и Исследовательского центра SenseTime. Статья сопровождается сайтом проекта с живыми демонстрациями (и вы даже можете загрузить свое собственное изображение в демонстрацию Джигсо для изображений). Код и веса для проекта были опубликованы,
Метод
Хотя мы рассмотрим, как информация разбита для трех протестированных модальностей, мы должны сначала рассмотреть систему наград для новой системы.
Подход Визуального Джигсо оценивает ответы модели с помощью градуированной награды, а не простого прохода или провала. Если модель предсказывает точный правильный порядок фрагментов пазла, она получает полную награду; если ответ в основном правильный, но не идеальный, модель получает частичный кредит, масштабированный с помощью коэффициента дисконтирования, чтобы избежать переоценки gầnких промахов (это предотвращает, чтобы модель не манипулировала системой, повторяя догадки, которые только частично правильны).
Недействительные ответы, такие как ‘обман’ использования одного и того же числа повторно, получают оценку ноль. Чтобы поощрить последовательное форматирование, модель должна размещать свое рассуждение внутри <think> тегов и свое окончательное решение внутри <answer> тегов. Она получает небольшой бонус, если этот формат используется правильно.
Изображения
Чтобы создать пазл для изображений модальности, изображение сначала делится на сетку фрагментов, разрезая его на равные блоки:

Примеры фрагментов изображений для системы решения.
Фрагменты располагаются в фиксированном порядке слева направо, как при чтении страницы, прежде чем быть перемешанными с помощью случайной перестановки. Модель затем подвергается этому перемешанному набору фрагментов и должна выяснить исходный порядок, предсказав правильную перестановку, которая восстанавливает исходную компоновку.
При обучении использовалось 118 000 изображений из датасета COCO, с каждым изображением, дающим девять фрагментов (т.е. ‘фрагменты пазла’). Промпт, данный системе, показан ранее в этой статье (изображение выше с подписью, начинающейся ‘Из дополнительного материала новой статьи’).
Видео
Для задачи Джигсо для видео видео разрезается на последовательность клипов, разрезая его равномерно во времени, и затем перемешивая клипы. Модель затем показывается этому перемешанному последовательности, и должна выяснить их правильный, исходный хронологический порядок.

Обрезанные примеры видео-пазла, из дополнительного материала статьи.
Обучение для этой модальности использовало 100 000 видео из датасета LLaVA-Video, с каждым видео, разрезанным на шесть клипов. Чтобы предотвратить, чтобы модель не эксплуатировала очевидные совпадения кадров на границах клипов, 5% кадров в начале и конце каждого клипа были обрезаны.
Клипы не содержали более 12 кадров, каждый с максимальным разрешением 128x28x28 пикселей. Видео, короче 24 секунд, были исключены.
Промпт для этой задачи показан ниже:

Промпт обучения с подкреплением, представленный МБЯМ для видео-задачи, без клипов, которые были бы представлены МБЯМ..
3D-Данные
Полная задача Джигсо для 3D обычно включала бы разбиение 3D-пространства (такого как воксельные блоки или фрагменты облака точек) на меньшие части и обучение модели на восстановление их исходной пространственной компоновки.
Однако средняя МБЯМ не способна обрабатывать сырые 3D-данные напрямую, вместо этого полагаясь на семантически-интерпретированные изображения или видео-входы. Поэтому, чтобы создать задачу, которая все еще использует 3D-рассуждение, оставаясь совместимой с текущими МБЯМ, авторы ввели более тривиальную вариацию, используя вышеупомянутые RGB-D изображения (т.е. 2D-изображения, которые включают информацию о глубине для каждого пикселя).

Примеры вопросов из 3D-Понимания Бенчмарка, используемого для оценки производительности относительно точки зрения и движения камеры. Модель Джигсо для 3D правильно выводит как пространственные отношения между двумя видами сцены, так и вероятное направление вращения камеры, превосходя базовую Qwen2.5-VL-7B.
Из каждого RGB-D изображения модель получает перемешанный список точек, которые изначально имели разные глубины, варьирующиеся от ближайших до дальших, целью является восстановление их правильного порядка глубины, используя только 2D-изображение в качестве справочного:

Промпт RL для Джигсо для 3D.
Каждая точка помечена на изображении (которое показывается модели, но не визуализируется в примере промпта выше), и модель должна предсказать, какая была ближайшей, второй ближайшей и так далее, эффективно восстанавливая исходную последовательность глубины без доступа к сырым значениям глубины.
Задача Джигсо для 3D обучается на RGB-D изображениях из датасета ScanNet, используя 300 000 образцов, созданных путем выбора случайных наборов из шести точек глубины на изображение.

Примеры облаков точек из датасета ScanNet, используемого в Джигсо для 3D. Источник: https://arxiv.org/pdf/1702.04405
Каждая точка должна была находиться в диапазоне глубины от 0,1 до 10 метров, и чтобы способствовать разнообразию, никакие две точки в наборе не могли быть ближе 40 пикселей в плоскости изображения или менее 0,2 метра друг от друга в глубине.
Тесты
Для начальных тестов система использовала Qwen2.5-VL-7B-Instruct в качестве базовой мультимодальной модели. Обучение использовало алгоритм Group Relative Policy Optimization (GRPO), с удаленными KL-регуляризацией и энтропийной потерей.
Для частичных предсказаний коэффициент дисконтирования 0,2 был применен. Обучение Джигсо для изображений использовало глобальный батч-размер 256, в то время как Джигсо для видео и 3D использовали 128. Скорость обучения была установлена на 1×10⁻⁶.
Для каждого промпта модель генерировала 16 ответов при температуре декодирования 1,0. Обе задачи Джигсо для изображений и видео были обучены в течение 1000 шагов, в то время как задача Джигсо для 3D была обучена в течение 800 шагов.
Джигсо для Изображений
Модель Джигсо для изображений была протестирована на трех категориях визуально-ориентированных бенчмарков: для мелкозернистого восприятия и понимания, MMVP, подмножество мелкозернистого восприятия MMStar; MMBench; HR-Bench; V*; MME-RealWorld (lite); LISA-Grounding; и OVD-Eval.
Для монокулярного пространственного понимания бенчмарки были VSR; OmniSpatial; и Depth Anything V2 (DA-2K). Для композиционного визуального понимания тесты использовали Winoground и SugerCrepe++.
Три бенчмарка были протестированы, все полученные из Qwen2.5-VL-7B: ThinkLite-VL для мультимодального рассуждения; VL-Cogito для общих визуальных и научных задач; и LLaVA-Critic-R1 для восприятия изображений.
Все они были оценены, используя только короткие ответы, поскольку цепочка рассуждений (CoT) иногда снижала производительность.

Результаты оценки на бенчмарках изображений. Джигсо для изображений улучшил производительность на базовой модели Qwen2.5-VL-7B во всех категориях задач (т.е. мелкозернистое восприятие и понимание; монокулярное пространственное понимание; и композиционное визуальное рассуждение), превосходя предыдущие пост-обученные бенчмарки.
Из результатов Джигсо для изображений, показанных выше, авторы утверждают:
‘[Изображение выше] показывает, что наш метод последовательно улучшает визуально-ориентированные возможности на трех типах бенчмарков. Эти результаты подтверждают, что включение пост-обучения Джигсо для изображений значительно улучшает визуальное основание и мелкозернистое понимание МБЯМ за пределами рассуждений-ориентированных стратегий пост-обучения. ‘
‘Мы приписываем эти улучшения тому факту, что решение задач Джигсо для изображений требует от модели обращать внимание на местные детали фрагментов, выводить глобальные пространственные компоновки и рассуждать о взаимосвязях между фрагментами, что напрямую выигрывает от мелкозернистого, пространственного и композиционного понимания.’
Джигсо для Видео
Для Джигсо для видео оценка была проведена на AoTBench; Vinoground; TOMATO; FAVOR-Bench; TUNA-Bench; Video-MME; TempCompass; TVBench; MotionBench; LVBench; VSI-Bench; Video-TT; и CVBench.
Video-R1 был использован в качестве бенчмарка, обученного с холодным стартом контролируемым тонким настроением, за которым последовало обучение с подкреплением для понимания и рассуждения видео. В этом случае оценки включали полный процесс рассуждения, поскольку это последовательно давало лучшие результаты, чем прямые ответы.
Все модели были ограничены 256x28x28 пикселями и протестированы на трех настройках кадров – 16, 32 и 64:

Результаты оценки на видео-бенчмарках, с Джигсо для видео, последовательно превосходящим бенчмарк во всех задачах и настройках кадров.
Джигсо для видео произвел последовательные улучшения во всех видео-бенчмарках и настройках кадров, с выигрышами, особенно сильными в задачах, требующих временного рассуждения и направленности, таких как те, что в AoTBench, и также в межвидовых бенчмарках, таких как CVBench:
‘Эти результаты подтверждают, что решение задач Джигсо для видео поощряет модель лучше захватить временную непрерывность, понять отношения между видео, рассуждать о направленности и обобщать на целостные и обобщаемые сценарии видео-понимания.’
3D-Данные
Для 3D-модальности модель была оценена на SAT-Real; 3DSRBench; ViewSpatial; All-Angles; вышеупомянутый OmniSpatial; VSI-Bench; SPARBench (tiny); и вышеупомянутый DA-2K.

Результаты оценки на 3D-бенчмарках: Джигсо для 3D улучшил производительность на задачах сравнения глубины, таких как DA-2K, а также на более широких 3D-бенчмарках, охватывающих входы одного вида, нескольких видов и эгоцентрического видео.
Здесь авторы утверждают:
‘[3D] Джигсо достигает значительных улучшений на всех бенчмарках. Неудивительно, что самый большой выигрыш наблюдается на DA-2K, бенчмарке оценки глубины, который напрямую связан с нашей задачей пост-обучения упорядочения глубины. Более важно, мы наблюдаем последовательные улучшения на широком диапазоне других задач, включая те, которые имеют входы одного вида (например, 3DSRBench, [OmniSpatial]), нескольких видов (например, ViewSpatial, All-Angles) и эгоцентрического видео (например, VSI-Bench). ‘
‘Эти результаты демонстрируют, что наш подход не только учит конкретный навык упорядочения глубины, но также эффективно укрепляет общую способность модели воспринимать и рассуждать о 3D-пространственной структуре.’
Вывод
Что не совсем ясно из этой статьи, так это точная связь между изображениями и описаниями, которая стимулирует это улучшение в производительности МБЯМ.
На первый взгляд, процесс обучения через решение пазлов кажется очень аналогичным нашим собственным ранним попыткам и развитием. Однако наш собственный пространственный взгляд на мир интуитивно чувствуется менее семантическим и связанным с языком, и более глубокий взгляд на статью показывает, насколько язык служит МБЯМ как интригующий мост между визуальной и семантической реальностью.
* Пожалуйста, обратите внимание, что авторы статьи предпочитают менее распространенный термин ‘Мультимодальные Большие Языковые Модели’, сокращенный до ‘МБЯМ’. Это возникающий или редко используемый термин, и применяется к моделям, которые могут обширно рассуждать и анализировать изображения пространственно, но которые не генерируют изображения. По мере появления новых парадигм и моделей этот лексикон находится под постоянным пересмотром.
Опубликовано в первый раз в четверг, 2 октября 2025












