Погляд Anderson

Пазли Джигсо Покращують Візуальне Розуміння Штучного Інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google
'An industrial robot attempting to solve a jigsaw puzzle. Besides one robotic arm with which it assembles the puzzle, the robot is not anthropomorphic , and views the jigsaw puzzle with a single camera similar to a surveillance camera UHQ, stock'. SDXL and Adobe Firefly V3.

Нові дослідження показують, що моделі штучного інтелекту можуть стати розумнішими у сприйнятті візуальної інформації, розв’язуючи пазли Джигсо. Переставляння перемішаних зображень, відео та 3D-сцен giúp їм розвинути свої візуальні навички без потреби додаткових даних, міток або інструментів.

 

У сучасній гонитві за розвиток Мультимодальних Великомасштабних Моделей Мови (MLLMs*) впереди конкурентів (або хоча б утримувати три випуски попереду найближчого суперника), немає легких перемог і безкоштовних обідів.

Хоча багато з впечатливих відкритих китайських релізів 2025 року мають, як повідомляється, нижчі витрати на розробку і експлуатацію, західні релізи схильні кидати більше у проблему: більше обсягу даних, більше потужності інференсу, більше електрики (хоча не, як ми недавно відзначили, більше фактичних людських аннотаторів, оскільки це занадто дорого навіть для $трільйон+ масштабу революції генеративного ІІ).

У науковій літературі більшість так званих “безкоштовних” підходів до еволюції архітектур ІІ tend до пропонування лише незначних інкрементних поліпшень; або ж поліпшень в областях, які не є найбільш критично переслідуваними. Тим не менш, пошук досі не відкритих “фундаментальних принципів”, які могли б прискорити темп розвитку, є занадто привабливим, щоб його покинути.

Збирання Уламків

Хоча це не зовсім належить до цієї категорії, нове академічне співробітництво між китайськими установами стверджує, що виробництво ВЛМ розв’язуванням пазлів Джигсо покращує їхню продуктивність помітно, навіть якщо цей підхід з підкріпленням раніше мав незначний успіх у цій області, і навіть якщо це вимагає жодних додаткових систем, допоміжних моделей або інших “bolt-on” процесів:

Візуальний Джигсо - це самоорганізований пост-тренувальний каркас, який покращує візуальні навички у мультимодальних великомасштабних моделях мови. Навчання на завданнях Джигсо через зображення, відео та 3D-дані допомагає моделям розвинути гостріше тонко-зернисті, просторові та композиційні сприйняття у зображеннях, сильніше тимчасове розуміння у відео та поліпшене геометричне розуміння у 3D-сценах. Радарні діаграми на зображенні вище показують послідовні здобутки над базовим Qwen2.5-VL, з масштабами цін, скоригованими для кожної оцінки для ясності. Джерело: https://arxiv.org/pdf/2509.25190

Візуальний Джигсо – це самоорганізований пост-тренувальний каркас, який покращує візуальні навички у мультимодальних великомасштабних моделях мови. Навчання на завданнях Джигсо через зображення, відео та 3D-дані допомагає моделям розвинути гостріше тонко-зернисті, просторові та композиційні сприйняття у зображеннях, сильніше тимчасове розуміння у відео та поліпшене геометричне розуміння у 3D-сценах. Радарні діаграми на зображенні вище показують послідовні здобутки над базовим Qwen2.5-VL, з масштабами цін, скоригованими для кожної оцінки для ясності. Джерело: https://arxiv.org/pdf/2509.25190

Система, розроблена дослідниками, називається Візуальний Джигсо, і полягає у навчанні існуючих МЛМ на матеріалі, який був фрагментований і випадково розкиданий, як пазл. Автори розробили три модальності для цього підходу: зображення, відео та 3D (тобто, CGI-стиль меші), і виявили, що помірна адаптація того самого процесу принесла користь усім трьом областям:

Представлення трьох завдань Візуального Джигсо. У завданні Джигсо зображення розділяється на шматки, перемішується, і модель передбачає правильну композицію; у завданні Джигсо з відео кліпи перемішуються, і модель відновлює їхній оригінальний порядок у часі; у 3D Джигсо точки з різними глибинами перемішуються, і модель ранжує їх від найближчої до найдальшої. Вихідні дані моделі оцінюються проти фактичних даних, з частковим kredитом за частково правильні рішення.

Представлення трьох завдань Візуального Джигсо. У завданні Джигсо зображення розділяється на шматки, перемішується, і модель передбачає правильну композицію; у завданні Джигсо з відео кліпи перемішуються, і модель відновлює їхній оригінальний порядок у часі; у 3D Джигсо точки з різними глибинами перемішуються, і модель ранжує їх від найближчої до найдальшої. Вихідні дані моделі оцінюються проти фактичних даних, з частковим kredитом за частково правильні рішення.

Метод навчання Візуального Джигсо допомагає моделям ІІ покращувати розуміння візуальної інформації, змушуючи їх знову зібрати ці перемішані зображення, відеокліпи або 3D-дані.

Цей процес заснований на словах, а не на зображеннях, і тому немає потреби у генерації зображень або використанні додаткових візуальних компонентів. Цей метод вписується у систему, звану Навчання з підкріпленням від верифікованих винагород (RLVR), де модель отримує винагороду за правильні відповіді на основі чітких, автоматичних правил; і де, відповідно, не потрібне людське міткування.

Цей важливий факт насправді важко витягнути з нової статті: що система збирає пазл семантично, через описи, і не у вигляді-репрезентативному способі, яким люди вчаться розв’язувати такі пазли:

З нового паперу додаткового матеріалу, приклад завдання RL, що демонструє текстовий характер цього додаткового процесу навчання.

З нового паперу додаткового матеріалу, приклад завдання RL, що демонструє текстовий характер цього додаткового процесу навчання. Зображення, які мали бути показані МЛМ, не зображені тут.

Хоча МЛМ займаються здебільшого візуальними завданнями, вони є мовними архітектурами, а не призначені для генерації зображень, відео чи форми-представлень, таких як 3D-меші.

Приклади завдання Джигсо зображення. Кожен рядок показує перемішані шматки, які модель повинна впорядкувати у свій оригінальний вигляд, з правильною композицією, показаною праворуч.

Приклади завдання Джигсо зображення. Кожен рядок показує перемішані шматки, які модель повинна впорядкувати у свій оригінальний вигляд, з правильною композицією, показаною праворуч.

У будь-якому випадку, цей тип навчання проводиться після основної фази навчання, коли модель вже має деяку здатність розуміти зображення.

Попередні підходи, такі як 2017-річна швейцарська стаття Навчання візуальних представлень шляхом розв’язування пазлів Джигсо використовували цей підхід з підкріпленням з меншим успіхом на конволюційних нейронних мережах (CNN), досить іншій архітектурі порівняно з сучасною МЛМ.

З 2017 року випуску 'Навчання візуальних представлень шляхом розв'язування пазлів Джигсо ', ранні приклади використання фрагментації як винагороди-орієнтованого виклику для нейронної системи. Джерело: https://arxiv.org/pdf/1603.09246

З 2017 року випуску ‘Навчання візуальних представлень шляхом розв’язування пазлів Джигсо ‘, ранні приклади використання фрагментації як винагороди-орієнтованого виклику для нейронної системи. Джерело: https://arxiv.org/pdf/1603.09246

У тестах Візуальний Джигсо привів до того, що автори стверджують, що послідовні і вимірювані поліпшення по широкому спектру оцінок: завдання Джигсо зображення покращило тонко-зернисте сприйняття, просторове розуміння і композиційне розуміння; завдання Джигсо з відео покращило здатність моделі відстежувати тимчасові послідовності і rozumіти порядок подій; і завдання Джигсо 3D покращило глибинно-орієнтоване розуміння і просторове rozumіння за допомогою лише RGB-D входів.

По всім трьом модальностям папір повторює, що новий метод перевершив кілька конкурентних базових ліній, незважаючи на те, що не вимагає архітектурних змін, додаткових візуальних модулів або додаткових супервізованих даних:

‘Розширені експерименти демонструють суттєві поліпшення тонко-зернистого сприйняття, тимчасового rozumіння і 3D-просторового розуміння. Наші висновки підкреслюють потенціал самоорганізованих візуально-орієнтованих завдань у пост-тренуванні МЛМ і спрямовані на подальші дослідження візуально-орієнтованих pretext-дизайнів.’

Нова стаття називається Візуальний Джигсо Пост-Тренування Покращує МЛМ, і походить від шести дослідників з Наньянського технологічного університету, Лінчепінзького університету та SenseTime Research. Стаття супроводжується сайтом проекту з живими демонстраціями (і ви навіть можете завантажити своє власне зображення у демонстрацію Джигсо зображення). Код і ваги проекту були загально доступні,

Метод

Хоча ми розглянемо, як інформація розділяється для трьох протестованих модальностей, спочатку слід розглянути дизайн винагороди для нової системи.

Підхід Візуального Джигсо оцінює відповіді моделі за допомогою градуйованої винагороди, а не просто простого проходження чи провалу. Якщо модель передбачає точний правильний порядок шматків Джигсо, вона отримує повну винагороду; якщо відповідь частково правильна, але не досконала, модель отримує часткову винагороду, масштабовану фактором дисконтування для уникнення переоцінки майже-помилок (це запобігає моделі грати у систему, повторюючи гіпотези, які тільки частково правильні).

Неправильні відповіді, такі як “обман” використання одного і того ж числа повторно, отримують оцінку нуль. Для заохочення послідовного форматування модель повинна розмістити своє rozumіння всередині <think> тегів і свою остаточну відповідь всередині <answer> тегів. Вона отримує невелику бонусну винагороду, якщо цей формат використовується правильно.

Зображення

Для створення пазла для модальності зображення зображення спочатку розділяється на сітку шматків шляхом розрізання його на рівні блоки:

Приклади зображень-пазлів для розв'язування системою.

Приклади зображень-пазлів для розв’язування системою.

Шматки розташовуються у фіксованому порядку з верхнього лівого до нижнього правого, як при порядку читання на сторінці, перед тим, як бути перемішаними випадковим чином. Модель потім піддається цьому перемішаному набору шматків і повинна розібратися в оригінальному порядку, передбачаючи правильну пермутацію, яка відновлює оригінальну композицію.

Під час навчання використовувалося 118 000 зображень з COCO-датасету, з дев’ятьма шматками (тобто “шматками пазла”) для кожного зображення. Промпт, наданий системі, показаний вище в цій статті (зображення з підписом, що починається з ‘З нового паперу додаткового матеріалу’).

Відео

Для завдання Джигсо з відео відео розрізається на послідовність кліпів шляхом розрізання його рівномірно у часі, а потім перемішується. Модель потім показується цьому перемішаному порядку, і повинна розібратися в їхньому оригінальному хронологічному порядку.

Трюкані приклади відео-виклику, з паперу додаткового матеріалу.

Трюкані приклади відео-виклику, з паперу додаткового матеріалу.

Навчання для цієї модальності використовувало 100 000 відео з LLaVA-Video датасету, з шістьма кліпами для кожного відео. Для уникнення експлуатації очевидних кадро-матчевих підказок на межах кліпів 5% кадрів на початку і в кінці кожного кліпу були обрізані.

Кліпи не містили більше 12 кадрів, кожний з максимальною роздільною здатністю 128x28x28 пікселів. Відео тривалістю менше 24 секунд були виключені.

Промпт для цього завдання показаний нижче:

Промпт навчання для відео-завдання.

Промпт навчання для відео-завдання, без кліпів, які мали бути показані МЛМ..

3D-дані

Повне завдання Джигсо 3D зазвичай включало б розбиття 3D-простору (наприклад, воксельні блоки або фрагменти хмар точки) на менші шматки і навчання моделі для відновлення їхнього оригінального просторового розташування.

Однак, середня МЛМ не обладнана для обробки сирого 3D-даних безпосередньо, а залежить від семантично-інтерпретованих зображень або відео-вхідних даних. Тому, для створення завдання, яке все ще використовує 3D-розуміння, але залишається сумісним з поточними МЛМ, автори ввели більш прийнятну варіацію, що використовує зазначені вище RGB-D зображення (тобто 2D-зображення, які включають інформацію про глибину для кожного пікселя).

Приклади питань з 3D-просторового розуміння бенчмарку, використаного для оцінки продуктивності відносного погляду і камерного руху. Модель Джигсо 3D правильно витягує як просторову відносність між двома виглядами сцени, так і ймовірний напрям камерної ротації, перевершуючи базову модель Qwen2.5-VL-7B.

Приклади питань з 3D-просторового розуміння бенчмарку, використаного для оцінки продуктивності відносного погляду і камерного руху. Модель Джигсо 3D правильно витягує як просторову відносність між двома виглядами сцени, так і ймовірний напрям камерної ротації, перевершуючи базову модель Qwen2.5-VL-7B.

Від кожного RGB-D зображення модель отримує перемішаний список точок, які мали різні глибини, від найближчої до найдальшої, метою є відновлення їхнього правильного порядку глибини, використовуючи лише 2D-зображення як посилання:

Промпт навчання для 3D Джигсо.

Промпт навчання для 3D Джигсо.

Кожна точка позначена на зображенні (яке показується моделі, але не візуалізується у прикладі промпту вище), і модель повинна передбачити, яка була найближчою, другою найближчою тощо, ефективно відновлюючи оригінальну послідовність глибини без доступу до сирої глибини.

Завдання Джигсо 3D тренується на RGB-D зображеннях з ScanNet датасету, використовуючи 300 000 зразків, створених шляхом вибору випадкових наборів з шести глибинних точок на зображення.

Приклади хмар точки з ScanNet датасету, використаного у 3D Джигсо. Джерело: https://arxiv.org/pdf/1702.04405

Приклади хмар точки з ScanNet датасету, використаного у 3D Джигсо. Джерело: https://arxiv.org/pdf/1702.04405

Кожна точка повинна була лежати у діапазоні глибини від 0,1 до 10 метрів, і для сприяння різноманітності жодні дві точки в наборі не могли бути ближче 40 пікселів у площині зображення або менше 0,2 метра одна від одної у глибину.

Тести

Для початкових тестів система використовувала Qwen2.5-VL-7B-Instruct як базову мультимодальну модель. Навчання використовувало алгоритм GRPO, з видаленими KL-регуляризацією і ентропійною втратою.

Для часткових передбачень застосовувався фактор дисконтування 0,2. Навчання Джигсо зображення використовувало глобальний батч-розмір 256, тоді як відео- і 3D Джигсо використовували 128. Темп навчання був встановлений на 1х10⁻⁶.

Для кожного промпту модель генерувала 16 відповідей при температурі декодування 1,0. Завдання Джигсо зображення і відео тренувалися протягом 1000 кроків, тоді як завдання Джигсо 3D тренувалося протягом 800 кроків.

Джигсо зображення

Модель Джигсо зображення була протестована на трьох категоріях візуально-орієнтованих бенчмарків: для тонко-зернистого сприйняття і розуміння, MMVP, тонко-зернисте сприйняття підмножини MMStar; MMBench; HR-Bench; V*; MME-RealWorld (lite); LISA-Grounding; і OVD-Eval.

Для монокулярного просторового розуміння бенчмарками були VSR; OmniSpatial; і Depth Anything V2 (DA-2K). Для композиційного візуального розуміння тестами були використані Winoground і SugerCrepe++.

Три базові лінії були протестовані, всі похідні від Qwen2.5-VL-7B: ThinkLite-VL для мультимодального rozumіння; VL-Cogito для загальних візуальних і наукових завдань; і LLaVA-Critic-R1 для сприйняття зображення.

Всі були оцінені за допомогою коротких відповідей лише, оскільки ланцюг розуміння (CoT) іноді зменшував продуктивність.

Результати оцінки на зображеннях-бенчмарках. Джигсо зображення покращило продуктивність над базовою моделлю Qwen2.5-VL-7B на всіх завданнях (тобто тонко-зернистому сприйнятті і розумінню; монокулярному просторовому розумінню; і композиційному візуальному rozumінню), перевершуючи попередні пост-тренувальні базові лінії.

Результати оцінки на зображеннях-бенчмарках. Джигсо зображення покращило продуктивність над базовою моделлю Qwen2.5-VL-7B на всіх завданнях (тобто тонко-зернистому сприйнятті і розумінню; монокулярному просторовому розумінню; і композиційному візуальному rozumінню), перевершуючи попередні пост-тренувальні базові лінії.

Від результатів Джигсо зображення автори стверджують:

‘[Зображення вище] показує, що наш метод послідовно покращує візуально-орієнтовані можливості на трьох типах бенчмарків. Ці результати підтверджують, що включення пост-тренування Джигсо зображення суттєво покращує перцептивне угрунтування і тонко-зернисте візуальне розуміння МЛМ за рахунок розуміння-орієнтованих стратегій пост-тренування. ‘

‘Ми пояснюємо ці поліпшення тим фактом, що розв’язування завдань Джигсо зображення вимагає від моделі звертати увагу на локальні деталі шматків, виводити глобальні просторові макети і rozumувати про взаємозв’язки між шматками, що безпосередньо вигідно тонко-зернистому, просторовому і композиційному розумінню.’

Відео Джигсо

Для відео Джигсо оцінка проводилася на AoTBench; Vinoground; TOMATO; FAVOR-Bench; TUNA-Bench; Video-MME; TempCompass; TVBench; MotionBench; LVBench; VSI-Bench; Video-TT; і CVBench.

Video-R1 був використаний як базова лінія, яка була навчена з холодним стартом супервізованим тонким налаштуванням, за яким слідувало навчання з підкріпленням для розуміння і rozumіння відео. У цьому випадку оцінки включали весь процес rozumіння, оскільки це послідовно давало кращі результати, ніж прямі відповіді.

Всі моделі були обмежені 256x28x28 пікселів і протестовані на трьох налаштуваннях кадрів – 16, 32 і 64:

Результати оцінки на відео-бенчмарках, з Відео Джигсо, яке послідовно перевершує базову лінію на всіх завданнях і налаштуваннях кадрів.

Результати оцінки на відео-бенчмарках, з Відео Джигсо, яке послідовно перевершує базову лінію на всіх завданнях і налаштуваннях кадрів.

Відео Джигсо послідовно демонструє поліпшення на всіх відео-бенчмарках і налаштуваннях кадрів, з особливим виграшем на завданнях, що вимагають тимчасового rozumіння і напрямності, таких як ті, що у AoTBench, і також у відео-бенчмарках, таких як CVBench:

‘Ці результати підтверджують, що розв’язування завдань Відео Джигсо заохочує модель краще захоплювати тимчасову послідовність, розуміти відносини між відео, rozumувати про напрямність і узагальнювати до гольових і загальних відео-бенчмарків.’

3D дані

Для модальності 3D модель була оцінена на SAT-Real; 3DSRBench; ViewSpatial; All-Angles; вищезгаданий OmniSpatial; VSI-Bench; SPARBench (tiny); і вищезгаданий DA-2K.

Результати оцінки на 3D-бенчмарках: 3D Джигсо покращило продуктивність на завданнях порівняння глибини, таких як DA-2K, а також на ширших 3D-перцепційних бенчмарках, що охоплюють однооглядні, багатокадрові і еґоцентричні відео-входи.

Результати оцінки на 3D-бенчмарках: 3D Джигсо покращило продуктивність на завданнях порівняння глибини, таких як DA-2K, а також на ширших 3D-перцепційних бенчмарках, що охоплюють однооглядні, багатокадрові і еґоцентричні відео-входи.

Автори стверджують:

‘[3D] Джигсо досягає суттєвих поліпшень на всіх бенчмарках. Не дивно, що найбільший виграш спостерігається на DA-2K, бенчмарку оцінки глибини, який безпосередньо пов’язаний з нашим завданням попереднього навчання порядку глибини. Що більш важно, ми спостерігаємо послідовні поліпшення на широкому спектрі інших завдань, включаючи ті, які мають однооглядні (наприклад, 3DSRBench, [OmniSpatial]), багатокадрові (наприклад, ViewSpatial, All-Angles), і еґоцентричні відео-входи (наприклад, VSI-Bench). ‘

‘Ці результати демонструють, що наш підхід не тільки вчить конкретну навичку порядку глибини, але також ефективно зміцнює загальну здатність моделі сприймати і rozumувати про 3D-просторову структуру.’

Висновок

Що не зовсім зрозуміло з цієї статті, це точна взаємозв’язок між зображеннями і описами, який підтримує це поліпшення продуктивності МЛМ.

На перший погляд, процес навчання шляхом розв’язування пазлів здається дуже аналогічним нашим власним першими кроками і розвитком. Однак наш власний просторовий вияв світу інтуїтивно здається менш семантичним і пов’язаним з мовою, і глибше вивчення статті показує, якою мірою мова служить МЛМ цікавим містком між візуальною і семантичною реальністю.

 

* Примітка: автори статті віддають перевагу менш поширеному терміну ‘Мультимодальні Великомасштабні Моделі Мови’, скороченому до ‘MLLMs’. Це новий або рідко використовуваний термін, який застосовується до моделей, які можуть широко rozumувати і аналізувати зображення просторово, але не генерують зображення. Коли нові парадигми і моделі з’являються, цей лексикон перебуває під постійною ревізією.

Перша публікація: четвер, 2 жовтня 2025

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai