Погляд Anderson

Штучна збірка меблів: AI значно гірше людей у збірці меблів

mm
Додайте Unite.AI до бажаних джерел у Google
AI-generated image (GPT-2): An industrial humanoid robot sits on the floor of a sparsely furnished apartment beside a grotesquely malformed piece of self-assembled furniture, holding a screwdriver while studying the collapsed structure amid IKEA boxes, scattered components, and assembly instructions.

ChatGPT і Google Gemini все ще не можуть надійно зрозуміти відео збірки меблів IKEA, а інші відомі системи штучного інтелекту плутають деталі, пропускають з’єднання та майже не використовують відео для розуміння того, що відбувається.

 

Тривалий культурний мем навколо складності збірки меблів IKEA робить цю тему привабливою для досліджень у сфері комп’ютерного бачення — не в останню чергу через довгі послідовності дій, відстеження об’єктів та просторове мислення, які залучені в цьому процесі.

Отже, робота над штучно-інтелектуальними роботизованими процедурами збірки меблів стала невеликою, але поважною галуззю літератури, з виходами таких робіт, як середовище збірки меблів IKEA 2019 року, одним з перших наборів даних і дослідницьких контекстів, спеціально призначених для збірки меблів:

Натисніть, щоб відтворити Приклади практики збірки меблів, з проекту сайту ініціативи середовища збірки меблів IKEA 2019 року. Джерело

У 2024 році співпраця між Стенфордським університетом і Дж.П. Морганом Інструкції IKEA на роботі була першою, яка суттєво дослідила здатність штучного інтелекту виконувати цю, здавалося б, буденну (хоча часто розчаровуючу) процедуру, засновану на новому наборі даних зображень з інструкцій та використовуючи інструкційні відео:

Метод набору даних і деталі ініціативи Інструкції IKEA на роботі. Джерело - https://arxiv.org/abs/2411.11409

Метод набору даних і деталі ініціативи Інструкції IKEA на роботі. Джерело

Автори статті 2024 року — які використовували DGCNN, CNOS, SAM-6D, MegaPose, MiDaS, SAM2 Hiera-L, Cutie-base, і GPT-4o — зробили висновок, що завдання викликало ‘значні труднощі у розумінні інструкційних відео збірки, включаючи виділення частин і їх положень, побудову високорівневих планів збірки та виявлення ключових кроків збірки у відео’.

Нанести, нанести

Має бути очевидним, що, хоча отримання штучного інтелекту для автоматизації завдання, яке мало хто цінує, було б добре, це не науковий орієнтир або високий у списку пріоритетів для галузі комп’ютерного бачення.

Натомість, цінність завдання полягає в тому, що те, чого штучні системи повинні навчитися щоб стати професіоналами у цьому, буде ґрунтувати їх для набагато серйозніших процедур, які є рівноцінними або навіть більш складними, у сільському господарстві, промисловості, сфері послуг та інших сферах.

У цьому сенсі проект LEGO-Puzzles досліджує, як добре моделі бачення мови (VLM) обробляють багатокрокове просторове мислення через різні архітектури, оскільки завдання збірки залежать не тільки від поєднання правильних об’єктів разом у правильний момент — процес, відомий як спарювання — але також від дотримання інструкцій, які можуть бути набагато більш абстрактними, ніж сурова візуальна сцена, доступна моделі в будь-який момент:

Складні питання проекту LEGO-Puzzles. Джерело - https://tangkexian.github.io/LEGO-Puzzles/

Складні питання проекту LEGO-Puzzles. Джерело

Останній проект, який займається викликом збірки меблів, використовує більш сучасну і потужну генерацію моделей штучного інтелекту, включаючи Google Gemini 2.5/3.1 і OpenAI’s GPT-5 — але все ще не може отримати перемогу для штучного інтелекту у цьому завданні, з лише скромними поліпшеннями над базовим рівнем випадковості, і результати «далеко нижче рівня людини».

Автори заявляють:

‘Наші експерименти показують, що сучасні моделі бачення мови суттєво борються з дрібнозернистим просторово-часовим мисленням, підкреслюючи їх обмеження у ефективному використанні часової інформації з відео, обмеженій здатності відстежувати та розуміти просторові взаємодії, такі як фізичний контакт.’

Проблеми, які вирішуються в цьому напрямку досліджень, лише номінально пов’язані з практичною робототехнікою на цьому етапі, хоча додаткові виклики, безумовно, чекають, коли теоретичні питання, нарешті, розвинуться у втілені штучні системи.

Нова стаття називається Платформа для збірки меблів: оцінка просторово-часового розуміння у великих моделях бачення мови через збірку меблів, і виходить від восьми авторів з Корнелльського університету, Корнелльського технологічного інституту, MBZUAI і Каліфорнійського університету в Берклі. Стаття супроводжується сайтом проекту.

Метод

Автори нової роботи підкреслюють складність, з якою штучні системи мають зрозуміти процес збірки через спостереження, наприклад, через інструкційні відео типу YouTube, до яких багато людей звертаються, щоб скористатися спільними знаннями:

Деякі питання, які викликає завдання збірки меблів, разом з чотирма основними навичками, необхідними для подолання цих викликів. Джерело - https://arxiv.org/pdf/2605.21625

Деякі питання, які викликає завдання збірки меблів, разом з чотирма основними навичками, необхідними для подолання цих викликів. Джерело

Вони створили набір даних, відфільтрований з раніше згаданого набору даних Інструкції IKEA на роботі (IMaW) набору даних, який містить відео людей, які збирають меблі IKEA. Оновлений бенчмарк обрізає оригінальні відео, щоб видалити тексти інструкцій, з окремими варіантами ключових кадрів і повного відео, а також додає вручне анотовані візуальні підказки з розрізненими деталями меблів, щоб підтримувати завдання з вибору однієї відповіді.

Бенчмарк обертається навколо чотирьох типів питань: МАТИ, визначення того, чи з’єднані дві частини у кінцевій збірці; ТРАК, вимога до моделей відновити правильну відповідність між перемішаними ідентифікаторами частин через відео; ТОРД, оцінка того, чи можуть моделі вивести правильний порядок з’єднання; і ТЛОК, перевірка того, чи можуть моделі визначити події, які відбуваються безпосередньо перед або після стану, показаного у візуальній підказці, вимагаючи тимчасової локалізації та розуміння навколишніх подій.

Приклади нового бенчмарку, що ілюструють чотири основні типи завдань, призначених для тестування просторово-часового мислення у відео збірки меблів: Тимчасова локалізація; Тимчасове впорядкування; Відстежування; і Спарювання. Кожне завдання поєднує відео збірки з однією або декількома розрізненими візуальними підказками і завданням з вибору однієї відповіді.

Приклади нового бенчмарку, що ілюструють чотири основні типи завдань, призначених для тестування просторово-часового мислення у відео збірки меблів: Тимчасова локалізація; Тимчасове впорядкування; Відстежування; і Спарювання. Кожне завдання поєднує відео збірки з однією або декількома розрізненими візуальними підказками і завданням з вибору однієї відповіді.

Шаблони, показані на схемі вище, були отримані з цих чотирьох моделей питань.

Автори також зазначають, що вони додали тонкі анотації збірки частин до кожного з оригінальних відео IMaW, вказуючи, які частини з’єднуються з іншими частинами — деталі, відсутні в оригінальній колекції.

Ухилення

Питання, як зазначено в статті, мали бути вручну відібрані, оскільки автоматично згенеровані питання часто дають штучному інтелекту можливість ігнорувати відео і звернутися до свого власного навченого розуміння — сценарій, який будь-який регулярний користувач великомасштабних мовних моделей (LLM) або моделей бачення мови (VLM) ймовірно розпізнає, оскільки оптимізація та інші загадкові корпоративні пріоритети часто змушують передові моделі ігнорувати надані дані, такі як PDF або зображення, і покладатися на своє власне розуміння замість цього*:

‘[Ми] виявили, що автоматичне генерація часто створює питання, які можна відповісти, ігноруючи відео і використовуючи скорочення. Наприклад, автоматично згенеровані спарювання питання про частини, вже розташовані для з’єднання, або включені відволікаючі варіанти з явно різними формами або кольорами, що дозволяє легко [виключити]. Щоб подолати це, ми вручну відібрали всі питання, використовуючи фіксовані шаблони.

‘Анататори мали повне відео збірки, розрізнені кадри для візуальних підказок, шаблони питань і детальні керівництва щодо уникнення скорочень на основі статичних сигналів від візуальної підказки.’

Готовий бенчмарк складається з 602 завдань з вибору однієї відповіді через 50 різноманітних відео збірки меблів.

Дані і тести

Моделі, оцінені для раунду тестування, були вищезгаданими ChatGPT і Gemini, а також Video-LLaVA; LLaVA-NeXT-Vid; LLaVA-OneVision; LLaVA-Video; Qwen 2.5/Qwen 3-VL; InternVL3; ArrowRL; PerceptionLM; і Video-Refer.

GenS був використаний для вибору кадрів, відповідних питанню, у довгих відео для базової моделі Gemini 2.5 Pro, і більшість моделей були протестовані у одному кадрі контексті під жадібним декодуванням (не підтримується у GPT-5, проте).

Було розроблено три формати підказок для бенчмарку: мікс-медіа підказка надавала візуальну підказку як окреме зображення поряд з відео збірки; колаж підказка вбудовувала візуальну підказку безпосередньо у кожний кадр відео як частину макета сітки; і конкат підказка передувала візуальні підказки до початку відео.

Обидва обрізані і ключові варіанти відео були протестовані через ці формати, щоб виміряти, наскільки сильно структура підказки і тимчасове стиснення можуть вплинути на результати моделей.

Базові рівні випадковості, розглянуті для тестів, також включали ‘частотну випадковість’, де вибрано найбільш поширений варіант (а не真正 випадковий варіант).

Людський фактор

Результати людини були оцінені за допомогою учасників, набраних з програм комп’ютерних наук, від студентів до докторантів. Кожен учасник бачив відео збірки, пов’язану візуальну підказку і питання з вибором однієї відповіді, а також інструкцію завдання, перш ніж вибрати відповідь.

Було зібрано три відповіді на питання і вирішено через голосування більшості, тоді як окреме краудсорсинг- дослідження також було проведено на випадково вибраній підмножині бенчмарку.

Точність була використана як метрика для випробувань:

Модель Ранг Мікро-середнє ТОРД ТЛОК ТРАК МАТИ
Результати людини 94.18 93.54 93.20 93.77 97.70
Базові рівні випадковості
Випадкова випадковість 26.41 25.00 25.00 25.49 33.33
Частотна випадковість 26.74 27.74 30.10 26.46 36.78
Пропріетарні моделі
GPT-5 1 37.71 40.65 53.40 25.68 49.43
Gemini 2.5 Pro 2 33.72 40.65 44.66 23.35 39.08
Gemini 3.1 Pro 3 32.89 34.84 43.69 21.79 49.43
Gemini 2.5 Flash 4 31.06 31.61 41.75 23.35 40.23
Gemini 2.5 Pro + GenS 5 25.58 33.55 32.04 13.23 40.23
Відкриті моделі
Video-LLaVA-7B 26 23.75 21.29 35.92 10.89 51.72
InternVL3-14B 5 37.71 42.58 21.36 37.74 48.28
InternVL3-38B 12 36.05 42.58 37.86 25.68 52.87
InternVL3-78B 1 41.03 43.87 39.81 42.02 34.48
Qwen2.5-VL-7B 22 30.23 27.10 18.45 33.07 41.38
Qwen2.5-VL-32B 13 35.88 34.84 29.13 33.07 54.02
Qwen2.5-VL-72B 2 40.37 41.29 30.10 45.14 36.78
Qwen3-VL-4B 11 36.54 34.19 33.01 32.68 56.32
Qwen3-VL-4B-Think 9 37.21 31.61 25.24 37.74 59.77
Qwen3-VL-8B 15 33.72 36.13 30.10 33.85 33.33
Qwen3-VL-8B-Think 17 31.73 34.19 33.01 25.29 44.83
Qwen3-VL-32B 6 37.71 38.71 46.60 31.91 42.53
Qwen3-VL-32B-Think 3 40.03 38.71 22.33 45.53 47.13
Qwen3-VL-30B-A3B 10 36.71 30.32 22.33 42.02 49.43
Qwen3-VL-235B-A22B 8 37.21 37.42 25.24 39.69 43.68
LLaVA-NeXT-Vid-7B 25 25.08 33.55 24.27 16.73 35.63
LLaVA-NeXT-Vid-34B 21 30.40 30.32 24.27 32.68 31.03
LlaVA-OneVision-7B 16 32.89 26.45 30.10 34.24 43.68
LlaVA-OneVision-72B 4 38.37 35.48 25.24 38.91 57.47
LLaVA-Video-7B 19 30.73 30.97 24.27 25.68 52.87
LLaVA-Video-72B 7 37.54 36.77 27.18 35.80 56.32
Perception-LM-1B 24 27.74 28.39 26.21 25.29 35.63
Perception-LM-3B 18 31.40 28.39 32.04 29.96 40.23
Perception-LM-8B 14 35.38 26.45 26.21 44.75 34.48
VideoRefer 23 28.57 32.90 30.10 17.51 51.72
ArrowRL-7B 20 30.56 30.97 24.27 29.18 41.38

Результати на FLAT-PACK BENCH, порівняно з пропріетарними та відкритими багатозадачними моделями через завдання Тимчасового впорядкування, Тимчасової локалізації, Відстежування та Спарювання, з результатами людини, які залишаються далеко попереду всіх протестованих систем, незважаючи на скромні поліпшення серед більших моделей.

Як видно з початкових тестів (зображення вище), люди набрали понад 90% у всіх категоріях питань, з 80% одностайністю, що свідчить, як стверджує стаття, що пропозиції добре сформульовані і недвозначні.

GPT-5 і Gemini 2.5/3.1 Pro боролися з набором даних, досягнувши лише скромних поліпшень над рівнем випадковості, і залишилися далеко нижче рівня людини. Використання GenS для вибору кадрів, відповідних питанню, не покращило результати Gemini 2.5 Pro, що змусило авторів зробити висновок, що пропріетарні моделі бачення мови суттєво борються з завданням просторово-часового розуміння, необхідним для бенчмарку.

Серед відкритих систем найкращі результати показали моделі InternVL3 і Qwen, хоча результати у категорії різнилися різко, з кількома моделями, які майже не перевершували рівень випадковості; і спеціалізовані системи, включаючи PerceptionLM і VideoRefer, також боролися з складними завданнями збірки бенчмарку, тоді як учасники людини залишилися значно попереду в кожній категорії моделей.

Дослідники також протестували дві стратегії ланцюгового мислення проти стандартної настройки підказки статті. Zero-shot Chain-of-Thought підказка просила моделі пояснити свої відповіді крок за кроком, тоді як Самозбереження з ланцюговим мисленням генерувала п’ять кандидатських відповідей, перш ніж вибрати остаточну відповідь через голосування більшості. Однак жодна з цих підходів не покращила результати на бенчмарку Flat Pack Bench, з обома підходами, які набрали нижче стандартної конфігурації підказки бенчмарку.

Чіт код

Щоб протестувати, чи дійсно моделі бачення мови вивчають з відео збірки, чи просто використовують статичні візуальні підказки, дослідники створили версію бенчмарку тільки з зображенням, яка виключила відео повністю, залишиивши лише текст питання і візуальні підказки.

Результати людини впали більш ніж на 50% у цих умовах, показуючи, що завдання дійсно вимагають тимчасового розуміння процесу збірки. Моделі, однак, погіршилися значно менше, з деякими завданнями, які залишилися стабільними або навіть покращилися без відеовходу.

Це свідчить, як стверджує стаття, що багато моделей бачення мови не дійсно використовують тимчасову інформацію у відео взагалі, а замість цього покладаються на зображення, скорочення та загальні припущення, щоб вивести прийнятні відповіді*:

Результати моделі бачення мови на версії тільки з зображенням Flat-Pack Bench, порівняно зі стандартною настройкою відео плюс зображення, з додатковими результатами після перемішування ідентифікаторів частин для тестування того, чи моделі використовують скорочення міток порядку замість тимчасового відео-розуміння.

Результати моделі бачення мови на версії тільки з зображенням Flat-Pack Bench, порівняно зі стандартною настройкою відео плюс зображення, з додатковими результатами після перемішування ідентифікаторів частин для тестування того, чи моделі використовують скорочення міток порядку замість тимчасового відео-розуміння.

‘[Зображення вище] показує результати моделі бачення мови на цій версії тільки з зображенням, і зміну їх результатів з повної оцінки, разом з результатами людини.

‘Стриманий спад результатів людини (>50%) показує, що питання дійсно вимагають відео для відповіді.

‘Ми також спостерігаємо, що загальний результат моделі впав суттєво (8.80%), але в основному через підзавдання ТРАК. Точність інших завдань залишилася такою самою або покращилася, вказуючи на те, що модель бачення мови не використовує відео ефективно, тоді як люди використовують відео для відповіді.’

Глибший аналіз статті свідчить, що основною перешкодою не є просто тимчасове впорядкування, а помилки в об’єктному ґрунтуванні та просторово-часовому мисленні: моделі часто боролися з відстежуванням візуально подібних частин меблів через рух, зміну камери та зміну сцени, навіть коли вони здавалися ідентифікувати загальний процес збірки правильно.

Додаткові експерименти включали випуск інструментально-озброєного штучного інтелекту на завдання, і цей ‘виконав погано’ за словами авторів — хоча він був здатний правильно відповісти на додаткові 11,48% питань, пропущених іншими підходами.

Висновок

Збереження постійних внутрішніх концепцій і об’єктів є центральним як для людського досвіду зростання та перцептивного розвитку, так і для індивідуальних, часто нових завдань, для яких цей розвиток підготував нас.

Дослідження комп’ютерного бачення вже має тривалий бій для відновлення і повторної ідентифікації об’єктів і людей, які залишають і повертаються у кадр. Ці питання суттєво посилюються через необхідність постійної зміни бачення і позиції — як це, ймовірно, відбувається у відео-інструкціях типу YouTube про збірку меблів. Можна уявити, наскільки ще більш різкі зміни точки зору егоцентричного відео можуть ще більше заплутати спроби штучного інтелекту зібрати меблі.

 

* Оригінальне форматування авторів, змінене мною за необхідністю для збереження впливу під форматом цитування/

Опубліковано в понеділок, 25 травня 2026 року. Змінено у середу, 27 травня 2026 року, для виправлення цієї атрибуції дати (!).

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai