Взгляд Anderson

Искусственный интеллект значительно хуже человека в сборке мебели

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image (GPT-2): An industrial humanoid robot sits on the floor of a sparsely furnished apartment beside a grotesquely malformed piece of self-assembled furniture, holding a screwdriver while studying the collapsed structure amid IKEA boxes, scattered components, and assembly instructions.

ChatGPT и Google Gemini все еще не могут надежно понять видео сборки мебели IKEA, а многие другие известные системы ИИ путают детали, пропускают соединения и едва используют видео, чтобы понять, что происходит.

 

Долговечная культурная мем вокруг трудностей сборки мебели в стиле IKEA делает эту тему привлекательной для исследований в области компьютерного зрения — не в последнюю очередь потому, что длинные последовательности действий, отслеживание объектов и пространственное рассуждение, задействованные в этом процессе, будут толкать системы робототехники далеко за пределы упрощенных форм и контролируемых сред, к которым они привыкли.

Следовательно, работа над роботизированными сборочными процедурами, управляемыми ИИ, для мебели в стиле IKEA, стала небольшим, но уважаемым направлением в литературе, с такими работами, как Среда сборки мебели IKEA Университета Южной Калифорнии 2019 года, одной из первых баз данных и исследовательских контекстов, специально направленных на сборку мебели:

Нажмите, чтобы воспроизвести Примеры практики роботизированной сборки, с сайта проекта инициативы по среде сборки мебели IKEA 2019 года. Источник

В 2024 году сотрудничество между Стэнфордом и Дж.П. Морганом Руководства IKEA в действии стало первым, кто существенно проверил способность ИИ выполнить эту, казалось бы, будничную (хотя часто разочаровывающую) процедуру, на основе нового набора данных изображений из инструкций и с помощью видео:

Метод и подробности набора данных из инициативы 2024 года «Руководства IKEA в действии». Источник - https://arxiv.org/abs/2411.11409

Метод и подробности набора данных из инициативы 2024 года «Руководства IKEA в действии». Источник

Авторы статьи 2024 года — которые использовали DGCNN, CNOS, SAM-6D, MegaPose, MiDaS, SAM2 Hiera-L, Cutie-base, и GPT-4o — заключили, что задача представляет ‘значительные проблемы в понимании инструкционных видео, включая извлечение сегментации деталей и их положений, построение высокоуровневых планов сборки и обнаружение ключевых шагов в видео’.

Наносите, снимайте

Должно быть очевидно, что, хотя автоматизация задачи, которую мало кто любит, была бы приятной, это не является научной целью или приоритетом для сектора исследований компьютерного зрения.

Скорее, ценность задачи заключается в том, что то, что ИИ-системам нужно выучить чтобы стать профессионалами в этом, будет основой для более серьезных процедур, которые столь же или даже более сложны, в сельском хозяйстве, промышленности, сфере услуг и других областях.

В этом направлении проект и набор данных LEGO-Puzzles исследует, как хорошо модели языка и зрения (VLM) справляются с многоступенчатым пространственным рассуждением на различных архитектурах, поскольку задачи сборки зависят не только от соединения правильных объектов в правильный момент — процесса, известного как спаривание — но и от выполнения инструкций, которые могут быть намного более абстрактными, чем сырая визуальная сцена, доступная модели на каждом шаге:

Сложные вопросы из проекта LEGO-Puzzles. Источник - https://tangkexian.github.io/LEGO-Puzzles/

Сложные вопросы из проекта LEGO-Puzzles. Источник

Последний проект, решающий проблему сборки мебели, использует более современные и мощные модели ИИ, включая Google Gemini 2.5/3.1 и OpenAI’s GPT-5 — но все равно не может добиться победы ИИ в этой задаче, с только скромными улучшениями над базовым уровнем случайности и результатами «далеко ниже человеческого уровня».

Авторы утверждают:

‘Наши эксперименты показывают, что современные модели языка и зрения испытывают значительные трудности с тонким пространственно-временным рассуждением, подчеркивая их ограничения в эффективном использовании временной информации из видео, ограниченной способности отслеживать и понимании пространственных взаимодействий, таких как физический контакт.’

Проблемы, решаемые в этом направлении исследований, связаны с практической робототехникой только на данном этапе, хотя, безусловно, дополнительные проблемы ждут, когда теоретические проблемы наконец превратятся в воплощенную ИИ.

Новая статья называется Flat-Pack Bench: Оценка пространственно-временного понимания в больших моделях языка и зрения через сборку мебели, и приходит от восьми авторов из Корнелльского университета, Корнелльского технологического института, MBZUAI и Калифорнийского университета в Беркли. Статья сопровождается сайтом проекта.

Метод

Авторы новой работы подчеркивают трудности, с которыми ИИ-ассистенты сталкиваются при понимании процесса сборки через наблюдение, например, через видео-инструкции в стиле YouTube, к которым многие люди обращаются, чтобы воспользоваться знаниями сообщества:

Некоторые вопросы, которые вызывает задача сборки мебели, а также четыре необходимых навыка для преодоления этих проблем. Источник - https://arxiv.org/pdf/2605.21625

Некоторые вопросы, которые вызывает задача сборки мебели, а также четыре необходимых навыка для преодоления этих проблем. Источник

Они курировали набор данных, отфильтрованный из ранее упомянутого набора данных «Руководства IKEA в действии» (IMaW), который включает видео из реальной жизни людей, собирающих мебель IKEA. Пересмотренный эталон обрезает исходные видео, удаляя текстовые карты инструкций, с отдельными вариантами ключевых кадров и полного видео, а также добавляет вручную аннотированные визуальные подсказки с сегментированными деталями мебели, для поддержки задач рассуждения с несколькими вариантами ответов.

Эталон вращается вокруг четырех типов вопросов: MATE, определение того, соединены ли две детали в окончательной сборке; TRACK, требующий от моделей восстановить правильную соответствие между перемешанными идентификаторами деталей на сегментированных кадрах с помощью видео; TOrd, оценивающий способность моделей вывести правильный порядок событий соединения; и TLoc, тестирующий способность моделей определить события, происходящие непосредственно перед или после состояния, показанного в визуальной подсказке, требующей временной локализации и рассуждения о соседних событиях.

Примеры из нового эталона, иллюстрирующие четыре основных типа задач, предназначенные для проверки пространственно-временного рассуждения в видео сборки мебели: Временная локализация; Временной порядок; Отслеживание; и Спаривание. Каждая задача сочетает видео сборки с одной или несколькими сегментированными визуальными подсказками и вопросом с несколькими вариантами ответов.

Примеры из нового эталона, иллюстрирующие четыре основных типа задач, предназначенные для проверки пространственно-временного рассуждения в видео сборки мебели: Временная локализация; Временной порядок; Отслеживание; и Спаривание. Каждая задача сочетает видео сборки с одной или несколькими сегментированными визуальными подсказками и вопросом с несколькими вариантами ответов.

Шаблоны, показанные на схеме выше, были получены из этих четырех моделей вопросов.

Авторы также отмечают, что они добавили подробные аннотации сборки деталей к каждому из исходных видео IMaW, указывая, какие детали соединяются с другими — детали, отсутствующие в исходной коллекции.

Избежание

Вопросы, отмечает статья, необходимо было вручную курировать, поскольку автоматически сгенерированные вопросы часто дают ИИ возможность игнорировать видео и использовать свою собственную обученную информацию — сценарий, который любой регулярный пользователь ИИ, вероятно, признает, поскольку оптимизация и другие загадочные корпоративные приоритеты часто заставляют передовые модели игнорировать представленную информацию, такую как PDF или изображения, и полагаться на свою собственную информацию вместо этого*:

‘[Мы] обнаружили, что автогенерация часто производила вопросы, которые можно было ответить, игнорируя видео и используя обходные пути. Например, автоматически сгенерированные спаривающие вопросы о деталях, уже расположенных для соединения, или включали отвлекающие варианты с явно различимыми формами или цветами, что позволяло легко [исключить]. Чтобы решить эту проблему, мы курировали все вопросы вручную, используя фиксированные шаблоны.

‘Аннотаторам был предоставлен полный видео сборки, сегментированные кадры для визуальных подсказок, шаблоны вопросов и подробные рекомендации по избежанию обходных путей на основе статических сигналов из визуальной подсказки.’

Готовый эталон включает 602 вопроса с несколькими вариантами ответов в 50 различных видео сборки мебели.

Данные и тесты

Модели, оцененные для раунда тестирования, включали упомянутые выше ChatGPT и Gemini, а также Video-LLaVA; LLaVA-NeXT-Vid; LLaVA-OneVision; LLaVA-Video; Qwen 2.5/Qwen 3-VL; InternVL3; ArrowRL; PerceptionLM; и Video-Refer.

GenS был использован для выбора вопросов, соответствующих кадрам в длинных видео для базовой модели Gemini 2.5 Pro, и большинство моделей были протестированы в однострочном контексте под жадным декодированием (не поддерживается в GPT-5, однако).

Три формата подсказок были разработаны для эталона: мультимедийная подсказка предоставляла визуальную подсказку как отдельное изображение рядом с видео сборки; коллажная подсказка встроила визуальную подсказку непосредственно в каждый кадр видео в виде сеточной компоновки; и конкатенированная подсказка добавила визуальные подсказки в начало видео.

И обрезанные, и ключевые варианты видео были протестированы на этих форматах, чтобы измерить, насколько сильно структура подсказки и временное сжатие могут повлиять на производительность модели.

Базовые шансы, рассмотренные для тестов, также включали «частотный шанс», где выбирается наиболее распространенный вариант (а не действительно случайный вариант).

Человеческий фактор

Производительность человека была оценена с помощью участников, набранных из программ компьютерных наук, от бакалавриата до докторантуры. Каждый участник был показан видео сборки, связанной визуальной подсказкой и вопросом с несколькими вариантами ответов, а также инструкцией задачи, прежде чем выбрать ответ.

Три ответа были собраны на каждый вопрос и разрешены путем большинства голосов, в то время как отдельное краудсорсинговое исследование также было проведено на случайной выборке эталона.

Точность была использована в качестве метрики для испытаний:

Модель Ранг Микро-среднее TOrd TLoc Отслеживание Спаривание
Производительность человека 94.18 93.54 93.20 93.77 97.70
Базовые шансы
Случайный шанс 26.41 25.00 25.00 25.49 33.33
Частотный шанс 26.74 27.74 30.10 26.46 36.78
Проприетарные модели
GPT-5 1 37.71 40.65 53.40 25.68 49.43
Gemini 2.5 Pro 2 33.72 40.65 44.66 23.35 39.08
Gemini 3.1 Pro 3 32.89 34.84 43.69 21.79 49.43
Gemini 2.5 Flash 4 31.06 31.61 41.75 23.35 40.23
Gemini 2.5 Pro + GenS 5 25.58 33.55 32.04 13.23 40.23
Открытые модели
Video-LLaVA-7B 26 23.75 21.29 35.92 10.89 51.72
InternVL3-14B 5 37.71 42.58 21.36 37.74 48.28
InternVL3-38B 12 36.05 42.58 37.86 25.68 52.87
InternVL3-78B 1 41.03 43.87 39.81 42.02 34.48
Qwen2.5-VL-7B 22 30.23 27.10 18.45 33.07 41.38
Qwen2.5-VL-32B 13 35.88 34.84 29.13 33.07 54.02
Qwen2.5-VL-72B 2 40.37 41.29 30.10 45.14 36.78
Qwen3-VL-4B 11 36.54 34.19 33.01 32.68 56.32
Qwen3-VL-4B-Think 9 37.21 31.61 25.24 37.74 59.77
Qwen3-VL-8B 15 33.72 36.13 30.10 33.85 33.33
Qwen3-VL-8B-Think 17 31.73 34.19 33.01 25.29 44.83
Qwen3-VL-32B 6 37.71 38.71 46.60 31.91 42.53
Qwen3-VL-32B-Think 3 40.03 38.71 22.33 45.53 47.13
Qwen3-VL-30B-A3B 10 36.71 30.32 22.33 42.02 49.43
Qwen3-VL-235B-A22B 8 37.21 37.42 25.24 39.69 43.68
LLaVA-NeXT-Vid-7B 25 25.08 33.55 24.27 16.73 35.63
LLaVA-NeXT-Vid-34B 21 30.40 30.32 24.27 32.68 31.03
LlaVA-OneVision-7B 16 32.89 26.45 30.10 34.24 43.68
LlaVA-OneVision-72B 4 38.37 35.48 25.24 38.91 57.47
LLaVA-Video-7B 19 30.73 30.97 24.27 25.68 52.87
LLaVA-Video-72B 7 37.54 36.77 27.18 35.80 56.32
Perception-LM-1B 24 27.74 28.39 26.21 25.29 35.63
Perception-LM-3B 18 31.40 28.39 32.04 29.96 40.23
Perception-LM-8B 14 35.38 26.45 26.21 44.75 34.48
VideoRefer 23 28.57 32.90 30.10 17.51 51.72
ArrowRL-7B 20 30.56 30.97 24.27 29.18 41.38

Результаты производительности на FLAT-PACK BENCH, сравнивающие проприетарные и открытые мультимодальные модели по задачам временного порядка, временной локализации, отслеживания и спаривания, с производительностью человека, остающейся далеко впереди всех протестированных систем, несмотря на скромные улучшения среди более крупных передовых моделей.

Как видно из первых испытаний (изображение выше), люди набрали более 90% во всех категориях вопросов, с 80% единогласия, что, по утверждению статьи, подтверждает, что предложения хорошо сформулированы и неambiguous.

GPT-5 и Gemini 2.5/3.1 Pro испытывали трудности с набором данных, добившись только скромных улучшений над базовым уровнем случайности и оставаясь далеко ниже производительности человека. Использование GenS для выбора вопросов, соответствующих кадрам, не улучшило результаты Gemini 2.5 Pro, что заставило авторов сделать вывод, что проприетарные модели языка и зрения испытывают трудности с задачей пространственно-временного понимания, необходимой для эталона.

Среди открытых систем самые сильные результаты были получены от семейств InternVL3 и Qwen, хотя производительность в категории варьировалась сильно, и несколько моделей едва превосходили уровень случайности; и специализированные системы, включая PerceptionLM и VideoRefer, также испытывали трудности с сложными задачами сборки эталона, при этом человеческие участники оставались значительно впереди в каждой категории моделей.

Исследователи также протестировали две стратегии цепочного рассуждения против стандартной настройки подсказки статьи. Zero-shot Chain-of-Thought подсказка просила модели объяснить свои ответы шаг за шагом, в то время как Самосогласованность с цепочкой рассуждений генерировала пять кандидатских ответов, прежде чем выбрать окончательный ответ путем большинства голосов. Однако ни один из подходов не улучшил результаты на наборе данных Flat Pack Bench, с обоими подходами, набирающими ниже стандартной настройки подсказки эталона.

Чит-код

Чтобы проверить, действительно ли модели языка и зрения учатся из видео сборки или просто используют статические визуальные подсказки, исследователи создали версию эталона, в которой видео было полностью удалено, оставив только текст вопроса и визуальные подсказки.

Производительность человека рухнула более чем на 50% в этих условиях, показывая, что задачи действительно требуют временного понимания процесса сборки. Модели, однако, ухудшились гораздо менее сильно, с некоторыми задачами, оставаясь стабильными или даже улучшающимися без видео-ввода.

Это, по мнению статьи, указывает на то, что многие модели языка и зрения на самом деле не используют временную информацию в видео, вместо этого полагаясь на образные обходные пути и предположения, чтобы сделать правдоподобные ответы*:

Производительность модели языка и зрения на версии только с изображением Flat-Pack Bench, сравнена с стандартной видео-и-изображением настройкой, с дополнительными результатами после перемешивания идентификаторов деталей для проверки того, используют ли модели обходные пути меток вместо временного понимания видео.

Производительность модели языка и зрения на версии только с изображением Flat-Pack Bench, сравнена с стандартной видео-и-изображением настройкой, с дополнительными результатами после перемешивания идентификаторов деталей для проверки того, используют ли модели обходные пути меток вместо временного понимания видео.

‘[Изображение выше] показывает производительность модели языка и зрения на этой версии только с изображением, и изменение их производительности от полной оценки, а также производительность человека.

‘Острый спад производительности человека (>50%) показывает, что вопросы действительно требуют видео для ответа.

‘Мы также наблюдаем, что общая производительность модели падает сильно (8.80%), но в основном из-за задачи отслеживания. Точность других задач остается прежней или улучшается, указывая на то, что модель языка и зрения не использует видео эффективно, в то время как люди используют видео для ответа.’

Более глубокий анализ статьи предполагает, что основной препятствием является не только простая временная последовательность, но и неудачи в привязке объектов и пространственно-временном рассуждении: модели часто испытывали трудности с отслеживанием визуально-похожих деталей мебели через движение, смену камеры и изменения сцены, даже когда они казались определять более широкий процесс сборки правильно.

Дополнительные эксперименты включали выпуск инструментального агентного ИИ на эту задачу, и это «показало плохие результаты» по мнению авторов — хотя он смог правильно ответить на дополнительные 11,48% вопросов, пропущенных другими подходами.

Заключение

Сохранение постоянных внутренних представлений концепций и объектов является центральным как для человеческого опыта роста и перцептивного развития, так и для индивидуальных, часто новых задач, для которых это развитие подготовило нас.

Исследования компьютерного зрения уже имеют продолжающуюся борьбу за повторное приобретение и распознавание объектов и людей, которые покидают и вновь входят в кадр. Эти проблемы значительно усиливаются с необходимостью постоянно изменять вид и положение — как это, вероятно, произойдет в видео-инструкции YouTube о сборке мебели в стиле IKEA. Можно представить, насколько более резкие изменения точки зрения в эгоцентрическом видео могут еще больше запутать попытки ИИ собрать мебель.

 

* Оригинальная форматировка авторов, измененная мной при необходимости для сохранения воздействия под форматированием цитат/

Опубликовано в понедельник, 25 мая 2026 года. Изменено в среду, 27 мая 2026 года, для исправления этой атрибуции даты (!).

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai