Ángulo de Anderson

La IA es significativamente peor que los humanos a la hora de ensamblar muebles

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-2): An industrial humanoid robot sits on the floor of a sparsely furnished apartment beside a grotesquely malformed piece of self-assembled furniture, holding a screwdriver while studying the collapsed structure amid IKEA boxes, scattered components, and assembly instructions.

ChatGPT y Google Gemini aún no pueden entender de manera fiable los videos de ensamblaje de IKEA, con muchos otros sistemas de IA prominentes que confunden las partes, pierden las conexiones y apenas utilizan el video en sí para averiguar qué está sucediendo.

 

El duradero mem cultural en torno a la dificultad de ensamblar muebles de estilo IKEA hace que el tema sea un objetivo atractivo para la investigación de visión por computadora — no menos porque las largas secuencias de acciones, el seguimiento de objetos y el razonamiento espacial involucrados tenderán a llevar a los sistemas de manipulación robótica mucho más allá de las formas simplificadas y los entornos controlados a los que están acostumbrados.

Por lo tanto, el trabajo en rutinas de ensamblaje robótico impulsadas por IA para muebles de paquete plano se ha convertido en una rama pequeña pero respetable en la literatura, con salidas como el entorno de ensamblaje de muebles IKEA de la USC de 2019, entre los primeros conjuntos de datos y contextos de investigación específicamente destinados al ensamblaje de muebles:

Haga clic para reproducir Ejemplos de práctica de ensamblaje robótico, del sitio web del proyecto para la iniciativa del entorno de ensamblaje de muebles IKEA de 2019. Fuente

En 2024, la colaboración entre Stanford y J.P. Morgan Manuales de IKEA en el trabajo fue la primera en sondear significativamente la capacidad de la IA para realizar este procedimiento aparentemente mundano (aunque a menudo frustrante), basado en un conjunto de datos novel de imágenes de manuales de instrucciones y utilizando videos instructivos:

Método y detalles del conjunto de datos de la iniciativa Manuales de IKEA en el trabajo de 2024. Fuente - https://arxiv.org/abs/2411.11409

Método y detalles del conjunto de datos de la iniciativa Manuales de IKEA en el trabajo de 2024. Fuente

Los autores del documento de 2024 — que aprovecharon DGCNN, CNOS, SAM-6D, MegaPose, MiDaS, SAM2 Hiera-L, Cutie-base, y GPT-4o — concluyeron que la tarea planteaba ‘desafíos significativos en la comprensión de los videos de ensamblaje instructivos, incluyendo la extracción de segmentaciones de partes y posiciones, la construcción de planes de ensamblaje de alto nivel y la detección de pasos de ensamblaje clave en los videos’.

Cera sobre, cera abajo

Debe ser obvio que, si bien conseguir que la IA nos automatice en una tarea que pocos aprecian sería agradable, no es exactamente un faro científico, ni está alto en la lista de prioridades para el sector de investigación de Visión por Computadora.

Rather, el valor de la tarea radica en el hecho de que lo que los sistemas de IA necesitan aprender para volverse competentes en esto los prepararía para rutinas mucho más serias que son igualmente o incluso más desafiantes, en la agricultura, la industria, el sector de servicios y diversas otras esferas.

En este sentido, el proyecto y conjunto de datos LEGO-Puzzles examina cómo manejan los Modelos de Lenguaje de Visión (VLM) el razonamiento espacial multi-paso a través de una serie de arquitecturas, ya que las tareas de ensamblaje dependen no solo de emparejar los objetos correctos en el momento correcto — un proceso conocido como emparejamiento — sino también de seguir instrucciones que pueden ser mucho más abstractas que la escena visual cruda disponible para el modelo en cualquier paso determinado:

Preguntas desafiantes del proyecto LEGO-Puzzles. Fuente - https://tangkexian.github.io/LEGO-Puzzles/

Preguntas desafiantes del proyecto LEGO-Puzzles. Fuente

El proyecto más reciente en abordar el desafío del ensamblaje de muebles explota una cosecha más actual y capaz de modelos de IA, incluyendo Google Gemini 2.5/3.1 y OpenAI’s GPT-5 — pero aún no logra obtener una victoria para la IA en la tarea, con solo mejoras modestas sobre la oportunidad basal, y el rendimiento ‘muy por debajo de los niveles humanos’.

Los autores afirman:

‘Nuestros experimentos revelan que los VLM de vanguardia luchan significativamente con el razonamiento espacial y temporal, destacando sus limitaciones para aprovechar eficazmente la información temporal de los videos, capacidad de seguimiento limitada y comprensión de interacciones espaciales como el contacto físico.’

Los problemas que se abordan en esta rama de la investigación solo están relacionados con la robótica práctica en esta etapa, aunque seguramente surgirán desafíos adicionales cuando los problemas teóricos finalmente evolucionen en IA encarnada.

El nuevo documento se titula Banco de pruebas de paquete plano: Evaluación de la comprensión espacial y temporal en grandes Modelos de Lenguaje de Visión a través del ensamblaje de muebles, y proviene de ocho autores de la Universidad de Cornell, Cornell Tech, MBZUAI y UC Berkeley. El documento viene acompañado de un sitio web del proyecto.

Método

Los autores del nuevo trabajo enfatizan la dificultad que tienen los asistentes de IA para comprender el proceso de ensamblaje a través de la observación, por ejemplo, a través del tipo de video instructivo de estilo YouTube al que muchas personas recurren para beneficiarse del conocimiento de la comunidad:

Algunas de las preguntas que plantea la tarea de ensamblaje de paquete plano, junto con las cuatro habilidades esenciales necesarias para superar los desafíos. Fuente - https://arxiv.org/pdf/2605.21625

Algunas de las preguntas que plantea la tarea de ensamblaje de paquete plano, junto con las cuatro habilidades esenciales necesarias para superar los desafíos. Fuente

Curaron un conjunto de datos filtrado del conjunto de datos mencionado anteriormente, IKEA-Manuals-at-Work (IMaW) conjunto de datos, que cuenta con videos en el mundo real de personas ensamblando muebles de IKEA. El conjunto de datos de referencia revisado elimina las tarjetas de instrucciones de texto de los videos originales, con variantes de video clave y video completo proporcionadas por separado, y también agrega instrucciones visuales anotadas manualmente con partes de muebles segmentadas, para respaldar tareas de razonamiento de opción múltiple.

La referencia gira en torno a cuatro tipos de preguntas: EMPAR, que determina si dos partes están conectadas en el ensamblaje final; SEGUIMIENTO, que requiere que los modelos recuperen la correspondencia correcta entre identificadores de partes revueltos a través de marcos segmentados utilizando el video en sí; TORD, que evalúa si los modelos pueden inferir el orden correcto de los eventos de conexión; y TLOC, que prueba si los modelos pueden identificar los eventos que ocurren inmediatamente antes o después del estado mostrado en la instrucción visual, lo que requiere localización temporal y razonamiento sobre eventos cercanos.

Ejemplos de la nueva referencia, que ilustran los cuatro tipos de tareas básicas diseñadas para probar el razonamiento espacial y temporal en videos de ensamblaje de muebles: Localización Temporal; Orden Temporal; Seguimiento; y Emparejamiento. Cada tarea combina metraje de video de ensamblaje con una o más instrucciones visuales con etiquetas de segmentación y una pregunta de razonamiento de opción múltiple.

Ejemplos de la nueva referencia, que ilustran los cuatro tipos de tareas básicas diseñadas para probar el razonamiento espacial y temporal en videos de ensamblaje de muebles: Localización Temporal; Orden Temporal; Seguimiento; y Emparejamiento. Cada tarea combina metraje de video de ensamblaje con una o más instrucciones visuales con etiquetas de segmentación y una pregunta de razonamiento de opción múltiple.

Los modelos de plantilla que se muestran en la imagen de esquema anterior se derivaron de estos cuatro modelos de preguntas.

Los autores también señalan que agregaron anotaciones de ensamblaje de partes detalladas a cada uno de los videos IMaW originales, especificando qué partes se conectan a qué otras partes — detalles que faltan en la colección original.

Evasión

Las preguntas, señala el documento, necesitaban ser curadas manualmente, ya que las preguntas auto-generadas a menudo dan a la IA la oportunidad de ignorar el video y referirse a su propia comprensión entrenada — un escenario que cualquier usuario habitual de LLM/VLM probablemente reconoce, ya que la optimización y otras prioridades corporativas misteriosas a menudo hacen que los modelos de vanguardia ignoren la información presentada, como PDF o imágenes, y se basen en su propia comprensión en su lugar*:

‘[Encontramos que la auto-generación frecuentemente producía preguntas que podían responderse ignorando el video y explotando atajos. Por ejemplo, preguntas de emparejamiento auto-generadas sobre partes ya posicionadas para la conexión, o incluyendo opciones de distracción con formas o colores claramente distintos, lo que permitía una fácil [eliminación]. Para abordar esto, curamos todas las preguntas manualmente utilizando plantillas fijas.

‘Los anotadores recibieron el video de ensamblaje completo, los marcos con etiquetas de segmentación para las instrucciones visuales, las plantillas de preguntas y las directrices detalladas para evitar atajos basados en señales de pista estáticas de la instrucción visual.’

La referencia terminada consta de 602 preguntas de opción múltiple en 50 videos de ensamblaje de muebles variables.

Datos y pruebas

Los modelos evaluados para la ronda de pruebas fueron las variantes de ChatGPT y Gemini mencionadas anteriormente, así como Video-LLaVA; LLaVA-NeXT-Vid; LLaVA-OneVision; LLaVA-Video; Qwen 2.5/Qwen 3-VL; InternVL3; ArrowRL; PerceptionLM; y Video-Refer.

GenS se utilizó para elegir marcos relevantes para preguntas en videos largos para el modelo Gemini 2.5 Pro base, y la mayoría de los modelos se probaron en un contexto de una sola llamada bajo decodificación codiciosa (no compatible con GPT-5, sin embargo).

Se diseñaron tres formatos de instrucciones para la referencia: la instrucción mixta proporcionó la instrucción visual como una imagen separada junto al video de ensamblaje; la instrucción collage incrustó la instrucción visual directamente en cada marco de video como parte de una disposición de cuadrícula; y la instrucción concat agregó las instrucciones visuales al principio del video.

Se probaron tanto las variantes de video recortadas como las de marco clave en estos formatos, con el fin de medir cómo podría afectar la estructura de la instrucción y la compresión temporal el rendimiento del modelo.

Las líneas de base de oportunidad consideradas para las pruebas también incluyeron la ‘oportunidad de frecuencia’, donde se elige la opción más común (en lugar de una opción verdaderamente aleatoria).

Factor humano

El rendimiento humano se evaluó utilizando participantes provenientes de programas de ciencias de la computación, que van desde el nivel de pregrado hasta el nivel de doctorado. Cada participante recibió un video de ensamblaje, la instrucción visual asociada y la pregunta de opción múltiple, así como la instrucción de la tarea, antes de elegir una respuesta.

Se recopilaron tres respuestas por pregunta y se resolvieron a través de votación por mayoría, mientras que también se realizó un estudio de crowdsourcing en un subconjunto aleatorio de la referencia.

Se utilizó la precisión como la métrica para las pruebas:

Modelo Clasificación Promedio micro TORD TLOC SEGUIMIENTO EMPAR
Rendimiento humano 94.18 93.54 93.20 93.77 97.70
Líneas de base de oportunidad
Oportunidad aleatoria 26.41 25.00 25.00 25.49 33.33
Oportunidad de frecuencia 26.74 27.74 30.10 26.46 36.78
Modelos propietarios
GPT-5 1 37.71 40.65 53.40 25.68 49.43
Gemini 2.5 Pro 2 33.72 40.65 44.66 23.35 39.08
Gemini 3.1 Pro 3 32.89 34.84 43.69 21.79 49.43
Gemini 2.5 Flash 4 31.06 31.61 41.75 23.35 40.23
Gemini 2.5 Pro + GenS 5 25.58 33.55 32.04 13.23 40.23
Modelos abiertos
Video-LLaVA-7B 26 23.75 21.29 35.92 10.89 51.72
InternVL3-14B 5 37.71 42.58 21.36 37.74 48.28
InternVL3-38B 12 36.05 42.58 37.86 25.68 52.87
InternVL3-78B 1 41.03 43.87 39.81 42.02 34.48
Qwen2.5-VL-7B 22 30.23 27.10 18.45 33.07 41.38
Qwen2.5-VL-32B 13 35.88 34.84 29.13 33.07 54.02
Qwen2.5-VL-72B 2 40.37 41.29 30.10 45.14 36.78
Qwen3-VL-4B 11 36.54 34.19 33.01 32.68 56.32
Qwen3-VL-4B-Think 9 37.21 31.61 25.24 37.74 59.77
Qwen3-VL-8B 15 33.72 36.13 30.10 33.85 33.33
Qwen3-VL-8B-Think 17 31.73 34.19 33.01 25.29 44.83
Qwen3-VL-32B 6 37.71 38.71 46.60 31.91 42.53
Qwen3-VL-32B-Think 3 40.03 38.71 22.33 45.53 47.13
Qwen3-VL-30B-A3B 10 36.71 30.32 22.33 42.02 49.43
Qwen3-VL-235B-A22B 8 37.21 37.42 25.24 39.69 43.68
LLaVA-NeXT-Vid-7B 25 25.08 33.55 24.27 16.73 35.63
LLaVA-NeXT-Vid-34B 21 30.40 30.32 24.27 32.68 31.03
LlaVA-OneVision-7B 16 32.89 26.45 30.10 34.24 43.68
LlaVA-OneVision-72B 4 38.37 35.48 25.24 38.91 57.47
LLaVA-Video-7B 19 30.73 30.97 24.27 25.68 52.87
LLaVA-Video-72B 7 37.54 36.77 27.18 35.80 56.32
Perception-LM-1B 24 27.74 28.39 26.21 25.29 35.63
Perception-LM-3B 18 31.40 28.39 32.04 29.96 40.23
Perception-LM-8B 14 35.38 26.45 26.21 44.75 34.48
VideoRefer 23 28.57 32.90 30.10 17.51 51.72
ArrowRL-7B 20 30.56 30.97 24.27 29.18 41.38

Resultados de rendimiento en FLAT-PACK BENCH, comparando modelos multimodales propietarios y abiertos en tareas de Orden Temporal, Localización Temporal, Seguimiento y Emparejamiento, con el rendimiento humano que sigue siendo mucho mejor que todos los sistemas probados a pesar de las ganancias modestas entre los modelos de vanguardia más grandes.

Como se ve en las pruebas iniciales (imagen de arriba), los humanos obtuvieron >90% en todas las categorías de preguntas, con una unanimidad del 80%, lo que sugiere, según el documento, que las proposiciones están bien formuladas y no ambiguas.

GPT-5 y Gemini 2.5/3.1 Pro lucharon en el conjunto de datos, logrando solo mejoras modestas sobre la línea de base de oportunidad, y permanecieron muy por debajo del rendimiento humano. Usar GenS para seleccionar marcos relevantes para preguntas en videos largos no mejoró los resultados de Gemini 2.5 Pro, lo que llevó a los autores a concluir que los VLM propietarios luchan con la tarea de comprensión espacial y temporal requerida por la referencia.

Entre los sistemas abiertos, los resultados más fuertes provinieron de las familias InternVL3 y Qwen, aunque el rendimiento varió mucho en la categoría; y los sistemas especializados, incluyendo PerceptionLM y VideoRefer, también lucharon en las tareas de ensamblaje complejas de la referencia, con los participantes humanos que siguen siendo significativamente superiores en cada categoría de modelo.

Los investigadores también probaron dos estrategias de instrucción de cadena de pensamiento contra la configuración de instrucción estándar del documento. La instrucción Cadena de pensamiento de disparo cero pidió a los modelos que explicaran sus respuestas paso a paso, mientras que la instrucción Coherencia con cadena de pensamiento generó cinco respuestas candidatas antes de seleccionar una respuesta final a través de votación por mayoría. Sin embargo, ninguna de las dos mejoró los resultados en el conjunto de datos Flat Pack Bench, con ambas estrategias que obtuvieron puntuaciones por debajo de la configuración de instrucción predeterminada de la referencia.

Código secreto

Para probar si los VLM realmente estaban aprendiendo de los videos de ensamblaje, o simplemente explotando pistas visuales estáticas, los investigadores crearon una versión de imagen solo de la referencia, que omitió el video por completo, conservando solo el texto de la pregunta y las instrucciones visuales.

El rendimiento humano se derrumbó en más del 50% en estas condiciones, lo que muestra que las tareas realmente requieren una comprensión temporal del proceso de ensamblaje. Los modelos, sin embargo, se degradaron mucho menos severamente, con algunas tareas que permanecieron estables o incluso mejoraron sin la entrada de video.

Esto indica, sugiere el documento, que muchos VLM no estaban utilizando de manera significativa la información temporal en los videos en absoluto, sino que confiaban en atajos basados en imágenes y suposiciones de sentido común para inferir respuestas plausibles*:

Rendimiento del VLM en la versión de imagen solo de Flat-Pack Bench, en comparación con la configuración de video más imagen estándar, con resultados adicionales después de barajar los identificadores de partes para probar si los modelos estaban explotando atajos de orden de etiqueta en lugar de comprensión de video temporal.

Rendimiento del VLM en la versión de imagen solo de Flat-Pack Bench, en comparación con la configuración de video más imagen estándar, con resultados adicionales después de barajar los identificadores de partes para probar si los modelos estaban explotando atajos de orden de etiqueta en lugar de comprensión de video temporal.

‘[La imagen de arriba] muestra el rendimiento del VLM en esta versión de imagen solo, y el cambio en su rendimiento desde la evaluación completa, junto con el rendimiento humano.

‘La caída brusca en el rendimiento humano (>50%) muestra que las preguntas realmente requieren videos para responder.

‘También observamos que el rendimiento general del modelo disminuye severamente (8.80%), pero principalmente debido a la tarea de SEGUIMIENTO. La precisión en otras tareas permanece igual o mejora, lo que indica que el VLM no utiliza el video de manera efectiva, mientras que los humanos utilizan el video para responder.’

El análisis más profundo del documento sugiere que el principal obstáculo no es solo la secuencia temporal simple, sino fallas en la vinculación de objetos y el razonamiento espacial y temporal: los modelos a menudo lucharon para seguir las partes de muebles visualmente similares a través del movimiento, los cambios de cámara y los cambios de escena, incluso cuando parecían identificar el proceso de ensamblaje más amplio correctamente.

Se realizaron experimentos adicionales que involucraron dejar que una IA agente con herramientas se ocupara de la tarea, y esta ‘desempeñó mal’ según los autores — aunque pudo responder correctamente a un 11,48% adicional de preguntas que los otros enfoques no lograron responder.

Conclusión

Retener internalizaciones persistentes de conceptos y objetos es central tanto para la experiencia humana de crecimiento y desarrollo perceptual, como para las tareas individuales, a menudo novedosas, para las cuales ese desarrollo nos ha preparado.

La investigación de Visión por Computadora ya tiene una lucha en curso para re-adquirir y re-reconocer objetos y personas que dejan y re-ingresan el marco. Estos problemas se magnifican significativamente con la necesidad de alterar constantemente la visión y la postura — como es probable que ocurra en un video instructivo de YouTube sobre ensamblaje de muebles de paquete plano. Se puede imaginar la medida en que los cambios de POV aún más impactantes de un video egocéntrico podrían confundir aún más los intentos de la IA de ensamblar muebles.

 

* El formato original de los autores, modificado por mí según sea necesario para conservar el impacto bajo la configuración de formato de cita/

Publicado por primera vez el lunes 25 de mayo de 2026. Modificado el miércoles 27 de mayo de 2026 para corregir esta atribución de fecha (!).

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]