Angle d’Anderson
L’IA est nettement moins performante que les humains pour assembler des meubles

ChatGPT et Google Gemini ne peuvent toujours pas comprendre de manière fiable les vidéos d’assemblage d’IKEA, avec de nombreux autres systèmes d’IA éminents qui confondent les pièces, manquent de connexions et utilisent à peine la vidéo elle-même pour comprendre ce qui se passe.
Le mème culturel durable autour de la difficulté d’assembler des meubles plats en colis d’IKEA rend le sujet attractif pour la recherche en vision par ordinateur — notamment parce que les longues séquences d’actions, le suivi d’objets et la raison spatiale impliqués tendent à pousser les systèmes de manipulation robotique bien au-delà des formes simplifiées et des environnements contrôlés auxquels ils sont habitués.
Par conséquent, les travaux sur les routines d’assemblage robotique alimentées par l’IA pour les meubles plats en colis sont devenus une petite mais respectable branche de la littérature, avec des sorties telles que l’environnement d’assemblage de meubles d’IKEA de l’USC en 2019, parmi les premiers jeux de données et contextes de recherche spécifiquement axés sur l’assemblage de meubles:
Cliquez pour jouer Exemples de pratique d’assemblage robotique, à partir du site du projet pour l’initiative de l’environnement d’assemblage de meubles d’IKEA de 2019. Source
En 2024, la collaboration Stanford/J.P. Morgan Manuels d’IKEA au travail a été la première à sonder de manière significative la capacité de l’IA à entreprendre cette procédure apparemment banale (mais souvent frustrante), sur la base d’un nouveau jeu de données d’images issues de manuels d’instructions et en utilisant des vidéos d’instruction:

Méthode et détails du jeu de données de l’initiative Manuels d’IKEA au travail de 2024. Source
Les auteurs du document de 2024 — qui ont utilisé DGCNN, CNOS, SAM-6D, MegaPose, MiDaS, SAM2 Hiera-L, Cutie-base, et GPT-4o — ont conclu que la tâche posait ‘des défis importants pour ancrer les vidéos d’assemblage d’instruction, notamment l’extraction de la segmentation des pièces et des poses, la construction de plans d’assemblage de haut niveau et la détection des étapes clés d’assemblage dans les vidéos’.
Wax On, Wax Off
Il doit être évident que, même si obtenir l’IA pour nous faire sortir d’une tâche que peu de gens apprécient serait agréable, ce n’est pas un objectif scientifique, ni une priorité élevée pour le secteur de la recherche en vision par ordinateur.
Plutôt, la valeur de la tâche réside dans le fait que ce que les systèmes d’IA doivent apprendre pour devenir compétents dans ce domaine les ancrerait pour des routines bien plus sérieuses qui sont également ou plus difficiles, dans l’agriculture, l’industrie, le secteur des services et divers autres domaines.
Dans ce sens, le projet LEGO-Puzzles et le jeu de données examinent comment les modèles de langage de vision (VLM) gèrent la raison spatiale mult étape sur une gamme d’architectures, puisque les tâches d’assemblage dépendent non seulement de l’appariement des objets corrects au moment opportun — un processus appelé mating — mais également du suivi d’instructions qui peuvent être bien plus abstraites que la scène visuelle brute disponible pour le modèle à un moment donné:

Questions difficiles du projet LEGO-Puzzles. Source
Le projet le plus récent pour relever le défi de l’assemblage de meubles exploite une récolte plus actuelle et plus capable de modèles d’IA, notamment Google Gemini 2.5/3.1 et OpenAI’s GPT-5 — mais échoue toujours à obtenir une victoire pour l’IA dans la tâche, avec seulement des améliorations modestes par rapport à la chance de base, et des performances ‘bien en dessous des niveaux humains’.
Les auteurs déclarent:
‘Nos expériences révèlent que les VLM de pointe ont du mal de manière significative avec la raison spatiale et temporelle fine, mettant en évidence leurs limites pour exploiter efficacement les informations temporelles des vidéos, leur capacité de suivi limitée et leur compréhension des interactions spatiales comme le contact physique’.
Les problèmes abordés dans cette branche de recherche ne sont liés qu’à titre notionnel à la robotique pratique à ce stade, bien que des défis supplémentaires attendent probablement lorsque les problèmes théoriques évolueront enfin en IA incarnée.
Le nouvel article est intitulé Banc plat: évaluation de la compréhension spatio-temporelle dans les grands modèles de vision de langage grâce à l’assemblage de meubles, et provient de huit auteurs de l’Université Cornell, Cornell Tech, MBZUAI et UC Berkeley. L’article est accompagné d’un site de projet.
Méthode
Les auteurs du nouveau travail soulignent la difficulté que les assistants d’IA ont à comprendre le processus d’assemblage par observation, par exemple, via le type de vidéo d’instruction YouTube que de nombreuses personnes consultent pour bénéficier de la connaissance de la communauté:

Certaines des questions que la tâche d’assemblage de meubles plats suscite, ainsi que les quatre compétences essentielles nécessaires pour relever les défis. Source
Ils ont créé un jeu de données filtré à partir du jeu de données précédemment mentionné, IKEA-Manuals-at-Work (IMaW), qui présente des vidéos enregistrées de personnes assemblant des meubles d’IKEA. Le benchmark révisé coupe les vidéos d’origine pour supprimer les cartes d’instruction texte uniquement, avec des variantes de cadre clé et de vidéo complète distinctes, et ajoute également des invites visuelles annotées manuellement avec des pièces de meubles segmentées, pour soutenir des tâches de raisonnement à choix multiple.
Le benchmark tourne autour de quatre types de questions: MATE, pour déterminer si deux pièces sont connectées dans l’assemblage final; TRACK, qui oblige les modèles à récupérer la correspondance correcte entre les ID de pièces mélangés à travers les cadres segmentés en utilisant la vidéo elle-même; TOrd, pour évaluer si les modèles peuvent déduire l’ordre correct des événements de connexion; et TLoc, pour tester si les modèles peuvent identifier les événements qui se produisent immédiatement avant ou après l’état affiché dans l’invite visuelle, nécessitant une localisation temporelle et une raison sur les événements voisins.

Exemples du nouveau benchmark, illustrant les quatre types de tâches de base conçues pour tester la raison spatiale et temporelle dans les vidéos d’assemblage de meubles: localisation temporelle; ordonnancement temporel; suivi; et appariement. Chaque tâche combine des séquences de vidéos d’assemblage avec une ou plusieurs invites visuelles étiquetées et une question de raisonnement à choix multiple.
Les modèles de gabarit présentés dans l’image de schéma ci-dessus ont été dérivés de ces quatre modèles de questions.
Les auteurs notent également qu’ils ont ajouté des annotations d’assemblage de pièces fines à chaque vidéo d’IMaW d’origine, en spécifiant quelles pièces se connectent à quelles autres pièces — des détails manquants dans la collection d’origine.
Évitement
Les questions, note le document, devaient être curées manuellement, car les questions auto-générées donnent souvent à l’IA la possibilité d’ignorer la vidéo et de se référer à sa propre compréhension formée — un scénario que tout utilisateur régulier de LLM/VLM est susceptible de reconnaître, car l’optimisation et d’autres priorités d’entreprise mystérieuses provoquent souvent les modèles de pointe pour ignorer les informations soumises, telles que des PDF ou des images, et s’appuyer sur leur propre compréhension au lieu de cela*:
‘[Nous] avons constaté que l’auto-génération produisait souvent des questions qui pouvaient être répondues en ignorant la vidéo et en exploitant des raccourcis. Par exemple, des questions de mating auto-générées sur des pièces déjà positionnées pour la connexion, ou des options de distraction avec des formes ou des couleurs clairement distinctes, permettant une élimination facile. Pour résoudre ce problème, nous avons curé toutes les questions manuellement en utilisant des modèles de gabarit fixes.
‘Les annotateurs ont reçu la vidéo d’assemblage complète, les cadres étiquetés pour les invites visuelles, les modèles de questions et les directives détaillées pour éviter les raccourcis basés sur les indices statiques de l’invite visuelle.’
Le benchmark terminé comprend 602 questions à choix multiple sur 50 vidéos d’assemblage de meubles variés.
Données et tests
Les modèles évalués pour les tests comprenaient les variantes ChatGPT et Gemini mentionnées plus haut, ainsi que Video-LLaVA; LLaVA-NeXT-Vid; LLaVA-OneVision; LLaVA-Video; Qwen 2.5/Qwen 3-VL; InternVL3; ArrowRL; PerceptionLM; et Video-Refer.
GenS a été utilisé pour choisir les cadres pertinents pour les questions dans les vidéos longues pour le modèle Gemini 2.5 Pro de base, et la plupart des modèles ont été testés dans un contexte à un seul coup sous décodage glouton (non pris en charge dans GPT-5, cependant).
Trois formats d’invite ont été conçus pour le benchmark: l’invite multimédia a fourni l’invite visuelle comme une image distincte aux côtés de la vidéo d’assemblage; l’invite collage a intégré l’invite visuelle directement dans chaque cadre de la vidéo en tant que partie d’une disposition de grille; et l’invite concat a préfixé les invites visuelles au début de la vidéo.
Les variantes de vidéo tronquées et de cadre clé ont été testées sur ces formats, afin de mesurer à quel point la structure d’invite et la compression temporelle pourraient affecter les performances du modèle.
Les repères de chance considérés pour les tests comprenaient également la ‘chance de fréquence’, où l’option la plus courante (plutôt qu’une option vraiment aléatoire) est choisie.
Facteur humain
Les performances humaines ont été évaluées en utilisant des participants issus de programmes d’informatique, allant des étudiants de premier cycle au niveau doctoral. Chaque participant a reçu une vidéo d’assemblage, l’invite visuelle et la question à choix multiple associée, ainsi que l’instruction de tâche, avant de choisir une réponse.
Trois réponses ont été collectées par question et résolues par vote à la majorité, tandis qu’une étude menée par la foule a également été menée sur un sous-ensemble aléatoire du benchmark.
Précision a été utilisée comme métrique pour les essais:
| Modèle | Classement | Moyenne micro | TOrd | TLoc | Track | Mate |
|---|---|---|---|---|---|---|
| Performance humaine | – | 94,18 | 93,54 | 93,20 | 93,77 | 97,70 |
| Repères de chance | ||||||
| Hasard aléatoire | – | 26,41 | 25,00 | 25,00 | 25,49 | 33,33 |
| Hasard de fréquence | – | 26,74 | 27,74 | 30,10 | 26,46 | 36,78 |
| Modèles propriétaires | ||||||
| GPT-5 | 1 | 37,71 | 40,65 | 53,40 | 25,68 | 49,43 |
| Gemini 2.5 Pro | 2 | 33,72 | 40,65 | 44,66 | 23,35 | 39,08 |
| Gemini 3.1 Pro | 3 | 32,89 | 34,84 | 43,69 | 21,79 | 49,43 |
| Gemini 2.5 Flash | 4 | 31,06 | 31,61 | 41,75 | 23,35 | 40,23 |
| Gemini 2.5 Pro + GenS | 5 | 25,58 | 33,55 | 32,04 | 13,23 | 40,23 |
| Modèles ouverts | ||||||
| Video-LLaVA-7B | 26 | 23,75 | 21,29 | 35,92 | 10,89 | 51,72 |
| InternVL3-14B | 5 | 37,71 | 42,58 | 21,36 | 37,74 | 48,28 |
| InternVL3-38B | 12 | 36,05 | 42,58 | 37,86 | 25,68 | 52,87 |
| InternVL3-78B | 1 | 41,03 | 43,87 | 39,81 | 42,02 | 34,48 |
| Qwen2.5-VL-7B | 22 | 30,23 | 27,10 | 18,45 | 33,07 | 41,38 |
| Qwen2.5-VL-32B | 13 | 35,88 | 34,84 | 29,13 | 33,07 | 54,02 |
| Qwen2.5-VL-72B | 2 | 40,37 | 41,29 | 30,10 | 45,14 | 36,78 |
| Qwen3-VL-4B | 11 | 36,54 | 34,19 | 33,01 | 32,68 | 56,32 |
| Qwen3-VL-4B-Think | 9 | 37,21 | 31,61 | 25,24 | 37,74 | 59,77 |
| Qwen3-VL-8B | 15 | 33,72 | 36,13 | 30,10 | 33,85 | 33,33 |
| Qwen3-VL-8B-Think | 17 | 31,73 | 34,19 | 33,01 | 25,29 | 44,83 |
| Qwen3-VL-32B | 6 | 37,71 | 38,71 | 46,60 | 31,91 | 42,53 |
| Qwen3-VL-32B-Think | 3 | 40,03 | 38,71 | 22,33 | 45,53 | 47,13 |
| Qwen3-VL-30B-A3B | 10 | 36,71 | 30,32 | 22,33 | 42,02 | 49,43 |
| Qwen3-VL-235B-A22B | 8 | 37,21 | 37,42 | 25,24 | 39,69 | 43,68 |
| LLaVA-NeXT-Vid-7B | 25 | 25,08 | 33,55 | 24,27 | 16,73 | 35,63 |
| LLaVA-NeXT-Vid-34B | 21 | 30,40 | 30,32 | 24,27 | 32,68 | 31,03 |
| LlaVA-OneVision-7B | 16 | 32,89 | 26,45 | 30,10 | 34,24 | 43,68 |
| LlaVA-OneVision-72B | 4 | 38,37 | 35,48 | 25,24 | 38,91 | 57,47 |
| LLaVA-Video-7B | 19 | 30,73 | 30,97 | 24,27 | 25,68 | 52,87 |
| LLaVA-Video-72B | 7 | 37,54 | 36,77 | 27,18 | 35,80 | 56,32 |
| Perception-LM-1B | 24 | 27,74 | 28,39 | 26,21 | 25,29 | 35,63 |
| Perception-LM-3B | 18 | 31,40 | 28,39 | 32,04 | 29,96 | 40,23 |
| Perception-LM-8B | 14 | 35,38 | 26,45 | 26,21 | 44,75 | 34,48 |
| VideoRefer | 23 | 28,57 | 32,90 | 30,10 | 17,51 | 51,72 |
| ArrowRL-7B | 20 | 30,56 | 30,97 | 24,27 | 29,18 | 41,38 |
Résultats des performances sur FLAT-PACK BENCH, comparant les modèles multimodaux propriétaires et ouverts sur les tâches d’ordonnancement temporel (TOrd), de localisation temporelle (TLoc), de suivi et d’appariement, la performance humaine restant loin devant tous les systèmes testés malgré des gains modestes parmi les plus grands modèles de pointe.
Comme le montre les tests initiaux (image ci-dessus), les humains ont obtenu plus de 90 % dans toutes les catégories de questions, avec une unanimité de 80 %, ce qui suggère, selon le document, que les propositions sont bien formulées et non ambiguës.
GPT-5 et Gemini 2.5/3.1 Pro ont eu du mal sur le jeu de données, n’obtenant que des améliorations modestes par rapport au repère de chance, et sont restés loin des performances humaines. L’utilisation de GenS pour sélectionner les cadres pertinents pour les questions n’a pas amélioré les résultats de Gemini 2.5 Pro, ce qui a conduit les auteurs à conclure que les VLM propriétaires ont du mal avec la tâche de compréhension spatio-temporelle requise par le benchmark.
Parmi les systèmes ouverts, les résultats les plus forts sont venus des familles InternVL3 et Qwen, même si les performances dans cette catégorie ont varié fortement, avec plusieurs modèles à peine surpassant le hasard; et des systèmes spécialisés, notamment PerceptionLM et VideoRefer, ont également eu du mal sur les tâches d’assemblage complexes du benchmark, les participants humains restant nettement en tête dans chaque catégorie de modèles.
Les chercheurs ont également testé deux stratégies d’invocation de chaîne de pensée contre la configuration d’invocation standard du document. L’invocation Zero-shot Chain-of-Thought a demandé aux modèles d’expliquer leurs réponses étape par étape, tandis que Self-consistency with Chain-of-Thought a généré cinq réponses candidates avant de sélectionner une réponse finale par vote à la majorité. Cependant, aucune de ces approches n’a amélioré les résultats sur le benchmark de Flat Pack, les deux approches obtenant des scores inférieurs à la configuration d’invocation par défaut du benchmark.
Cheat Code
Pour tester si les VLM apprenaient vraiment à partir des vidéos d’assemblage ou s’ils exploitaient simplement des indices visuels statiques, les chercheurs ont créé une version image-seulement du benchmark, qui omettait la vidéo entière, ne conservant que le texte de la question et les invites visuelles.
Les performances humaines se sont effondrées de plus de 50 % dans ces conditions, montrant que les tâches nécessitaient réellement une compréhension temporelle du processus d’assemblage. Les modèles, cependant, se sont dégradés beaucoup moins sévèrement, certains tâches restant stables ou même s’améliorant sans entrée vidéo.
Cela indique, suggère le document, que de nombreux VLM ne utilisent pas de manière significative les informations temporelles des vidéos du tout, mais s’appuient plutôt sur des raccourcis basés sur des images et des hypothèses de bon sens pour inférer des réponses plausibles*:

Performances du VLM sur la version image-seulement de Flat-Pack Bench, comparées à la configuration vidéo-plus-image standard, avec des résultats supplémentaires après avoir mélangé les ID de pièces pour tester si les modèles exploitaient des raccourcis d’ordre d’étiquette au lieu d’une compréhension temporelle de la vidéo.
‘[L’image ci-dessus] montre les performances du VLM sur cette version image-seulement, et le changement dans leurs performances par rapport à l’évaluation complète, ainsi que les performances humaines.
‘La chute abrupte des performances humaines (>50%) montre que les questions nécessitent des vidéos pour y répondre.
‘Nous observons également que les performances globales du modèle chutent sévèrement (8,80%), mais principalement en raison de la tâche de suivi. L’exactitude des autres tâches reste la même ou s’améliore, indiquant que le VLM n’utilise pas efficacement la vidéo, tandis que les humains utilisent la vidéo pour répondre.’
L’analyse plus approfondie du document suggère que l’obstacle principal n’est pas simplement la séquence temporelle, mais les échecs dans l’ancrage d’objets et la raison spatiale et temporelle: les modèles ont souvent du mal à suivre les pièces de meubles visuellement similaires à travers le mouvement, les changements de caméra et les changements de scène, même lorsqu’ils semblent identifier correctement le processus d’assemblage plus large.
D’autres expériences ont consisté à lâcher un AI doté d’outils sur la tâche, et celui-ci « s’est comporté mal » selon les auteurs — même s’il a pu répondre correctement à 11,48 % de questions supplémentaires manquées par les autres approches.
Conclusion
Conserver des internalisations persistantes de concepts et d’objets est central à la fois pour l’expérience humaine de croissance et de développement perceptuel, et dans des tâches individuelles, souvent nouvelles, pour lesquelles ce développement nous a préparés.
La recherche en vision par ordinateur a déjà un combat en cours pour réacquérir et réidentifier des objets et des personnes qui quittent et réentrent dans le cadre. Ces problèmes sont considérablement amplifiés avec la nécessité de modifier constamment la vision et la position — comme cela se produit probablement dans une vidéo d’instruction YouTube sur l’assemblage de meubles plats en colis. On peut imaginer à quel point les changements de point de vue encore plus choquants d’une vidéo égocentrique pourraient encore plus dérouter les tentatives d’assemblage de meubles par l’IA.
* Le formatage d’origine des auteurs, modifié par moi si nécessaire pour conserver l’impact sous le formatage de citation/
Publié pour la première fois lundi 25 mai 2026. Modifié mercredi 27 mai 2026 pour corriger cette attribution de date (!).












