Andersons vinkel

AI är betydligt sämre än människor på att montera möbler

mm
Lägg till Unite.AI bland dina föredragna källor på Google
AI-generated image (GPT-2): An industrial humanoid robot sits on the floor of a sparsely furnished apartment beside a grotesquely malformed piece of self-assembled furniture, holding a screwdriver while studying the collapsed structure amid IKEA boxes, scattered components, and assembly instructions.

ChatGPT och Google Gemini kan fortfarande inte tillförlitligt förstå IKEA-monteringsvideor, och många andra framstående AI-system förvirrar delar, missar anslutningar och använder knappt videon själv för att förstå vad som händer.

 

Den bestående kulturella memen kring svårigheten att montera IKEA-liknande plattförpackade möbler gör ämnet till ett attraktivt mål för datorseende-forskning — inte minst för att de långa sekvenserna av handlingar, objekttillföljd och rumslig resonemang som är inblandade tenderar att driva robotmanipulationssystem långt bortom de förenklade formerna och kontrollerade miljöer som de är vana vid.

Därför har arbetet med AI-styrda robotmonteringsrutiner för plattförpackade möbler blivit en liten men respektabel gren inom litteraturen, med exempel som USC:s 2019 IKEA Furniture Assembly Environment, bland de första benchmark-dataseten och forskningssammanhang som specifikt riktade sig mot möbelmontering:

Klicka för att spela upp Exempel på robotmonteringsövning, från projektwebbplatsen för 2019 års IKEA Furniture Assembly Environment-initiativ. Källa

År 2024 var Stanford/J.P. Morgan-samarbetet IKEA Manuals at Work det första som betydligt undersökte AI:s förmåga att utföra denna uppenbarligen vardagliga (om än ofta frustrerande) procedur, baserat på en ny dataset av bilder från instruktionsmanualer och med hjälp av instruktionsvideor:

Datametod och detaljer från 2024 års IKEA Manuals at Work-initiativ. Källa - https://arxiv.org/abs/2411.11409

Datametod och detaljer från 2024 års IKEA Manuals at Work-initiativ. Källa

Författarna till 2024 års artikel – som utnyttjade DGCNN, CNOS, SAM-6D, MegaPose, MiDaS, SAM2 Hiera-L, Cutie-base, och GPT-4o – drog slutsatsen att uppgiften medförde ‘betydande utmaningar i att förankra instruktionsmonteringsvideor, inklusive att extrahera delsegmenteringar och poser, konstruera högnivåmonteringsplaner och upptäcka nyckelmonteringssteg i videor’.

Wax On, Wax Off

Det måste vara uppenbart att, medan det vore trevligt att automatisera en uppgift som få uppskattar, är det knappast en vetenskaplig ledstjärna eller högt upp på prioritetslistan för datorseende-forskning.

Snarare ligger värdet i uppgiften i det faktum att vad AI-system behöver lära sig för att bli duktiga på detta skulle förbereda dem för betydligt svårare rutiner som är lika eller ännu mer utmanande, inom jordbruk, industri, servicebranschen och många andra områden.

I detta sammanhang undersöker LEGO-Puzzles-projektet och dataset hur väl Vision Language Models (VLMs) hanterar multi-stegsrumslig resonemang över en rad arkitekturer, eftersom monteringsuppgifter inte bara beror på att para ihop rätt objekt vid rätt tillfälle – en process som kallas mating – utan också på att följa instruktioner som kan vara långt mer abstrakta än den råa visuella scenen som är tillgänglig för modellen vid varje given tidpunkt:

Utmärkande frågor från LEGO-Puzzles-projektet. Källa - https://tangkexian.github.io/LEGO-Puzzles/

Utmärkande frågor från LEGO-Puzzles-projektet. Källa

Det senaste projektet som tar itu med utmaningen att montera möbler utnyttjar en mer aktuell och kapabel skörd av AI-modeller, inklusive Google Gemini 2.5/3.1 och OpenAI:s GPT-5 – men lyckas fortfarande inte att uppnå en seger för AI i uppgiften, med endast måttliga förbättringar jämfört med baslinjen, och prestationer “långt under mänskliga nivåer”.

Författarna skriver:

‘Våra experiment visar att state-of-the-art LVLMs kämpar betydligt med fin-granulerad spatio-temporell resonemang, vilket lyfter fram deras begränsningar i att effektivt utnyttja temporalt information från videor, begränsad spårningsförmåga och förståelse av rumsliga interaktioner som fysisk kontakt.’

De problem som tas itu med i denna gren av forskningen är endast nominellt relaterade till praktisk robotik på detta stadium, även om ytterligare utmaningar säkert väntar när de teoretiska frågorna slutligen utvecklas till inkorporerad AI.

Den nya artikeln heter Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly, och kommer från åtta författare på Cornell University, Cornell Tech, MBZUAI och UC Berkeley. Artikeln åtföljs av en projektwebbplats.

Metod

Författarna till det nya arbetet betonar svårigheten som AI-assistenter har att förstå monteringsprocessen genom observation, till exempel via den typ av YouTube-liknande instruktionsvideo som många människor vänder sig till för att dra nytta av community-kunskap:

Några av de frågor som flat-pack-monteringsuppgiften väcker, tillsammans med de fyra grundläggande färdigheterna som krävs för att bemöta utmaningarna. Källa - https://arxiv.org/pdf/2605.21625

Några av de frågor som flat-pack-monteringsuppgiften väcker, tillsammans med de fyra grundläggande färdigheterna som krävs för att bemöta utmaningarna. Källa

De kuraterade en dataset filtrerad från den tidigare nämnda IKEA-Manuals-at-Work (IMaW) dataset, som innehåller videor av människor som monterar IKEA-möbler i vildmarken. Den reviderade benchmarken klipper den ursprungliga videon för att ta bort textbaserade instruktionskort, med separata nyckelfrämre- och full-videovarianter tillhandahållna, och lägger till manuellt annoterade visuella påminnelser med segmenterade möbeldelar, för att stödja flervals resonemangs-uppgifter.

Benchmarken kretsar kring fyra frågetyper: MATE, som bestämmer om två delar är anslutna i den slutliga monteringen; TRACK, som kräver att modellerna återställer den korrekta korrespondensen mellan ombytta del-IDs över segmenterade ramar med hjälp av videon själv; TOrd, som utvärderar om modellerna kan sluta sig till den korrekta ordningen av anslutningshändelser; och TLoc, som testar om modellerna kan identifiera händelser som inträffar omedelbart före eller efter den tillstånd som visas i den visuella påminnelsen, vilket kräver temporalt läge och resonemang om närliggande händelser.

Exempel från den nya benchmarken, som visar de fyra kärnuppgiftstyperna som är utformade för att testa spatio-temporell resonemang i möbelmonteringsvideor: Temporalt läge; Temporal ordning; Spårning; och Mating. Varje uppgift kombinerar monteringsvideo-footage med en eller flera segmenteringsmärkta visuella påminnelser och en flervals resonemangsfråga.

Exempel från den nya benchmarken, som visar de fyra kärnuppgiftstyperna som är utformade för att testa spatio-temporell resonemang i möbelmonteringsvideor: Temporalt läge; Temporal ordning; Spårning; och Mating. Varje uppgift kombinerar monteringsvideo-footage med en eller flera segmenteringsmärkta visuella påminnelser och en flervals resonemangsfråga.

Mallarna som visas i schema-bilden ovan härstammar från dessa fyra frågemodeller.

Författarna noterar också att de lade till fin-granulerade del-monterings-annotationer till var och en av de ursprungliga IMaW-videorna, som specificerar vilka delar som ansluter till vilka andra delar – detaljer som saknades i den ursprungliga samlingen.

Undvikande

Frågorna, konstaterar artikeln, behövde manuellt kurateras, eftersom auto-genererade frågor ofta ger AI möjlighet att ignorera videon och hänvisa till sin egen utbildade förståelse – en scen som varje regelbunden användare av LLM/VLM förmodligen känner igen, eftersom optimering och andra mystiska företagsprioriteringar ofta orsakar frontmodeller att ignorera inskickad information, såsom PDF:er eller bilder, och förlita sig på sin egen förståelse istället*:

‘[Vi] fann att auto-generering ofta producerade frågor som kunde besvaras genom att ignorera videon och utnyttja genvägar. Till exempel auto-genererade mating frågor om delar som redan var positionerade för anslutning, eller innehöll distraktor-alternativ med tydligt olika former eller färger, vilket möjliggjorde enkel [eliminering]. För att åtgärda detta kuraterade vi alla frågor manuellt med hjälp av fasta mallar.

‘Annotatorerna fick den fullständiga monteringsvideon, segmenteringsmärkta ramar för visuella påminnelser, frågemallarna och detaljerade riktlinjer för att undvika genvägar baserade på statiska signaler från den visuella påminnelsen.’

Den färdiga benchmarken består av 602 flervalsfrågor över 50 varierande möbelmonteringsvideor.

Data och tester

Modellerna som utvärderades för testrundan var de tidigare nämnda ChatGPT och Gemini-varianterna, samt Video-LLaVA; LLaVA-NeXT-Vid; LLaVA-OneVision; LLaVA-Video; Qwen 2.5/Qwen 3-VL; InternVL3; ArrowRL; PerceptionLM; och Video-Refer.

GenS användes för att välja frågerelevanta ramar i långa videor för den grundläggande Gemini 2.5 Pro-modellen, och de flesta modellerna testades i ett one-shot sammanhang under girig avkodning (ostödd i GPT-5, dock).

Tre prompt-format utvecklades för benchmarken: den blandade media prompten tillhandahöll den visuella påminnelsen som en separat bild bredvid monteringsvideon; den collage prompten infogade den visuella påminnelsen direkt i varje videoram som en del av en grid-layout; och den concat prompten föregick den visuella påminnelsen i början av videon.

Både klippta och nyckelfrämre-videovarianter testades över dessa format, för att mäta hur starkt prompt-struktur och temporalt komprimering kunde påverka modellprestanda.

De chans-baslinjer som övervägdes för testerna inkluderade också ‘frekvens-chans’, där det vanligaste alternativet (snarare än ett verkligt slumpmässigt alternativ) väljs.

Mänsklig faktor

Mänsklig prestanda utvärderades med hjälp av deltagare från datavetenskapsprogram, som sträckte sig från grundnivå till doktorsnivå. Varje deltagare visades en monteringsvideo, och den associerade visuella påminnelsen och flervalsfrågan, samt uppgiftsinstruktionen, innan de valde ett svar.

Tre svar samlades in per fråga och löstes genom majoritetsröstning, medan en separat crowd-sourced studie också genomfördes på ett slumpmässigt urval av benchmarken.

Accuracy användes som mått för försöken:

Modell Rank Micro Avg. TOrd TLoc Track Mate
Mänsklig prestanda 94.18 93.54 93.20 93.77 97.70
Chans-baslinjer
Slumpmässig chans 26.41 25.00 25.00 25.49 33.33
Frekvens-chans 26.74 27.74 30.10 26.46 36.78
Proprietära modeller
GPT-5 1 37.71 40.65 53.40 25.68 49.43
Gemini 2.5 Pro 2 33.72 40.65 44.66 23.35 39.08
Gemini 3.1 Pro 3 32.89 34.84 43.69 21.79 49.43
Gemini 2.5 Flash 4 31.06 31.61 41.75 23.35 40.23
Gemini 2.5 Pro + GenS 5 25.58 33.55 32.04 13.23 40.23
Öppna modeller
Video-LLaVA-7B 26 23.75 21.29 35.92 10.89 51.72
InternVL3-14B 5 37.71 42.58 21.36 37.74 48.28
InternVL3-38B 12 36.05 42.58 37.86 25.68 52.87
InternVL3-78B 1 41.03 43.87 39.81 42.02 34.48
Qwen2.5-VL-7B 22 30.23 27.10 18.45 33.07 41.38
Qwen2.5-VL-32B 13 35.88 34.84 29.13 33.07 54.02
Qwen2.5-VL-72B 2 40.37 41.29 30.10 45.14 36.78
Qwen3-VL-4B 11 36.54 34.19 33.01 32.68 56.32
Qwen3-VL-4B-Think 9 37.21 31.61 25.24 37.74 59.77
Qwen3-VL-8B 15 33.72 36.13 30.10 33.85 33.33
Qwen3-VL-8B-Think 17 31.73 34.19 33.01 25.29 44.83
Qwen3-VL-32B 6 37.71 38.71 46.60 31.91 42.53
Qwen3-VL-32B-Think 3 40.03 38.71 22.33 45.53 47.13
Qwen3-VL-30B-A3B 10 36.71 30.32 22.33 42.02 49.43
Qwen3-VL-235B-A22B 8 37.21 37.42 25.24 39.69 43.68
LLaVA-NeXT-Vid-7B 25 25.08 33.55 24.27 16.73 35.63
LLaVA-NeXT-Vid-34B 21 30.40 30.32 24.27 32.68 31.03
LlaVA-OneVision-7B 16 32.89 26.45 30.10 34.24 43.68
LlaVA-OneVision-72B 4 38.37 35.48 25.24 38.91 57.47
LLaVA-Video-7B 19 30.73 30.97 24.27 25.68 52.87
LLaVA-Video-72B 7 37.54 36.77 27.18 35.80 56.32
Perception-LM-1B 24 27.74 28.39 26.21 25.29 35.63
Perception-LM-3B 18 31.40 28.39 32.04 29.96 40.23
Perception-LM-8B 14 35.38 26.45 26.21 44.75 34.48
VideoRefer 23 28.57 32.90 30.10 17.51 51.72
ArrowRL-7B 20 30.56 30.97 24.27 29.18 41.38

Prestandaresultat på FLAT-PACK BENCH, som jämför proprietära och öppna multimodala modeller över Temporal Ordering (TOrd), Temporal Localization (TLoc), Tracking och Mating-uppgifter, med mänsklig prestanda som förblir långt före alla testade system trots måttliga vinster bland större frontmodeller.

Som visas i de första testerna (bild ovan), fick människor över 90% i alla kategorier av frågor, med 80% enhällighet, vilket antyder, enligt artikeln, att påståendena är välformulerade och entydiga.

GPT-5 och Gemini 2.5/3.1 Pro kämpade på datasetet, och uppnådde endast måttliga förbättringar jämfört med chans-baslinjen, och förblev långt under mänsklig prestanda. Att använda GenS för att välja frågerelevanta ramar förbättrade inte Gemini 2.5 Pros resultat, vilket ledde författarna att dra slutsatsen att proprietära LVLMs kämpar med uppgiften att förstå spatio-temporell resonemang som krävs av benchmarken.

Bland öppna system var de starkaste resultaten från InternVL3- och Qwen-familjerna, även om prestandan varierade skarpt över kategorin, med flera modeller som knappt överträffade chansen; och specialiserade system, inklusive PerceptionLM och VideoRefer, kämpade också på benchmarkens komplexa monteringsuppgifter, med mänskliga deltagare som förblev betydligt före i varje modellkategori.

Forskarna testade också två chain-of-thought prompt-strategier mot artiklens standardprompt-uppsättning. Zero-shot Chain-of-Thought prompting bad modellerna att förklara sina svar steg för steg, medan Self-consistency with Chain-of-Thought genererade fem kandidat-svar innan de valde ett slutligt svar genom majoritetsröstning. Dock förbättrade varken av dessa strategier resultaten på Flat Pack Bench-datasetet, med båda strategierna som presterade under benchmarkens standardprompt-konfiguration.

Fusk-kod

För att testa om LVLMs verkligen lärde sig från monteringsvideorna, eller om de bara utnyttjade statiska visuella signaler, skapade forskarna en bild-baserad version av benchmarken, som uteslöt videon helt, och behöll endast frågetexten och visuella påminnelser.

Mänsklig prestanda kollapsade med över 50% under dessa förhållanden, vilket visar att uppgifterna verkligen krävde temporalt förstånd av monteringsprocessen. Modellerna, å andra sidan, försämrades inte så allvarligt, med vissa uppgifter som förblev stabila eller till och med förbättrades utan videoinmatning.

Detta indikerar, enligt artikeln, att många LVLMs inte använde den temporala informationen i videorna alltid, utan förlitade sig på bild-baserade genvägar och sunt förnuft för att inferera plausibla svar*:

Prestanda för LVLM på den bild-baserade versionen av Flat-Pack Bench, jämfört med den standard video-plus-bild-konfigurationen, med ytterligare resultat efter att ha slumpat om del-IDs för att testa om modellerna utnyttjade etikett-ordnings-genvägar istället för temporalt video-förstånd.

Prestanda för LVLM på den bild-baserade versionen av Flat-Pack Bench, jämfört med den standard video-plus-bild-konfigurationen, med ytterligare resultat efter att ha slumpat om del-IDs för att testa om modellerna utnyttjade etikett-ordnings-genvägar istället för temporalt video-förstånd.

‘[Bilden ovan] visar prestandan för LVLM på denna bild-baserade version, och förändringen i deras prestanda från den fullständiga utvärderingen, tillsammans med mänsklig prestanda.

‘Det skarpa fallet i mänsklig prestanda (>50%) visar att frågorna verkligen kräver videor för att besvaras.

‘Vi observerar också att den övergripande prestandan för modellen sjunker kraftigt (8.80%), men främst på grund av TRACK-uppgiften. Precision på andra uppgifter förblir densamma eller förbättras, vilket indikerar att LVLM inte använder videon effektivt, medan människor använder videon för att besvara.’

Artiklens djupare analys visar att det främsta hindret inte är enkel temporalt sekvensering utan snarare misslyckanden i objektförankring och spatio-temporell resonemang: modellerna kämpade ofta med att hålla reda på visuellt liknande möbeldelar över rörelse, kameraskift och scenförändringar, även när de tycktes identifiera den bredare monteringsprocessen korrekt.

Ytterligare experiment involverade att sätta en verktygsbärande agentic AI-lost på uppgiften, och denna “presterade dåligt” enligt författarna – men kunde korrekt besvara ytterligare 11,48% av frågorna som missades av de andra tillvägagångssätten.

Slutsats

Att behålla bestående internaliseringar av begrepp och objekt är centralt för både den mänskliga upplevelsen av tillväxt och perceptuell utveckling, och i individuella, ofta nya uppgifter som denna utveckling har förberett oss på.

Datorseende-forskning har redan en pågående kamp för att återförvärva och återigenkänna objekt och människor som lämnar och återinträder ramen. Dessa problem förstoras avsevärt med behovet av att ständigt ändra syn och hållning – som sannolikt kommer att inträffa i en YouTube-instruktionsvideo om plattförpackad möbelmontering. Man kan föreställa sig i vilken utsträckning de ännu mer störande POV-förändringarna i en egocentrisk video kan ytterligare förvirra AI:s försök att montera möbler.

 

* Författarnas ursprungliga formatering, ändrad av mig såsom nödvändigt för att behålla inverkan under citat-formatering/

Publicerad första gången måndag, 25 maj 2026. Ändrad onsdag 27 maj 2026 för att korrigera denna datum-attribut (!).

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai