Andersonův úhel
Umělé inteligence je výrazně horší než lidé při sestavování nábytku

ChatGPT a Google Gemini stále nemohou spolehlivě pochopit instrukční videa IKEA, zatímco mnoho dalších prominentních systémů AI zaměňuje součásti, пропouští spojení a téměř nevyužívají video samo o sobě k určení, co se děje.
Trvalý kulturní mém kolem obtížnosti sestavování nábytku IKEA-style flat-pack činí toto téma atraktivním cílem pro výzkum počítačového vidění — nejméně proto, že dlouhé sekvence akcí, sledování objektů a prostorové úsudky, které jsou zapojeny, budou pravděpodobně tlačit systémy robotického manipulace daleko za hranice zjednodušených tvarů a kontrolovaných prostředí, na které jsou zvyklé.
Práce na vývoji AI poháněných robotických sestavovacích rutin pro nábytek flat-pack se stala malou, ale respektovanou větví literatury, s výstupy jako Prostředí sestavování nábytku IKEA z roku 2019, jedním z prvních souborů dat a výzkumných kontextů speciálně zaměřených na sestavování nábytku:
Kliknutím spustíte Příklady robotické sestavovací praxe z projektu Prostředí sestavování nábytku IKEA. Zdroj
V roce 2024 byla spolupráce Stanford/J.P. Morgan Návody IKEA v akci první, kdo významně prozkoumal schopnost AI provádět tento zdánlivě všední (i když často frustrující) postup, na základě nového souboru dat obrazů z instrukčních manuálů a pomocí instrukčních videí:

Metoda a podrobnosti ze série 2024 Návody IKEA v akci. Zdroj
Autoři článku z roku 2024 — kteří využili DGCNN, CNOS, SAM-6D, MegaPose, MiDaS, SAM2 Hiera-L, Cutie-base, a GPT-4o — dospěli k závěru, že úkol přinesl ‘významné výzvy při zakotvení instrukčních montážních videí, včetně extrakce segmentací součástí a jejich poloh, konstrukce vysokouhlých montážních plánů a detekce klíčových montážních kroků ve videích’.
Wax On, Wax Off
Musí být zřejmé, že zatímco by bylo hezké, kdybychom mohli automatizovat úkoly, které si málokdo váží, není to vědecký cíl, nebo priorita pro sektor výzkumu počítačového vidění.
Rather, hodnota úkolu spočívá v tom, že to, co AI systémy potřebují naučit se aby se staly profi v tomto, by je připravilo na mnohem vážnější postupy, které jsou stejně nebo ještě více náročné, v zemědělství, průmyslu, službách a dalších sférách.
V tomto smyslu projekt LEGO-Puzzles a dataset zkoumá, jak dobře modely Vision Language (VLM) zvládají vícekrokové prostorové úsudky napříč různými architekturami, protože montážní úkoly závisí nejen na spojení správných objektů ve správném okamžiku — procesu známého jako mating — ale také na následování instrukcí, které mohou být daleko abstraktnější než surová vizuální scéna dostupná modelu v každém kroku:

Výzvající otázky z projektu LEGO-Puzzles. Zdroj
Nejnovější projekt, který se pokusil vyřešit výzvu sestavování nábytku, využívá novější a schopnější generaci modelů AI, včetně Google Gemini 2.5/3.1 a OpenAI GPT-5 — ale stále se nepodařilo získat vítězství pro AI v úkolu, s pouze skromnými zlepšeními oproti základnímu náhodnému výběru, a výkonem “daleko pod lidskou úrovní”.
Autoři uvádějí:
‘Naše experimenty ukazují, že současné LVLMs výrazně trpí jemnou prostorově-časovou úsudkou, zdůrazňující jejich omezení při efektivní utilizaci temporálních informací z videí, omezenou schopností sledovat a porozumět prostorovým interakcím, jako je fyzický kontakt.’
Problémy, které jsou řešeny v této větvi výzkumu, jsou pouze pojmově související s praktickou robotikou v této fázi, i když další výzvy jistě čekají, až teoretické problémy nakonec vyústí v ztělesněné AI.
Nový článek se jmenuje Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly a pochází od osmi autorů z Cornell University, Cornell Tech, MBZUAI a UC Berkeley. Článek je doprovázen projektovou stránkou.
Metoda
Autoři nové práce zdůrazňují obtížnost, se kterou AI asistenti rozumí procesu sestavování prostřednictvím pozorování, například prostřednictvím instrukčních videí na YouTube, ke kterým se mnoho lidí obrací, aby využili znalostí komunity:

Některé otázky, které úkol sestavování nábytku vyvolává, spolu se čtyřmi základními dovednostmi nezbytnými pro překonání výzev. Zdroj
Oni kurátorovali dataset filtrovaný z dříve zmíněného souboru IKEA-Manuals-at-Work (IMaW) dataset, který obsahuje videa lidí sestavujících nábytek IKEA. Revize benchmarku odstranila původní videa, aby odstranila textové instrukční karty, s oddělenými klíčovými snímky a plnými videi, a přidala ručně anotované vizuální podněty se segmentovanými součástmi nábytku, aby podpořila úkoly vícečetného výběru.
Benchmark se točí kolem čtyř typů otázek: MATE, určující, zda jsou dvě součásti spojeny ve finální montáži; TRACK, vyžadující, aby modely obnovily správnou korespondenci mezi zamíchanými ID součástek napříč segmentovanými snímky pomocí videa; TOrd, hodnotící, zda modely mohou odvodit správný řád spojení; a TLoc, testující, zda modely mohou identifikovat události, které se vyskytují okamžitě před nebo po stavu zobrazeném ve vizuálním podnětu, vyžadujícím temporální lokalizaci a úsudky o blízkých událostech.

Příklady z nového benchmarku, ilustrující čtyři základní typy úkolů navržené pro testování prostorově-časové úsudky ve videích sestavování nábytku: Temporální lokalizace; Temporální pořadí; Sledování; a Spojení. Každý úkol kombinuje montážní video s jedním nebo více segmentovanými vizuálními podněty a otázkou vícečetného výběru.
Šablony zobrazené v obrazové schéma výše byly odvozeny z těchto čtyř modelů otázek.
Autoři také poznamenali, že přidali jemné anotace montáže součástí k původním videím IMaW, specifikujícím, které součásti se spojují s jinými součástmi — detaily, které chyběly v původní sbírce.
Vyhnout se
Otázky, uvádí článek, musely být ručně kurátorovány, protože automaticky generované otázky často dávají AI prostor ignorovat video a odkázat se na své vlastní tréninkové pochopení — scénář, který je pravděpodobně známý každému, kdo pravidelně používá LLM/VLM, protože optimalizace a další záhadné firemní priority často způsobují, že modely na hranici ignorují předané informace, jako jsou PDF nebo obrázky, a spoléhají se na své vlastní pochopení*:
‘[My] jsme zjistili, že automatická generace často produkovala otázky, které mohly být zodpovězeny ignorováním videa a využitím zkratky. ‘Například automaticky generované mating otázky o součástech, které jsou již umístěny pro spojení, nebo zahrnovaly rozptylové možnosti s jasně odlišnými tvary nebo barvami, umožňující snadné [vyloučení]. Abychom se tomu vyhnuli, kurátorovali jsme všechny otázky ručně pomocí pevných šablon.
‘Annotátoři dostali plné montážní video, segmentované snímky pro vizuální podněty, šablony otázek a podrobné pokyny pro vyhnutí se zkratkám založeným na statických podnětech z vizuálního podnětu.’
Dokončený benchmark se skládá z 602 otázek vícečetného výběru napříč 50 různými videi sestavování nábytku.
Data a testy
Modely vyhodnocené pro testovací kolo zahrnovaly výše zmíněné ChatGPT a Gemini varianty, jakož i Video-LLaVA; LLaVA-NeXT-Vid; LLaVA-OneVision; LLaVA-Video; Qwen 2.5/Qwen 3-VL; InternVL3; ArrowRL; PerceptionLM; a Video-Refer.
GenS byl použit k výběru otázek relevantních snímků v dlouhých videích pro základní model Gemini 2.5 Pro, a většina modelů byla testována v jednorázovém kontextu pod žadoucí dekódování (nepodporované v GPT-5, nicméně).
Tři formáty podnětů byly navrženy pro benchmark: mixed-media podnět poskytoval vizuální podnět jako samostatný obrázek vedle montážního videa; collage podnět vložil vizuální podnět přímo do každého snímku videa jako součást mřížkové kompozice; a concat podnět připojil vizuální podněty k začátku videa.
Oba zkrácené a klíčové video varianty byly testovány napříč těmito formáty, aby se změřila, jak silně by struktura podnětu a temporální komprese mohly ovlivnit výkon modelu.
Bázi náhodného výběru zahrnovaly také ‘často se vyskytující náhodný výběr’, kde se zvolila nejčastější možnost (místo skutečně náhodné možnosti).
Lidský faktor
Lidský výkon byl vyhodnocen pomocí účastníků z programů počítačových věd, od bakalářského až po doktorský stupeň. Každý účastník dostal montážní video, vizuální podnět a otázku vícečetného výběru, jakož i instrukce úkolu, předtím, než zvolil odpověď.
Tři odpovědi byly shromážděny na každou otázku a vyřešeny prostřednictvím většinového hlasování, zatímco samostatná crowdsourcová studie byla provedena na náhodném vzorku benchmarku.
Přesnost byla použita jako metrika pro testy:
| Model | Rank | Micro Avg. | TOrd | TLoc | Track | Mate |
|---|---|---|---|---|---|---|
| Lidský výkon | – | 94.18 | 93.54 | 93.20 | 93.77 | 97.70 |
| Báze náhodného výběru | ||||||
| Náhodný výběr | – | 26.41 | 25.00 | 25.00 | 25.49 | 33.33 |
| Často se vyskytující náhodný výběr | – | 26.74 | 27.74 | 30.10 | 26.46 | 36.78 |
| Proprietární modely | ||||||
| GPT-5 | 1 | 37.71 | 40.65 | 53.40 | 25.68 | 49.43 |
| Gemini 2.5 Pro | 2 | 33.72 | 40.65 | 44.66 | 23.35 | 39.08 |
| Gemini 3.1 Pro | 3 | 32.89 | 34.84 | 43.69 | 21.79 | 49.43 |
| Gemini 2.5 Flash | 4 | 31.06 | 31.61 | 41.75 | 23.35 | 40.23 |
| Gemini 2.5 Pro + GenS | 5 | 25.58 | 33.55 | 32.04 | 13.23 | 40.23 |
| Otevřené modely | ||||||
| Video-LLaVA-7B | 26 | 23.75 | 21.29 | 35.92 | 10.89 | 51.72 |
| InternVL3-14B | 5 | 37.71 | 42.58 | 21.36 | 37.74 | 48.28 |
| InternVL3-38B | 12 | 36.05 | 42.58 | 37.86 | 25.68 | 52.87 |
| InternVL3-78B | 1 | 41.03 | 43.87 | 39.81 | 42.02 | 34.48 |
| Qwen2.5-VL-7B | 22 | 30.23 | 27.10 | 18.45 | 33.07 | 41.38 |
| Qwen2.5-VL-32B | 13 | 35.88 | 34.84 | 29.13 | 33.07 | 54.02 |
| Qwen2.5-VL-72B | 2 | 40.37 | 41.29 | 30.10 | 45.14 | 36.78 |
| Qwen3-VL-4B | 11 | 36.54 | 34.19 | 33.01 | 32.68 | 56.32 |
| Qwen3-VL-4B-Think | 9 | 37.21 | 31.61 | 25.24 | 37.74 | 59.77 |
| Qwen3-VL-8B | 15 | 33.72 | 36.13 | 30.10 | 33.85 | 33.33 |
| Qwen3-VL-8B-Think | 17 | 31.73 | 34.19 | 33.01 | 25.29 | 44.83 |
| Qwen3-VL-32B | 6 | 37.71 | 38.71 | 46.60 | 31.91 | 42.53 |
| Qwen3-VL-32B-Think | 3 | 40.03 | 38.71 | 22.33 | 45.53 | 47.13 |
| Qwen3-VL-30B-A3B | 10 | 36.71 | 30.32 | 22.33 | 42.02 | 49.43 |
| Qwen3-VL-235B-A22B | 8 | 37.21 | 37.42 | 25.24 | 39.69 | 43.68 |
| LLaVA-NeXT-Vid-7B | 25 | 25.08 | 33.55 | 24.27 | 16.73 | 35.63 |
| LLaVA-NeXT-Vid-34B | 21 | 30.40 | 30.32 | 24.27 | 32.68 | 31.03 |
| LlaVA-OneVision-7B | 16 | 32.89 | 26.45 | 30.10 | 34.24 | 43.68 |
| LlaVA-OneVision-72B | 4 | 38.37 | 35.48 | 25.24 | 38.91 | 57.47 |
| LLaVA-Video-7B | 19 | 30.73 | 30.97 | 24.27 | 25.68 | 52.87 |
| LLaVA-Video-72B | 7 | 37.54 | 36.77 | 27.18 | 35.80 | 56.32 |
| Perception-LM-1B | 24 | 27.74 | 28.39 | 26.21 | 25.29 | 35.63 |
| Perception-LM-3B | 18 | 31.40 | 28.39 | 32.04 | 29.96 | 40.23 |
| Perception-LM-8B | 14 | 35.38 | 26.45 | 26.21 | 44.75 | 34.48 |
| VideoRefer | 23 | 28.57 | 32.90 | 30.10 | 17.51 | 51.72 |
| ArrowRL-7B | 20 | 30.56 | 30.97 | 24.27 | 29.18 | 41.38 |
Výsledky výkonu na FLAT-PACK BENCH, porovnávající proprietární a otevřené multimodální modely napříč úkoly Temporální pořadí (TOrd), Temporální lokalizace (TLoc), Sledování a Spojení, s lidským výkonem, který zůstává daleko před všemi testovanými systémy, navzdory skromným ziskům mezi většími modely na hranici.
Jako je vidět v počátečních testech (obrázek výše), lidé dosáhli více než 90% ve všech kategoriích otázek, s 80% shodou, což podle článku naznačuje, že propozice jsou dobře formulované a neambivalentní.
GPT-5 a Gemini 2.5/3.1 Pro se potýkaly s datovým souborem, dosáhly pouze skromných zlepšení oproti bázi náhodného výběru a zůstaly daleko pod lidským výkonem. Použití GenS k výběru otázek relevantních snímků nezlepšilo výsledky modelu Gemini 2.5 Pro, což vedlo autory k závěru, že proprietární LVLMs se potýkají s úkolem prostorově-časového pochopení vyžadovaného benchmarkem.
Mezi otevřenými systémy byly nejsilnější výsledky dosaženy u rodin InternVL3 a Qwen, i když výkon v kategorii se značně lišil, s několika modely, které jen mírně překonaly náhodný výběr; a specializované systémy, včetně PerceptionLM a VideoRefer, se také potýkaly s komplexními montážními úkoly benchmarku, s lidskými účastníky, kteří zůstali významně před všemi modely.
Výzkumníci také otestovali dvě řetězové strategie podnětů proti standardnímu nastavení podnětů článku. Zero-shot Chain-of-Thought podněty požadovaly, aby modely vysvětlily své odpovědi krok za krokem, zatímco Self-consistency with Chain-of-Thought generovaly pět kandidátských odpovědí, než vybraly konečnou odpověď prostřednictvím většinového hlasování. Nicméně, ani jeden z nich nezlepšil výsledky na datasetu Flat Pack Bench, s oběma přístupy, které dosáhly skóre pod výchozím nastavením podnětů benchmarku.
Špatný kód
Aby otestovali, zda LVLMs skutečně učí z montážních videí, nebo zda pouze využívají statické vizuální zkratky, výzkumníci vytvořili obrazový benchmark, který vynechal video úplně, ponechávající pouze text otázky a vizuální podněty.
Lidský výkon se zhroutil o více než 50% v těchto podmínkách, ukazující, že úkoly skutečně vyžadují temporální pochopení montážního procesu. Modely se však zhoršily mnohem méně výrazně, s některými úkoly, které zůstaly stabilní nebo dokonce zlepšily bez video vstupu.
To naznačuje, že článek navrhuje, že mnoho LVLMs vůbec nevyužívá temporální informace ve videích, místo toho spoléhají se na obrazové zkratky a předpoklady, aby odvodily pravděpodobné odpovědi*:

Výkon LVLM na obrazovém benchmarku, porovnán s výchozím nastavením video-plus-obrázek, s dalšími výsledky po zamíchání ID součástí, aby se otestovalo, zda modely využívají zkratky založené na pořadí labelů místo temporálního video pochopení.
‘[Obrázek výše] ukazuje výkon LVLM na tomto obrazovém benchmarku, a změnu v jejich výkonu z plného hodnocení, spolu s lidským výkonem.
‘Prudký pokles lidského výkonu (>50%) ukazuje, že otázky skutečně vyžadují videa k odpovědi.
‘My také pozorujeme, že celkový výkon modelu poklesl výrazně (8.80%), ale většinou kvůli úkolu TRACK. Přesnost na ostatních úkolech zůstala stejná nebo se zlepšila, ukazující, že LVLM nevyužívá video efektivně, zatímco lidé využívají video k odpovědi.’
Hlubší analýza článku naznačuje, že hlavní překážkou není jednoduchá temporální sekvence sama o sobě, ale selhání v objektovém zakotvení a prostorově-časovém úsudku: modely často měly potíže s udržením vizuálně podobných součástí nábytku napříč pohybem, změnou kamery a scénou, i když zdánlivě identifikovaly širší montážní proces správně.
Další experimenty zahrnovaly nasazení nástrojového agentic AI na úkol, a toto “vykonalo špatně” podle autorů — i když bylo schopno správně odpovědět na dalších 11,48% otázek, které byly vynechány ostatními přístupy.
Závěr
Uchování trvalých internalizací konceptů a objektů je centrální pro lidskou zkušenost růstu a percepční vývoj, a v individuálních, často nových úkolech, pro které tento vývoj připravil.
Výzkum počítačového vidění již má trvající potíže se zajištěním a opětovným rozpoznáním objektů a lidí, kteří opouštějí a znovu vstupují do rámce. Tyto problémy jsou značně zhoršeny potřebou neustále měnit vidění a postoj — jak je pravděpodobné v instrukčním videu na YouTube o sestavování nábytku flat-pack. Můžeme si představit, do jaké míry by ještě více rušivé změny POV v egocentrickém videu mohly dále zkomplikovat pokusy AI o sestavení nábytku.
* Originální formátování autorů, upravené mnou, pokud to bylo nutné, aby se zachoval dopad pod formátováním citací/
Poprvé zveřejněno v pondělí, 25. května 2026. Upraveno ve středu, 27. května 2026, aby se opravila tato datumová atribuce (!).












