Kąt Andersona

Sztuczna inteligencja jest znacznie gorsza niż ludzie w montowaniu mebli

mm
Dodaj Unite.AI do preferowanych źródeł w Google
AI-generated image (GPT-2): An industrial humanoid robot sits on the floor of a sparsely furnished apartment beside a grotesquely malformed piece of self-assembled furniture, holding a screwdriver while studying the collapsed structure amid IKEA boxes, scattered components, and assembly instructions.

ChatGPT i Google Gemini nadal nie mogą niezawodnie zrozumieć filmów instruktażowych IKEA, a wiele innych prominentnych systemów AI myli części, pomija połączenia i ledwo korzysta z filmu, aby zrozumieć, co się dzieje.

 

Trwały kulturowy mem dotyczący trudności montowania mebli w stylu IKEA sprawia, że temat ten jest atrakcyjnym celem badań nad rozpoznawaniem obrazów — nie tylko dlatego, że długie sekwencje działań, śledzenie obiektów i rozumowanie przestrzenne wymagane w tym procesie będą tendencją do przekraczania uproszczonych kształtów i kontrolowanych środowisk, do których są one przyzwyczajone.

Prace nad AI-zasilanymi rutynami montażu mebli płaskich stały się małą, ale szanowaną gałęzią literatury, z wyjściami takimi jak środowisko montażu mebli IKEA z 2019 roku IKEA Furniture Assembly Environment, jednym z pierwszych zestawów danych i kontekstów badawczych specjalnie ukierunkowanych na montaż mebli:

Kliknij, aby odtworzyć Przykłady praktyki montażu, z projektu Środowisko montażu mebli IKEA.

W 2024 roku współpraca Stanford/J.P. Morgan Instrukcje IKEA w pracy była pierwszym, który znacznie zbadał możliwości AI w wykonaniu tego pozornie munduralnego (choć często frustrującego) procederu, opartego na nowym zestawie danych obrazów z instrukcji, oraz korzystając z filmów instruktażowych:

Metoda i szczegóły zestawu danych z inicjatywy Instrukcje IKEA w pracy. Źródło - https://arxiv.org/abs/2411.11409

Metoda i szczegóły zestawu danych z inicjatywy Instrukcje IKEA w pracy. Źródło

Autorzy pracy z 2024 roku — którzy wykorzystali DGCNN, CNOS, SAM-6D, MegaPose, MiDaS, SAM2 Hiera-L, Cutie-base oraz GPT-4o — doszli do wniosku, że zadanie to stanowi ‘znaczne wyzwania w zakresie rozumienia filmów instruktażowych, w tym wyodrębniania segmentacji części i ich położenia, tworzenia planów montażu oraz wykrywania kluczowych kroków montażu w filmach’.

Wosk na, wosk off

Muszę przyznać, że choć byłoby miło, gdyby AI mogło nas wyeliminować z zadania, które niewielu ludzi lubi, nie jest to naukowy priorytet, ani nie jest wysoko na liście priorytetów sektora badań nad rozpoznawaniem obrazów.

Raczej wartość tego zadania leży w tym, że to, czego AI musi się nauczyć aby stać się biegłym w tym, ugruntuje je w znacznie poważniejszych rutynach, które są równie lub nawet bardziej wymagające, w rolnictwie, przemyśle, sektorze usług i innych dziedzinach.

W tym kontekście projekt LEGO-Puzzles i zestaw danych bada, jak dobrze modele języka i wizji (VLM) radzą sobie z wieloetapowym rozumowaniem przestrzennym w różnych architekturach, ponieważ zadania montażu zależą nie tylko od połączenia odpowiednich obiektów w odpowiednim momencie — proces znanym jako połączenie — ale także od postępowania zgodnie z instrukcjami, które mogą być znacznie bardziej abstrakcyjne niż surowa scena wizualna dostępna dla modelu w danym momencie:

Wyzwania z projektu LEGO-Puzzles. Źródło - https://tangkexian.github.io/LEGO-Puzzles/

Wyzwania z projektu LEGO-Puzzles. Źródło

Najnowszy projekt, który podejmuje wyzwanie montażu mebli, wykorzystuje bardziej aktualny i zdolny zestaw modeli AI, w tym Google Gemini 2.5/3.1 oraz OpenAI GPT-5 — ale nadal nie udaje się osiągnąć zwycięstwa AI w tym zadaniu, z tylko umiarkowanymi poprawami w stosunku do szansy, a wyniki znacznie poniżej poziomu ludzkiego.

Autorzy stwierdzają:

‘Nasze eksperymenty pokazują, że najnowsze modele LVLM znacznie mają trudności z drobnymi rozwiązaniami przestrzennymi i czasowymi, podkreślając ich ograniczenia w efektywnym wykorzystaniu informacji czasowych z filmów, ograniczonej zdolności śledzenia i zrozumienia interakcji przestrzennych, takich jak kontakt fizyczny’.

Problemy, które są rozwiązywane w tym nurcie badań, są tylko pozornie związane z robotyką praktyczną na tym etapie, choć dodatkowe wyzwania z pewnością czekają, gdy teoretyczne problemy ewoluują w kierunku ucieleśnionego AI.

Nowy artykuł pt. Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly pochodzi od ośmiu autorów z Cornell University, Cornell Tech, MBZUAI i UC Berkeley. Artykuł jest uzupełniony o stronę projektu.

Metoda

Autorzy nowej pracy podkreślają trudności, jakie AI ma z zrozumieniem procesu montażu przez obserwację, na przykład za pomocą filmu instruktażowego w stylu YouTube, do którego wiele osób sięga, aby skorzystać z wiedzy społeczności:

Niektóre z pytań, które zadaje zadanie montażu mebli, wraz z czterema niezbędnymi umiejętnościami niezbędnymi do pokonania wyzwań. Źródło - https://arxiv.org/pdf/2605.21625

Niektóre z pytań, które zadaje zadanie montażu mebli, wraz z czterema niezbędnymi umiejętnościami niezbędnymi do pokonania wyzwań. Źródło

Stworzyli zestaw danych, który jest filtrowany z wcześniej wymienionego zestawu danych IKEA-Manuals-at-Work (IMaW) zestawu danych, który zawiera filmy z ludźmi montującymi meble IKEA. Zrewidowany benchmark obcina oryginalne filmy, aby usunąć karty instruktażowe, z oddzielnymi wariantami klatki kluczowej i pełnego filmu, oraz dodaje ręcznie adnotowane wizualne wskazówki z wydzielonymi częściami mebli, w celu wsparcia zadań rozumowania wielokrotnego wyboru.

Benchmark kręci się wokół czterech typów pytań: MATE, określający, czy dwie części są połączone w końcowym montażu; TRACK, wymagający od modeli odzyskania prawidłowej korespondencji między pomieszanymi identyfikatorami części w ramach wydzielonych klatek za pomocą filmu; TOrd, oceniający, czy modele mogą wywnioskować prawidłowy porządek zdarzeń połączenia; oraz TLoc, testujący, czy modele mogą określić zdarzenia występujące bezpośrednio przed lub po stanie pokazanym w wizualnej wskazówce, wymagającej lokalizacji czasowej i rozumowania o pobliskich zdarzeniach.

Przykłady z nowego benchmarku, ilustrujące cztery podstawowe typy zadań zaprojektowane do testowania rozumowania przestrzennego i czasowego w filmach montażu mebli: lokalizacja czasowa; porządek czasowy; śledzenie; oraz łączenie. Każde zadanie łączy filmy montażu z jedną lub więcej wizualnymi wskazówkami z wydzielonymi częściami i pytaniem wielokrotnego wyboru.

Przykłady z nowego benchmarku, ilustrujące cztery podstawowe typy zadań zaprojektowane do testowania rozumowania przestrzennego i czasowego w filmach montażu mebli: lokalizacja czasowa; porządek czasowy; śledzenie; oraz łączenie.

Szablony przedstawione na powyższym obrazie zostały pochodne z tych czterech modeli pytań.

Autorzy zauważają również, że dodali drobne adnotacje montażu części do każdego z oryginalnych filmów IMaW, określając, które części łączą się z innymi częściami — szczegóły brakujące w oryginalnym zbiorze.

Unikanie

Pytania, jak zauważa praca, musiały być ręcznie opracowane, ponieważ automatycznie generowane pytania często dają AI możliwość zignorowania filmu i odwołania się do własnego przeszkolonego zrozumienia — scenariusz, który każdy regularny użytkownik LLM/VLM jest prawdopodobnie rozpoznać, ponieważ optymalizacja i inne tajemnicze priorytety korporacyjne często powodują, że modele graniczne ignorują przesłane informacje, takie jak pliki PDF lub obrazy, i polegają na własnym zrozumieniu zamiast tego*:

‘[My] stwierdziliśmy, że auto-generowanie często wytwarzało pytania, które można było odpowiedzieć, ignorując film i wykorzystując skróty. Na przykład, auto-generowane połączenie pytań o części już ustawione do połączenia, lub zawierały opcje rozpraszające z wyraźnie odrębnymi kształtami lub kolorami, umożliwiając łatwe [wyeliminowanie]. Aby rozwiązać ten problem, opracowaliśmy wszystkie pytania ręcznie przy użyciu szablonów.

‘Adnotatorzy otrzymali pełny film montażu, ramy z wydzielonymi częściami mebli, szablony pytań i szczegółowe wytyczne dotyczące unikania skrótów opartych na wskazówkach statycznych z wizualnej wskazówki.’

Zakończony benchmark składa się z 602 pytań wielokrotnego wyboru w 50 różnych filmach montażu mebli.

Dane i testy

Modele oceniane w teście były wymienione powyżej ChatGPT i Gemini, a także Video-LLaVA; LLaVA-NeXT-Vid; LLaVA-OneVision; LLaVA-Video; Qwen 2.5/Qwen 3-VL; InternVL3; ArrowRL; PerceptionLM; oraz Video-Refer.

GenS został użyty do wyboru klatek istotnych dla pytań w długich filmach dla podstawowego modelu Gemini 2.5 Pro, a większość modeli została przetestowana w jednym strzale pod chciwe dekodowanie (nieobsługiwane w GPT-5).

Trzy formaty wskazówek zostały opracowane dla benchmarku: mixed-media wskazówka dostarczała wizualną wskazówkę jako oddzielny obraz obok filmu montażu; collage wskazówka osadzała wizualną wskazówkę bezpośrednio w każdej klatce filmu jako część siatki; oraz concat wskazówka wstępnie dołączała wizualne wskazówki do początku filmu.

Obydwa warianty filmu, obcięte i kluczowe, zostały przetestowane w tych formatach, w celu pomiaru, jak silnie struktura wskazówki i kompresja czasowa mogą wpłynąć na wyniki modelu.

Bazowe szanse uwzględnione w testach obejmowały również ‘częstotliwość szansy’, gdzie najczęstsza opcja (zamiast prawdziwie losowej opcji) jest wybrana.

Czynnik ludzki

Wyniki ludzkie zostały ocenione przy użyciu uczestników z programów informatycznych, od poziomu licencjata do doktoranckiego. Każdy uczestnik został pokazany film montażu, a także wizualna wskazówka i pytanie wielokrotnego wyboru, a także instrukcja zadania, przed wyborem odpowiedzi.

Trzy odpowiedzi zostały zebrane na każde pytanie i rozstrzygnięte przez głosowanie większości, a oddzielne badanie crowdsourcingowe zostało również przeprowadzone na losowo wybranej podzbiorze benchmarku.

Dokładność została użyta jako miara w teście:

Model Rank Micro Avg. TOrd TLoc Track Mate
Wyniki ludzkie 94.18 93.54 93.20 93.77 97.70
Bazy szans
Losowa szansa 26.41 25.00 25.00 25.49 33.33
Częstotliwość szansy 26.74 27.74 30.10 26.46 36.78
Modele własne
GPT-5 1 37.71 40.65 53.40 25.68 49.43
Gemini 2.5 Pro 2 33.72 40.65 44.66 23.35 39.08
Gemini 3.1 Pro 3 32.89 34.84 43.69 21.79 49.43
Gemini 2.5 Flash 4 31.06 31.61 41.75 23.35 40.23
Gemini 2.5 Pro + GenS 5 25.58 33.55 32.04 13.23 40.23
Modele otwarte
Video-LLaVA-7B 26 23.75 21.29 35.92 10.89 51.72
InternVL3-14B 5 37.71 42.58 21.36 37.74 48.28
InternVL3-38B 12 36.05 42.58 37.86 25.68 52.87
InternVL3-78B 1 41.03 43.87 39.81 42.02 34.48
Qwen2.5-VL-7B 22 30.23 27.10 18.45 33.07 41.38
Qwen2.5-VL-32B 13 35.88 34.84 29.13 33.07 54.02
Qwen2.5-VL-72B 2 40.37 41.29 30.10 45.14 36.78
Qwen3-VL-4B 11 36.54 34.19 33.01 32.68 56.32
Qwen3-VL-4B-Think 9 37.21 31.61 25.24 37.74 59.77
Qwen3-VL-8B 15 33.72 36.13 30.10 33.85 33.33
Qwen3-VL-8B-Think 17 31.73 34.19 33.01 25.29 44.83
Qwen3-VL-32B 6 37.71 38.71 46.60 31.91 42.53
Qwen3-VL-32B-Think 3 40.03 38.71 22.33 45.53 47.13
Qwen3-VL-30B-A3B 10 36.71 30.32 22.33 42.02 49.43
Qwen3-VL-235B-A22B 8 37.21 37.42 25.24 39.69 43.68
LLaVA-NeXT-Vid-7B 25 25.08 33.55 24.27 16.73 35.63
LLaVA-NeXT-Vid-34B 21 30.40 30.32 24.27 32.68 31.03
LlaVA-OneVision-7B 16 32.89 26.45 30.10 34.24 43.68
LlaVA-OneVision-72B 4 38.37 35.48 25.24 38.91 57.47
LLaVA-Video-7B 19 30.73 30.97 24.27 25.68 52.87
LLaVA-Video-72B 7 37.54 36.77 27.18 35.80 56.32
Perception-LM-1B 24 27.74 28.39 26.21 25.29 35.63
Perception-LM-3B 18 31.40 28.39 32.04 29.96 40.23
Perception-LM-8B 14 35.38 26.45 26.21 44.75 34.48
VideoRefer 23 28.57 32.90 30.10 17.51 51.72
ArrowRL-7B 20 30.56 30.97 24.27 29.18 41.38

Wyniki na FLAT-PACK BENCH, porównujące modele wielomodalne z Temporal Ordering (TOrd), Temporal Localization (TLoc), Tracking i Mating, z wynikami ludzkimi pozostającymi znacznie przed wszystkimi testowanymi systemami, pomimo umiarkowanych zysków wśród większych modeli granicznych.

Widoczne w początkowych testach (obraz powyżej), ludzie uzyskali >90% we wszystkich kategoriach pytań, z 80% jednomyślności, co, jak twierdzi praca, sugeruje, że propozycje są dobrze sformułowane i nieambivalentne.

GPT-5 i Gemini 2.5/3.1 Pro miały trudności z zestawem danych, osiągając tylko umiarkowane poprawy w stosunku do szansy, a ich wyniki pozostały znacznie poniżej poziomu ludzkiego. Użycie GenS do wyboru klatek istotnych dla pytań nie poprawiło wyników Gemini 2.5 Pro, co skłoniło autorów do wniosku, że modele LVLM własne mają trudności ze zrozumieniem przestrzennym i czasowym wymaganym przez benchmark.

Wśród systemów otwartych najmocniejsze wyniki uzyskały rodziny InternVL3 i Qwen, chociaż wyniki w tej kategorii różniły się znacznie, a kilka modeli ledwo przewyższało szansę; a specjalistyczne systemy, w tym PerceptionLM i VideoRefer, również miały trudności z zadaniami montażu w benchmarku, przy czym uczestnicy ludzcy pozostawali znacznie przed wszystkimi kategoriach modeli.

Badacze również przetestowali dwie strategie wskazówek chain-of-thought wobec standardowej konfiguracji wskazówek. Zero-shot Chain-of-Thought wskazówka prosiła modele o wyjaśnienie swoich odpowiedzi krok po kroku, podczas gdy Self-consistency with Chain-of-Thought generowała pięć kandydujących odpowiedzi, zanim wybrała ostateczną odpowiedź za pomocą głosowania większości. Jednak żadna z nich nie poprawiła wyników na FLAT-PACK BENCH, a obie podejścia uzyskały wyniki poniżej konfiguracji wskazówek domyślnych.

Szczęśliwy traf

Aby przetestować, czy LVLM naprawdę uczą się z filmów montażu, czy po prostu wykorzystują statyczne wskazówki wizualne, badacze stworzyli wersję obrazkową benchmarku, która pominęła film całkowicie, zachowując tylko tekst pytań i wizualne wskazówki.

Wyniki ludzkie spadły o ponad 50% w tych warunkach, co pokazało, że zadania wymagają naprawdę zrozumienia czasowego procesu montażu. Modele, jednak, pogorszyły się znacznie mniej, a niektóre zadania pozostały stabilne lub nawet poprawiły się bez wejścia wideo.

To wskazuje, jak sugeruje praca, że wiele LVLM nie używało w sposób znaczący informacji czasowych z filmów w ogóle, zamiast tego polegając na skrótach opartych na obrazach i założeniach zdroworozsądkowych, aby wywnioskować prawdopodobne odpowiedzi*:

Wyniki LVLM na wersji obrazkowej FLAT-PACK BENCH, porównane z konfiguracją wideo plus obraz, z dodatkowymi wynikami po losowym przetasowaniu identyfikatorów części, aby przetestować, czy modele wykorzystują skróty oparte na kolejności etykiet zamiast zrozumienia wideo.

Wyniki LVLM na wersji obrazkowej FLAT-PACK BENCH, porównane z konfiguracją wideo plus obraz, z dodatkowymi wynikami po losowym przetasowaniu identyfikatorów części, aby przetestować, czy modele wykorzystują skróty oparte na kolejności etykiet zamiast zrozumienia wideo.

‘[Obraz powyżej] pokazuje wyniki LVLM na tej wersji obrazkowej, oraz zmianę ich wyników z pełnej oceny, wraz z wynikami ludzkimi.

‘Ostry spadek wyników ludzkich (>50%) pokazuje, że pytania wymagają filmów, aby odpowiedzieć.

‘Stwierdzamy również, że ogólny wynik modelu spada znacznie (8,80%), ale głównie z powodu zadania TRACK. Dokładność w innych zadaniach pozostaje taka sama lub poprawia się, co wskazuje, że LVLM nie używa wideo efektywnie, podczas gdy ludzie używają wideo, aby odpowiedzieć.’

Głębsza analiza wskazuje, że główną przeszkodą nie jest prosta sekwencja czasowa, ale awarie w zakotwiczeniu obiektów i rozumowaniu przestrzennym: modele często miały trudności ze śledzeniem podobnych wizualnie części mebli przez ruch, zmiany kamery i zmiany sceny, nawet gdy wydawało się, że identyfikują proces montażu w sposób ogólny.

Dalsze eksperymenty obejmowały użycie agenty AI z narzędziami do zadania, a ten ‘wystąpił słabo’ według autorów — chociaż był w stanie poprawnie odpowiedzieć na dodatkowe 11,48% pytań, które zostały pominięte przez inne podejścia.

Wnioski

Utrzymywanie trwałych internalizacji pojęć i obiektów jest kluczowe zarówno dla ludzkiego doświadczenia wzrostu i rozwoju percepcyjnego, jak i dla indywidualnych, często nowych zadań, dla których ten rozwój przygotował nas.

Badania nad rozpoznawaniem obrazów mają już trwającą walkę z ponownym zdobyciem i ponownym rozpoznaniem obiektów i ludzi, którzy opuszczają i ponownie wkraczają w ramy. Problemy te są znacznie zwiększone przez potrzebę ciągłej zmiany widoku i postawy — co może się zdarzyć w filmie instruktażowym w stylu YouTube o montażu mebli płaskich. Można sobie wyobrazić, w jakim stopniu nawet bardziej szokujące zmiany POV egocentrycznego filmu mogą dalej dezorientować próby AI w montażu mebli.

 

* Oryginalne formatowanie autorów, zmienione przeze mnie w razie potrzeby, aby zachować wpływ pod formatowaniem cytatu/

Pierwotnie opublikowane w poniedziałek, 25 maja 2026 r. Zmienione w środę, 27 maja 2026 r., aby poprawić ten atrybut daty (!).

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai