Andersonの視点
AIは人間よりも家具の組み立てがはるかに悪い

ChatGPTとGoogle Geminiはまだ信頼性の高いIKEA組み立てビデオを理解できないため、他の多くの著名なAIシステムは部品を混同し、接続を欠落し、ビデオ自体を使用して何が起こっているのかを理解するためにほとんど使用しません。
耐え続ける文化的メムは、IKEAスタイルの平面パック家具の組み立ての難しさを扱うコンピュータビジョン研究の魅力的なターゲットにしている — それが、長いアクションシーケンス、オブジェクトトラッキング、空間推論を含むため、ロボット操作システムを、慣れ親しんだ簡略化された形状や制御された環境から遠く離れたところまで押し進めるからである。
したがって、平面パック家具のAIパワードロボット組み立てルーチンの作業は、コンピュータビジョン研究の小さな分野ではあるが、USCの2019年のIKEA家具組み立て環境のような、家具組み立てに特化した最初のベンチマークデータセットと研究コンテキストの1つである、文学の小さな分野となっている。
クリックして再生 ロボット組み立ての練習の例、2019年のIKEA家具組み立て環境イニシアチブのプロジェクトサイトから。 ソース
2024年、スタンフォード/JPモルガン共同研究IKEAマニュアルを仕事には、指示書からの画像の新しいデータセットと、指示ビデオを使用して、AIがこのように見えれば平凡で、しかし、しばしば苛立たしい手順を実行する能力を最初に大規模に調査した。

2024年のIKEAマニュアルを仕事にイニシアチブのデータセット方法と詳細。 ソース
この論文の著者 — DGCNN、CNOS、SAM-6D、MegaPose、MiDaS、SAM2 Hiera-L、Cutie-base、およびGPT-4oを利用した — は、このタスクは、指示書ビデオのグラウンド化、パーツセグメンテーションとポーズの抽出、ハイレベルな組み立て計画の構築、ビデオからの重要な組み立てステップの検出を含む、‘重大な課題’をもたらすと結論付けた。
ワックスオン、ワックスオフ
明らかなように、AIが私たちをこの多くの人が喜んで取り組むタスクから自動化することは素晴らしいことですが、それは科学的な目標ではなく、コンピュータビジョン研究部門の優先順位のリストの上位にはない。
その価値は、AIシステムがこのタスクを実行するために必要なものを学ぶことで、農業、産業、サービス部門、その他の多くの分野でさらに困難なルーチンに直面することになるという事実にある。
この観点から、LEGO-Puzzlesプロジェクトとデータセットは、ビジョン言語モデル(VLMs)が、さまざまなアーキテクチャを横断するマルチステップ空間推論をどのように処理するかを調査し、組み立てタスクは、正しいオブジェクトを正しい時点でペアにすること — メイティング と呼ばれるプロセス — だけでなく、抽象的な指示に従うことも必要であることを示している。

LEGO-Puzzlesプロジェクトからの課題的な質問。 ソース
家具組み立ての課題に取り組む最新のプロジェクトは、Google Gemini 2.5/3.1やOpenAIのGPT-5を含む、より最新でより優れたAIモデルを利用しているが、依然としてAIはこのタスクで勝利を収めることができず、ベースラインチャンスよりもわずかな改善のみを達成し、‘人間のレベルをはるかに下回る’パフォーマンスを示している。
著者は次のように述べている。
‘私たちの実験は、最先端のLVLMsが、微細な空間時推論に重大な困難に直面していることを明らかにし、時系列情報を効果的に活用する能力、追跡能力、物理的接触などの空間的相互作用の理解の限界を強調している。
方法
新しい研究の著者は、AIアシスタントが、たとえば、コミュニティの知識を活用するために多くの人が頼るようなYouTubeスタイルの指示ビデオを介して、組み立てプロセスを理解することの難しさを強調している。

フラットパック組み立てタスクが引き起こすいくつかの質問と、課題を克服するために必要な4つの基本スキル。 ソース
彼らは、先ほど述べたIKEA-Manuals-at-Work (IMaW) データセットからフィルタリングされたデータセットをキュレーションし、元のビデオからテキストのみの指示カードを削除し、個別のキーフレームとフルビデオのバリアントを提供し、さらに、複数選択の推論タスクをサポートするために、セグメンテーションされた家具パーツで手動で注釈付きの視覚的なプロンプトを追加した。
ベンチマークは、メイト、トラック、トールド、トロックの4つの質問タイプを中心に展開し、メイトでは最終的な組み立てで2つのパーツが接続されているかどうかを判断し、トラックではビデオ自体を使用して、シャッフルされたパーツIDの間の正しい対応関係を回復する必要があり、トールドでは接続イベントの正しい順序を推論し、トロックでは視覚的なプロンプトで示される状態の直前にまたは直後に発生するイベントを特定する必要がある。

家具組み立てビデオの空間時推論をテストするために設計された4つのコアタスクの例: 時間的ローカリゼーション; 時間的順序付け; トラッキング; およびメイティング。 各タスクは、組み立てビデオのフッテージと1つまたは複数のセグメンテーションラベル付きの視覚的なプロンプトと複数選択の推論質問を組み合わせる。
上記のスキーマ画像のテンプレートは、これら4つの質問モデルから導き出された。
著者はまた、元のIMaWビデオごとに、どのパーツがどのパーツに接続するかを指定する、微細なパーツ組み立て注釈を追加した。
回避
質問は、論文によると、手動でキュレーションする必要があった。自動生成された質問は、AIがビデオを無視し、自身のトレーニング済みの理解を参照する機会を与えることが多いためである。
‘[私たちは]自動生成が、ビデオを無視し、ショートカットを利用することで回答できる質問を頻繁に生成することを発見した。
‘たとえば、すでに接続のために配置されたパーツに関する自動生成された メイティング 質問、または明らかに異なる形状または色を持つ妨害オプションを含むもの、など。 これに対処するために、固定されたテンプレートを使用してすべての質問を手動でキュレーションしました。
‘アノテーターには、フルアセンブリビデオ、視覚的なプロンプトのセグメンテーションラベル付きフレーム、質問テンプレート、および静的な視覚的なプロンプトからの静的なヒントを避けるための詳細なガイドラインが提供されました。 ‘
完成したベンチマークには、50種類の家具組み立てビデオにわたる602の複数選択質問が含まれている。
データとテスト
テストのためのモデルは、先ほど述べたChatGPTとGeminiのバリアント、およびVideo-LLaVA、LLaVA-NeXT-Vid、LLaVA-OneVision、LLaVA-Video、Qwen 2.5、Qwen 3-VL、InternVL3、ArrowRL、PerceptionLM、およびVideo-Referであった。
GenSは、基礎となるGemini 2.5 Proモデルで長いビデオの質問に関連するフレームを選択するために使用され、ほとんどのモデルはワンショットコンテキストで貪欲なデコーディングでテストされた(GPT-5ではサポートされていなかった)。
ベンチマークのために3つのプロンプト形式が考案された。 混合メディア プロンプトは、視覚的なプロンプトを画像として組み立てビデオの隣に提供した。 コラージュ プロンプトは、グリッドレイアウトの一部として、視覚的なプロンプトを各ビデオフレームに埋め込んだ。 連結 プロンプトは、ビデオの開始に視覚的なプロンプトを連結した。
両方のトリミング済みおよびキーフレームのビデオバリアントは、これらの形式でテストされ、プロンプト構造と時間圧縮がモデルパフォーマンスにどのように影響するかを測定するために使用された。
テストのためのチャンスベースラインには、「頻度チャンス」も含まれており、最も一般的なオプション(真にランダムなオプションではなく)が選択された。
人間の要因
人間のパフォーマンスは、コンピュータサイエンスプログラムから集められた参加者を使用して評価され、参加者はアンダーグラジュエートから博士課程までの範囲であった。各参加者は、組み立てビデオ、関連する視覚的なプロンプトと複数選択質問、およびタスクの指示が表示された後、回答を選択した。
質問ごとに3つの回答が収集され、多数決によって解決され、ランダムにサンプリングされたベンチマークのサブセットに対して別のクラウドソーシング研究も実施された。
精度は、試行のためのメトリックとして使用された:
| モデル | ランク | マイクロ平均 | トールド | トロック | トラック | メイト |
|---|---|---|---|---|---|---|
| 人間のパフォーマンス | – | 94.18 | 93.54 | 93.20 | 93.77 | 97.70 |
| チャンスベースライン | ||||||
| ランダムチャンス | – | 26.41 | 25.00 | 25.00 | 25.49 | 33.33 |
| 頻度チャンス | – | 26.74 | 27.74 | 30.10 | 26.46 | 36.78 |
| プロプライエタリモデル | ||||||
| GPT-5 | 1 | 37.71 | 40.65 | 53.40 | 25.68 | 49.43 |
| Gemini 2.5 Pro | 2 | 33.72 | 40.65 | 44.66 | 23.35 | 39.08 |
| Gemini 3.1 Pro | 3 | 32.89 | 34.84 | 43.69 | 21.79 | 49.43 |
| Gemini 2.5 Flash | 4 | 31.06 | 31.61 | 41.75 | 23.35 | 40.23 |
| Gemini 2.5 Pro + GenS | 5 | 25.58 | 33.55 | 32.04 | 13.23 | 40.23 |
| オープンモデル | ||||||
| Video-LLaVA-7B | 26 | 23.75 | 21.29 | 35.92 | 10.89 | 51.72 |
| InternVL3-14B | 5 | 37.71 | 42.58 | 21.36 | 37.74 | 48.28 |
| InternVL3-38B | 12 | 36.05 | 42.58 | 37.86 | 25.68 | 52.87 |
| InternVL3-78B | 1 | 41.03 | 43.87 | 39.81 | 42.02 | 34.48 |
| Qwen2.5-VL-7B | 22 | 30.23 | 27.10 | 18.45 | 33.07 | 41.38 |
| Qwen2.5-VL-32B | 13 | 35.88 | 34.84 | 29.13 | 33.07 | 54.02 |
| Qwen2.5-VL-72B | 2 | 40.37 | 41.29 | 30.10 | 45.14 | 36.78 |
| Qwen3-VL-4B | 11 | 36.54 | 34.19 | 33.01 | 32.68 | 56.32 |
| Qwen3-VL-4B-Think | 9 | 37.21 | 31.61 | 25.24 | 37.74 | 59.77 |
| Qwen3-VL-8B | 15 | 33.72 | 36.13 | 30.10 | 33.85 | 33.33 |
| Qwen3-VL-8B-Think | 17 | 31.73 | 34.19 | 33.01 | 25.29 | 44.83 |
| Qwen3-VL-32B | 6 | 37.71 | 38.71 | 46.60 | 31.91 | 42.53 |
| Qwen3-VL-32B-Think | 3 | 40.03 | 38.71 | 22.33 | 45.53 | 47.13 |
| Qwen3-VL-30B-A3B | 10 | 36.71 | 30.32 | 22.33 | 42.02 | 49.43 |
| Qwen3-VL-235B-A22B | 8 | 37.21 | 37.42 | 25.24 | 39.69 | 43.68 |
| LLaVA-NeXT-Vid-7B | 25 | 25.08 | 33.55 | 24.27 | 16.73 | 35.63 |
| LLaVA-NeXT-Vid-34B | 21 | 30.40 | 30.32 | 24.27 | 32.68 | 31.03 |
| LlaVA-OneVision-7B | 16 | 32.89 | 26.45 | 30.10 | 34.24 | 43.68 |
| LlaVA-OneVision-72B | 4 | 38.37 | 35.48 | 25.24 | 38.91 | 57.47 |
| LLaVA-Video-7B | 19 | 30.73 | 30.97 | 24.27 | 25.68 | 52.87 |
| LLaVA-Video-72B | 7 | 37.54 | 36.77 | 27.18 | 35.80 | 56.32 |
| Perception-LM-1B | 24 | 27.74 | 28.39 | 26.21 | 25.29 | 35.63 |
| Perception-LM-3B | 18 | 31.40 | 28.39 | 32.04 | 29.96 | 40.23 |
| Perception-LM-8B | 14 | 35.38 | 26.45 | 26.21 | 44.75 | 34.48 |
| VideoRefer | 23 | 28.57 | 32.90 | 30.10 | 17.51 | 51.72 |
| ArrowRL-7B | 20 | 30.56 | 30.97 | 24.27 | 29.18 | 41.38 |
初期テスト(上の画像)では、人間はすべてのカテゴリで90%以上のスコアを獲得し、80%の回答が一致していたため、質問は明確に定義され、曖昧性がないことが示唆された。
GPT-5とGemini 2.5/3.1 Proは、データセットで苦戦し、チャンスベースライン以上の僅かな改善しか示さず、人間のパフォーマンスをはるかに下回った。GenSを使用して質問に関連するフレームを選択することは、Gemini 2.5 Proの結果を改善しなかったため、著者は、プロプライエタリLVLMsがベンチマークで必要な空間時推論のタスクに苦戦していることを結論付けた。
オープンモデルの場合、InternVL3とQwenファミリーが最も強力な結果を示したが、パフォーマンスはカテゴリ全体で大きく変動し、複数のモデルがチャンスレベルをわずかに上回る程度であった。 PerceptionLMやVideoReferを含む専門システムも、ベンチマークの複雑な組み立てタスクで苦戦し、人間の参加者がすべてのモデルカテゴリで大幅に上回った。
研究者はまた、論文の標準的なプロンプト設定に対して、チェーンオブソートプロンプト戦略の2つのバリエーションをテストした。 ゼロショットチェーンオブソート プロンプトでは、モデルにステップバイステップで回答を説明するよう求め、チェーンオブソートを使用した自己一致では、最終的な回答を多数決で選択するために5つの候補回答を生成した。 ただし、どちらのアプローチも、Flat Pack Benchデータセットの結果を改善しなかった。
チートコード
LVLMsが実際に組み立てビデオから学習しているか、または静的な視覚的なヒントや常識的な仮定を利用して回答を推測しているかをテストするために、研究者は、ビデオを完全に省略し、質問テキストと視覚的なプロンプトのみを残した、ベンチマークの画像のみのバージョンを作成した。
人間のパフォーマンスは、ビデオを使用しない場合に50%以上低下したため、タスクは実際にビデオの時間的理解を必要とすることを示した。モデルは、ビデオ入力がなければ、パフォーマンスが大幅に低下するのではなく、タスクの一部が安定したままであるか、またはビデオ入力なしで実際に改善されることが示された。
これは、論文によると、多くのLVLMsがビデオからの時間情報を全く使用していないことを示唆しており、代わりに画像ベースのショートカットと常識的な仮定に頼っていることを示唆している。

LVLMの画像のみのバージョンのFlat-Pack Benchでのパフォーマンス、標準のビデオと画像のセットアップと比較し、パーツIDをシャッフルして、モデルが時間的ビデオ理解ではなくラベル順序のショートカットを利用しているかどうかをテストする追加の結果。
‘上の画像は、LVLMの画像のみのバージョンのパフォーマンスと、フル評価からのパフォーマンスの変化、および人間のパフォーマンスを示しています。 ‘
‘人間のパフォーマンスの50%以上の低下は、質問がビデオを必要とすることを示しています。 ‘
‘また、モデルの全体的なパフォーマンスが大きく低下していること(8.80%)、ただし主にTRACKサブタスクによるものであることを観察します。 他のタスクの精度は同じままであるか、または向上しています。これは、LVLMがビデオを効果的に使用していないことを示唆しており、人間はビデオを使用して質問に回答しています。 ‘
論文のより深い分析は、主な障害が単純な時間的シーケンシングだけでなく、オブジェクトグラウンド化と空間時推論の失敗であることを示唆している。モデルは、視覚的に類似した家具パーツを、運動、カメラの変化、シーンの変更を超えて追跡するのに苦労し、より広い組み立てプロセスを正しく特定したように見えても、苦労した。
さらに、ツールを備えたエージェントAIをタスクに取り組ませたが、‘悪く機能したと著者は述べている。ただし、他のアプローチで見逃された質問の追加の11.48%を正しく回答することができた。
結論
概念やオブジェクトの恒久的な内部化の保持は、人間の成長と認知発達の両方にとって重要であり、発達が私たちを準備した、多くの場合新しいタスクにも重要である。
コンピュータビジョン研究はすでに、オブジェクトや人物がフレームから出入りするのを再取得し、再認識するという継続的な課題を持っている。 これらの問題は、視点や視線が頻繁に変わることが予想される、YouTubeの指示ビデオのような、家具の組み立ての場合に大幅に増大する。
エゴセントリックビデオのさらに衝撃的な視点の変化が、AIの家具組み立ての試みをどれだけ混乱させるかを想像することができる。
* 著者の元の書式、引用書式の影響を保持するために必要な変更を加えた。
2026年5月25日に初めて公開され、2026年5月27日にこの日付の帰属を修正するために修正された。












