Anderson의 관점

AI는 인간보다 가구 조립에 현저히 뒤처짐

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image (GPT-2): An industrial humanoid robot sits on the floor of a sparsely furnished apartment beside a grotesquely malformed piece of self-assembled furniture, holding a screwdriver while studying the collapsed structure amid IKEA boxes, scattered components, and assembly instructions.

ChatGPT와 Google Gemini는 여전히 신뢰할 수 있게 IKEA 조립 비디오를 이해할 수 없으며, 다른 많은 유명한 AI 시스템은 부품을 혼동하고 연결을 놓치고 비디오 자체를 사용하여 무슨 일이 발생하는지 알아내는 데 거의 사용하지 않는다.

 

IKEA 스타일의 평면 가구 조립의 어려움을 둘러싼 지속적인 문화적 밈은 컴퓨터 비전 연구를 위한 매력적인 대상으로 만들며, 오랜 동작 시퀀스, 객체 추적 및 공간推論이 포함된 가구 조립과 같은 작업은 로봇 조작 시스템을 단순화된 모양과 제어된 환경을 넘어선다.

따라서 AI 기반 로봇 조립 루틴을 위한 평면 가구 조립에 대한 연구는 작은 nhưng 존경받는 분야가 되었으며, USC의 2019년 IKEA Furniture Assembly Environment는 가구 조립을 위한 첫 번째 벤치마크 데이터셋과 연구 컨텍스트 중 하나이다.

재생을 클릭하세요. 프로젝트 사이트의 2019년 IKEA Furniture Assembly Environment 이니셔티브에서 로봇 조립 연습의 예입니다. 소스

2024년 스탠퍼드/JP 모건 협력 IKEA 수동은 이arently 평범하지만 souvent 어려운 절차를 수행하는 AI의 능력을 처음으로 크게 조사했으며, 수동 이미지의 새로운 데이터셋과 수동 비디오를 사용했다.

2024년 IKEA 수동 작업 이니셔티브의 데이터셋 방법 및 세부 정보. 소스 - https://arxiv.org/abs/2411.11409

2024년 IKEA 수동 작업 이니셔티브의 데이터셋 방법 및 세부 정보. 소스

2024년 논문의 저자들은 DGCNN, CNOS, SAM-6D, MegaPose, MiDaS, SAM2 Hiera-L, Cutie-base, 및 GPT-4o를 사용하여 작업을 수행했으며, 이 작업은 “수동 비디오를 기반으로 하는 조립을 위한 지시를 이해하는 데 상당한 도전을 제기한다”고 결론지었다.

왁스 온, 왁스 오프

가구 조립과 같은 작업을 자동화하는 AI를 개발하는 것이 좋지만, 이는 컴퓨터 비전 연구 분야에서 과학적인 지표나 높은 우선순위가 아님을 명심해야 한다.

이 작업의 가치는 AI 시스템이 이 작업을 수행하기 위해 알아야 할 내용이 더 심오한 작업에 대한 준비를 도와줄 수 있다는 점에 있다. 즉, 농업, 산업, 서비스 부문 및 기타 분야에서 더 심오한 작업을 수행할 수 있다.

이와 관련하여, LEGO-Puzzles 프로젝트와 데이터셋은 다양한 아키텍처에서 다단계 공간推論을 수행하는 비전 언어 모델(VLM)의 능력을 조사한다. 조립 작업은 단순히 객체를 올바른 순서로 연결하는 것뿐만 아니라, 모델이 특정 단계에서 사용할 수 있는 원시 시각적 장면보다 더 추상적인 지시를 따라야 한다.

LEGO-Puzzles 프로젝트의 도전적인 질문. 소스 - https://tangkexian.github.io/LEGO-Puzzles/

LEGO-Puzzles 프로젝트의 도전적인 질문. 소스

가구 조립의 도전을 해결하기 위한 최신 프로젝트는 Google Gemini 2.5/3.1 및 OpenAI의 GPT-5를 포함한 최신 AI 모델을 사용한다. 그러나 이 프로젝트도 AI의 성능은 인간의 수준에 미치지 못하며, 기준선보다わずかな 개선만 보인다.

저자들은 다음과 같이 말한다:

‘우리의 실험은 최첨단 LVLM이 미세한 시공간적 推論에 상당한 어려움을 겪고 있음을 보여주며, 시공간적 정보를 효과적으로 활용하지 못하고 물리적 접촉과 같은 공간 상호작용을 이해하지 못하는 것을 강조한다.’

이 연구 분야에서 다루는 문제는 현재로서는 실제 로봇공학과 관련이 적지만, 이론적인 문제가 궁극적으로 구체화된 AI로 발전할 때 추가적인 도전이 예상된다.

새로운 논문은 Flat-Pack Bench: Large Vision-Language Models의 스파티오테мп럴 이해 평가를 위한 가구 조립라는 제목을 가지고 있으며, 코넬 대학교, 코넬 테크, MBZUAI, UC 버클리에서 8명의 저자가 참여했다. 이 논문은 프로젝트 사이트와 함께 제공된다.

방법

새로운 연구의 저자들은 AI 보조자가 관찰을 통해 조립 과정을 이해하는 것이 어려운 것을 강조한다. 예를 들어, 많은 사람이 커뮤니티 지식을 利用하기 위해 참조하는 YouTube 스타일의 수동 비디오를 통해이다.

평면 가구 조립 작업이 제기하는 몇 가지 질문과 이 도전을 극복하기 위한 네 가지 필수적인 기술. 소스 - https://arxiv.org/pdf/2605.21625

평면 가구 조립 작업이 제기하는 몇 가지 질문과 이 도전을 극복하기 위한 네 가지 필수적인 기술. 소스

저자들은 이전에 언급된 IKEA-Manuals-at-Work(IMaW) 데이터셋에서 필터링된 데이터셋을 수집했다. 이 새로운 벤치마크는 원래 비디오에서 텍스트 전용 지침 카드를 제거하고, 별도의 키 프레임 및 전체 비디오 변형을 제공하며, 또한 분할된 가구 부품이 있는 수동으로 주석이 달린 시각적 프롬프트를 추가하여 다중 선택 推論 작업을 지원한다.

벤치마크는 네 가지 유형의 질문을 중심으로 구성되어 있다: MATE, 두 부품이 최종 조립에서 연결되어 있는지 여부를 결정한다; TRACK, 모델이 비디오 자체를 사용하여 섞인 부품 ID를 복구하도록 요구한다; TOrd, 모델이 연결 이벤트의 올바른 순서를 추론할 수 있는지 평가한다; 및 TLoc, 모델이 시각적 프롬프트에 표시된 상태 바로 전에 또는 이후에 발생하는 이벤트를 식별할 수 있는지 테스트한다.

새로운 벤치마크의 예시, 평면 가구 조립 비디오의 스파티오테мп럴 推論을 테스트하기 위한 네 가지 핵심 작업 유형: Temporal Localization; Temporal Ordering; Tracking; 및 Mating. 각 작업은 조립 비디오와 하나 이상의 분할된 시각적 프롬프트 및 다중 선택 推論 질문을 결합한다.

새로운 벤치마크의 예시, 평면 가구 조립 비디오의 스파티오테ンプ럴 推論을 테스트하기 위한 네 가지 핵심 작업 유형: Temporal Localization; Temporal Ordering; Tracking; 및 Mating. 각 작업은 조립 비디오와 하나 이상의 분할된 시각적 프롬프트 및 다중 선택 推論 질문을 결합한다.

위의 스키마 이미지에서 보여진 템플릿은 이 네 가지 질문 모델에서 파생되었다.

저자들은 또한 원래 IMaW 비디오에 각 부품이 연결되는 세부 정보를 추가했다.

회피

논문에 따르면, 질문은 수동으로 수작업으로 작성해야 한다. 자동 생성된 질문은 AI가 비디오를 무시하고 자신의 훈련된 이해를 사용하도록 허용하기 때문이다. 이는 LLM/VLM을 사용하는 사용자가 익숙한 시나리오이다. 최적화 및 기타 기업의 우선순위로 인해 최전선 모델이 제출된 정보를 무시하고 자신의 이해를 사용하는 경우가 많기 때문이다.

‘우리는 자동 생성이 비디오를 무시하고捷徑을 이용하여 질문을 해결할 수 있는 질문을 자주 생성한다는 것을 발견했다. 예를 들어, 자동 생성된 결합 질문은 이미 연결을 위해 위치한 부품에 대해 또는 명확하게 다른 모양이나 색상의 분산 옵션을 포함하여 쉽게 제거할 수 있는 옵션을 포함한다. 이를 해결하기 위해 우리는 고정된 템플릿을 사용하여 모든 질문을 수동으로 작성했다.

‘주석자는 전체 조립 비디오, 분할된 프레임에 대한 시각적 프롬프트, 질문 템플릿 및捷徑을 피하기 위한 자세한 지침을 받았다. ‘

완성된 벤치마크는 50개의 다양한 가구 조립 비디오에 걸쳐 602개의 다중 선택 질문으로 구성되어 있다.

데이터 및 테스트

테스트에 사용된 모델은 앞서 언급된 ChatGPT와 Gemini 버전뿐만 아니라 Video-LLaVA; LLaVA-NeXT-Vid; LLaVA-OneVision; LLaVA-Video; Qwen 2.5/Qwen 3-VL; InternVL3; ArrowRL; PerceptionLM; 및 Video-Refer이다.

GenS는 기본 Gemini 2.5 Pro 모델에서 긴 비디오의 질문 관련 프레임을 선택하는 데 사용되었다. 대부분의 모델은 one-shot 컨텍스트에서 greedy decoding을 사용하여 테스트되었지만(GPT-5는 지원하지 않음).

세 가지 프롬프트 형식이 벤치마크를 위해 고안되었다: 혼합 미디어 프롬프트는 시각적 프롬프트를 별도의 이미지로 제공했다; 콜라주 프롬프트는 시각적 프롬프트를 비디오의 각 프레임에 그리드 레이아웃으로 삽입했다; 및 concat 프롬프트는 시각적 프롬프트를 비디오의 시작 부분에 추가했다.

트리밍된 비디오와 키 프레임 비디오 변형 모두가 이러한 형식에서 테스트되었으며, 프롬프트 구조와 시간 압축이 모델 성능에 미치는 영향을 측정하기 위해 사용되었다.

테스트에 사용된 기회 기준선에는 ‘기회 기준’도 포함되어 있는데, 이는 가장 일반적인 옵션(진짜로 임의의 옵션이 아닌)을 선택하는 것이다.

인간 요인

인간의 성능은 컴퓨터 과학 프로그램의 참가자들(학사부터 박사까지)을 통해 평가되었다. 각 참가자는 조립 비디오, 관련된 시각적 프롬프트 및 다중 선택 질문, 및 작업 지침을 보여주었고, 답변을 선택했다.

질문당 세 개의 응답을 수집하고 다수결 투표를 통해 해결했다. 또한 랜덤하게 샘플링된 벤치마크의 하위 집합에 대한 별도의 크라우드소싱 연구도 수행했다.

정확도는 시험이 사용한 측정값이다:

모델 순위 마이크로 평균 TOrd TLoc 추적 메이트
인간 성능 94.18 93.54 93.20 93.77 97.70
기회 기준
임의 기회 26.41 25.00 25.00 25.49 33.33
기회 기준 26.74 27.74 30.10 26.46 36.78
사유 모델
GPT-5 1 37.71 40.65 53.40 25.68 49.43
Gemini 2.5 Pro 2 33.72 40.65 44.66 23.35 39.08
Gemini 3.1 Pro 3 32.89 34.84 43.69 21.79 49.43
Gemini 2.5 Flash 4 31.06 31.61 41.75 23.35 40.23
Gemini 2.5 Pro + GenS 5 25.58 33.55 32.04 13.23 40.23
오픈 모델
Video-LLaVA-7B 26 23.75 21.29 35.92 10.89 51.72
InternVL3-14B 5 37.71 42.58 21.36 37.74 48.28
InternVL3-38B 12 36.05 42.58 37.86 25.68 52.87
InternVL3-78B 1 41.03 43.87 39.81 42.02 34.48
Qwen2.5-VL-7B 22 30.23 27.10 18.45 33.07 41.38
Qwen2.5-VL-32B 13 35.88 34.84 29.13 33.07 54.02
Qwen2.5-VL-72B 2 40.37 41.29 30.10 45.14 36.78
Qwen3-VL-4B 11 36.54 34.19 33.01 32.68 56.32
Qwen3-VL-4B-Think 9 37.21 31.61 25.24 37.74 59.77
Qwen3-VL-8B 15 33.72 36.13 30.10 33.85 33.33
Qwen3-VL-8B-Think 17 31.73 34.19 33.01 25.29 44.83
Qwen3-VL-32B 6 37.71 38.71 46.60 31.91 42.53
Qwen3-VL-32B-Think 3 40.03 38.71 22.33 45.53 47.13
Qwen3-VL-30B-A3B 10 36.71 30.32 22.33 42.02 49.43
Qwen3-VL-235B-A22B 8 37.21 37.42 25.24 39.69 43.68
LLaVA-NeXT-Vid-7B 25 25.08 33.55 24.27 16.73 35.63
LLaVA-NeXT-Vid-34B 21 30.40 30.32 24.27 32.68 31.03
LlaVA-OneVision-7B 16 32.89 26.45 30.10 34.24 43.68
LlaVA-OneVision-72B 4 38.37 35.48 25.24 38.91 57.47
LLaVA-Video-7B 19 30.73 30.97 24.27 25.68 52.87
LLaVA-Video-72B 7 37.54 36.77 27.18 35.80 56.32
Perception-LM-1B 24 27.74 28.39 26.21 25.29 35.63
Perception-LM-3B 18 31.40 28.39 32.04 29.96 40.23
Perception-LM-8B 14 35.38 26.45 26.21 44.75 34.48
VideoRefer 23 28.57 32.90 30.10 17.51 51.72
ArrowRL-7B 20 30.56 30.97 24.27 29.18 41.38

FLAT-PACK BENCH에서 다중 모드 모델의 성능 비교, TOrd, TLoc, 추적 및 메이트 작업에서 인간 성능은 모든 테스트 시스템을 크게 앞섬

초기 테스트(이미지 위)에서 인간은 모든 질문 类別에서 90% 이상의 점수를 얻었으며, 80%의 일치율을 보였다. 이는 질문이 잘 구성되어 있고 모호하지 않음을 시사한다.

GPT-5와 Gemini 2.5/3.1 Pro는 데이터셋에서 어려움을 겪었으며, 기준선보다わずかな 개선만 보였으며, 인간의 성능에 미치지 못했다. GenS를 사용하여 Gemini 2.5 Pro의 질문 관련 프레임을 선택하는 것은 결과를 개선하지 못했다. 따라서 저자들은 사유 LVLM이 벤치마크에서 요구하는 스파티오테мп럴 이해에 어려움을 겪는다고 결론지었다.

오픈 시스템 중에서 InternVL3와 Qwen 계열이 가장 좋은 결과를 보였지만, 성능은 모델에 따라 크게 달랐다. 일부 모델은 거의 기회 수준에 도달하지 못했다. PerceptionLM 및 VideoRefer와 같은 전문 시스템도 벤치마크의 복잡한 조립 작업에서 어려움을 겪었다. 인간 참가자는 모든 모델 类別에서 크게 앞섰다.

연구자들은 또한 두 가지 체인-오브-사고 프롬프팅 전략을 표준 프롬프팅 설정과 비교했다. 제로샷 체인-오브-사고 프롬프팅은 모델이 답변을 단계적으로 설명하도록 요청했다. 체인-오브-사고와 자기 일관성은 후보 답변을 5개 생성한 후 다수결 투표를 통해 최종 답변을 선택했다. 그러나 두 접근법 모두 Flat Pack Bench 데이터셋에서 결과를 개선하지 못했다.

치트 코드

연구자들은 LVLM이 실제로 조립 비디오에서 학습하는지, 아니면 정적 시각적 단서를 이용하여 가능한 답변을 추론하는지 테스트하기 위해 이미지 전용 버전의 벤치마크를 생성했다. 이 버전은 비디오를 제거하고 질문 텍스트와 시각적 프롬프트만 유지했다.

인간의 성능은 이 조건에서 50% 이상 저하되었으며, 이는 작업이真正로 시간적 이해를 요구함을 보여준다. 그러나 모델은 비디오 입력 없이도 성능이 크게 저하되지 않았으며, 일부 작업에서는 성능이 개선되거나 안정적인 것으로 나타났다.

이것은 많은 LVLM이 실제로 비디오의 시간적 정보를 사용하지 않았으며, 대신 이미지 기반의捷徑과 상식적인 가정에 의존하여 가능한 답변을 추론한다는 것을 시사한다.

이미지 전용 버전의 Flat-Pack Bench에서 LVLM의 성능, 표준 비디오-이미지 설정과 비교, 및 부품 ID를 섞는 추가 결과

이미지 전용 버전의 Flat-Pack Bench에서 LVLM의 성능, 표준 비디오-이미지 설정과 비교, 및 부품 ID를 섞는 추가 결과

‘위의 이미지에서는 이미지 전용 버전의 LVLM의 성능과 전체 평가에서 성능의 변화, 및 인간의 성능을 보여준다. ‘

‘인간의 성능이 50% 이상 저하되는 것은 질문이 비디오를 필요로 함을 보여준다. ‘

‘우리는 또한 모델의 전체 성능이 크게 저하되지 않았으며, 일부 작업에서는 성능이 개선되거나 안정적인 것으로 나타남을 관찰한다. 이는 LVLM이 비디오를 효과적으로 사용하지 못하고, 대신 이미지 기반의捷徑과 상식적인 가정에 의존하여 가능한 답변을 추론한다는 것을 시사한다.’

연구의 더 깊은 분석은 주요 장애물이 단순한 시간적 시퀀싱뿐만 아니라 객체 고정과 스파티오테мп럴 推論의 실패라는 것을 시사한다. 모델은 시각적으로 유사한 가구 부품을 추적하는 데 어려움을 겪었으며, 이는 모델이 더广い 조립 과정을 올바르게 식별하는 경우에도 발생했다.

결론

개념과 객체의 내부화는 인간의 성장과 지각 발달, 및 개인의 다양한 작업에 필수적이다.

컴퓨터 비전 연구는 이미 객체와 사람을 재획득하고 재인식하는 데 어려움을 겪고 있다. 이러한 문제는 가구 조립과 같은 작업에서 더욱 크게 나타날 수 있다. 특히, 로봇이 비디오의 시점과 자세를 변경해야 하는 경우, AI의 가구 조립 시도는 더욱 어려워질 수 있다.

 

* 저자의 원래 형식, 필요한 경우 영향력을 유지하기 위해 수정됨 /

최초로 게시된 날: 2026년 5월 25일. 2026년 5월 27일 날짜 속성의 오류를 수정하기 위해 수정됨 (!).

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai