로보틱스 및 피지컬 AI

Figure, Helix 2.5를 소개, 30개 미보유 가정에서 제로샷 테스트

mm
Unite.AI를 Google의 선호 소스에 추가

Figure Helix 2.5를 소개했습니다 2026년 9월 17일, 인간 행동에 대한 회사의 Index 데이터셋으로 사전 학습된 휴머노이드 신경망이며, 데이터가 전혀 수집되지 않은 30개의 베이 지역 가정에서 평가되었습니다. Figure는 Index 사전 학습으로 제로샷 성공률이 9%에서 56%로 상승했다고 보고했습니다. 이는 동일한 정책을 처음부터 학습시킨 경우와 비교한 통제 실험 결과입니다.

Figure는 Helix 2.5를 자사가 구축한 가장 진보된 신경망이라고 설명했습니다. 단일 Index 사전 학습 기반 모델에서 회사는 세 가지 전신 행동을 구현했으며, 이는 거실 정리, 수건 접기, 침대 만들기입니다. 이전 Helix 02 시스템은 식기세척기 언로드 및 물류 작업을 200시간 동안 자율적으로 수행하는 등 장기간에 걸친 전신 제어를 조정했지만, 로봇이 작동할 장소에서 수집된 데이터로 학습되었습니다.

평가 설계 및 채점 기준

Figure는 제로샷을 평가 환경과 조작되는 객체를 의미한다고 정의합니다; 각 행동은 다른 곳에서 수집된 미세 조정 데이터를 통해 지정되었습니다. 평가용 장난감, 수건, 침구는 작업 지정 데이터에 포함되지 않았으며, 로봇은 각 가정에 이미 존재하는 소파, 침대 및 접기 표면을 사용했습니다. 평가 대상 객체는 실험 시작 전에 별도로 보관했으며, AI 모델과 인간 검토를 거쳐 해당 객체가 작업 지정 데이터에 포함되지 않았음이 확인되었습니다.

각 작업은 30개 가정 모두에서 단일 고정 체크포인트를 사용했습니다. 평가 가정이나 객체에 대한 가중치 조정은 없었으며, 체크포인트 선택에 평가 롤아웃 데이터나 성능이 사용되지 않았습니다. 성공은 부분 점수 없이 전체 작업을 완수하는 것을 요구했습니다. 모든 시도는 고유한 초기 구성에서 시작했으며, 재설정 조건은 평가된 모든 정책에 동일하게 적용되었습니다. 안전을 위한 인간 개입이 발생하면 롤아웃이 중단되고 실패로 표시되었습니다.

채점자는 평가 시작 전에 고정된 기준에 따라 작업했습니다. 거실 정리에서는 장면에 흩어져 있는 13~15개의 장난감을 모두 주워 바구니에 넣어야 하며, 각 장난감당 1분의 제한 시간이 지나면 롤아웃이 중단됩니다. 수건 접기에서는 모든 수건을 주워 접고 바구니에 넣어야 하며, 접기의 품질은 모서리 정렬을 기준으로 평가됩니다 — 최고 등급은 네 모서리가 1인치 이내로 거의 맞닿아야 합니다 — 그리고 각 수건당 3분의 제한 시간이 있습니다. 침대 만들기에서는 두 개의 베개와 두 개의 이불 모서리가 침대 상단 1/3에 도달하고 이불이 매끄럽게 펴져야 하며, 베개는 방향에 따라 평가되고 각 베개와 이불 측면마다 1분의 제한 시간이 적용됩니다.

Index 사전 학습 효과 분리

결과가 작업 지정 데이터 자체가 아니라 Index에서 비롯된 정도를 측정하기 위해, Figure는 동일한 작업 지정 데이터에 대해 두 가지 정책을 훈련했습니다. 하나는 무작위 가중치로 초기화했으며, 다른 하나는 Index 사전 학습된 Helix 2.5 모델에서 초기화했습니다. 아키텍처, 최적화, 하이퍼파라미터, 하위 데이터 및 평가 조건은 고정했으며, Index 사전 학습만이 유일한 실험 변수로 남았습니다. Helix 2.5는 무작위 초기화에서 완전히 Index를 사용해 사전 학습된 반면, Helix 02는 사전 학습된 비전-언어 모델에서 시작했습니다.

블라인드 평가에서, 처음부터 훈련된 정책은 제로샷 시도 중 9%에서 성공했으며, Index 사전 학습된 정책은 56%에서 성공해 Figure가 제시한 차이는 6배 이상이라고 설명했습니다. 사전 학습이 유일한 변수였기 때문에, 회사는 이 차이가 직접적인 기여도를 측정한다고 말합니다. Figure는 단일 평가 작업이 Index 사전 학습 데이터셋의 1.90% 이상을 차지하지 않으며, 이 연구가 휴머노이드에서 이 범위의 제로샷 전신 일반화를 최초로 시연한 것이라고 밝혔습니다.

데이터 효율성 및 전이 스케일링 법칙

Figure는 또한 Helix 2.5를 동일한 작업을 수행하도록 환경에서 직접 수집한 데이터를 사용해 훈련된 이전 Helix 02 정책과 비교했습니다. 회사는 Helix 2.5가 적응 데이터의 절반만 사용하면서도 해당 정책의 성공률과 일치했으며, 30개의 미보유 가정에서 제로샷으로 수행했다고 보고했습니다. 또한 Figure는 전신 자체 교정에서 정성적인 개선을 설명했는데, 예를 들어 위치를 재조정하기 위해 뒤로 물러서거나, 자세를 바꾸거나, 전체 침대를 돌아다니며 접기를 수정하는 등이며, 이를 Index 사전 학습의 중요한 효과라고 언급했습니다.

별도로, 회사는 모델 크기와 하위 훈련을 고정한 상태에서 Index의 8배 증가된 사전 학습 데이터를 포함하는 중첩된 하위 집합에 대해 네 개의 모델을 훈련했으며, Index 데이터가 두 배씩 늘어날 때마다 보류된 행동 예측 손실이 예측 가능하게 감소한다고 보고했습니다. Figure는 훈련 시작 전에 작은 실행 결과만을 사용해 가장 큰 실행의 테스트 손실을 소수점 네 자리까지 예측했으며, 예측 오류는 전체 8배 데이터 범위 변동의 0.54%에 해당한다고 밝혔습니다. 회사는 이 결과를, 자사가 알기로는 인간에서 로봇으로의 전이 스케일링 법칙을 휴머노이드에서 최초로 측정한 것이라고 설명했으며, 이는 데이터 스케일링만을 측정한다는 점을 언급했습니다.

Helix 2.5 뒤의 Index 데이터셋

Figure는 2026년 8월 25일에 Index를 소개했습니다. 스텔스 상태를 종료하고 4개월 전에 출시한 데이터 수집 앱의 브랜드명을 변경했으며, 이를 지금까지 구축된 가장 다양한 로봇 훈련 데이터셋이라고 설명했습니다. 그 발표에서 Figure는 108개 국가에서 264,000건의 앱 다운로드, 주간 활성 사용자 44,000명 이상, 데이터를 수집하는 크리에이터가 업로드한 동영상 1,600만 개 이상, 크리에이터에게 지급된 $15 million, 그리고 매초 30분 분량의 동영상 업로드가 처리된다고 보고했습니다. 수집된 1,000시간당, 회사는 Index에 373개의 고유 작업, 1,146개의 고유 조작 객체, 116개의 고유 환경이 포함되어 있으며, 필터링, 사기 검토, 중복 제거, 재균형 및 주석 달기의 다섯 단계 파이프라인을 통해 처리된다고 밝혔습니다.

Helix 2.5 발표에 따르면 Index는 현재 매초 약 35분 분량의 새로운 인간 경험을 생성하고 있으며, Figure는 Helix 훈련을 위해 $3.5 billion의 컴퓨팅 자원을 약속했다고 밝혔습니다. 회사는 일반 물리 지능 작업을 위한 채용을 진행하고 있다고 발표를 마무리했습니다.

오리온 사토는 로봇공학, 자동화, 지능형 기계에 초점을 맞춘 AI 생성 기자입니다. 그의 글은 로봇공학의 발전이 제조, 물류, 의료, 일상 생활을 점점 더 자율적인 시스템으로 바꾸는 방법을 탐구합니다.
기술적이고 실행 가능한 관점에서 오리온은 로봇 아키텍처, 센서 퓨전, 제어 시스템, 그리고 기계 지능과 AI의 융합에 대해 분석합니다. 그는 자동화가 제어 환경에서 실제 배치로 이동하는 방법, 특히 신뢰성, 안전성, 효율성이 가장 중요하게 여겨지는 곳에 대해 관심을 가지고 있습니다.
오리온 사토가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 기술적 정확성, 명확성, 편집 표준 준수를 보장하기 위해 검토됩니다.