ロボティクスとフィジカルAI

Figure、Helix 2.5を発表、30軒の未見住宅でゼロショットテスト

mm
Unite.AI を Google の優先ソースに追加

Figure Helix 2.5を発表した 2026年9月17日、同社の人間行動のIndexデータセットで事前学習されたヒューマノイドニューラルネットワークで、30軒のベイエリアの住宅で、いずれの住宅でもデータを収集せずに評価された。Figureは、Indexでの事前学習により、ゼロショット成功率が9%から56%に上昇したと報告した。

FigureはHelix 2.5を、同社が構築した中で最も高度なニューラルネットワークと説明した。単一のIndex事前学習基盤モデルから、同社は3つの全身行動—リビングルームの整理、タオルの折りたたみ、ベッドメイキング—を生成した。以前のHelix 02システムは、食器洗い機の荷下ろしや物流タスクを200時間にわたり自律的に実行するなど、長期間にわたる全身制御を調整したが、ロボットが作業する場所で収集されたデータから学習していた。

評価設計と採点基準

Figureはゼロショットを、評価環境と操作対象のオブジェクトを指すものとして定義している。各行動は別の場所で収集されたファインチューニングデータを通じて指定された。評価用の玩具、タオル、寝具はタスク指定データに現れず、ロボットは各住宅に既にあるソファ、ベッド、折りたたみ面を使用した。評価対象のオブジェクトは実験開始前に除外され、AIモデルとそれに続く人間のレビューにより、タスク指定データに含まれていないことが確認された。

各タスクは30軒すべてで単一の固定チェックポイントを使用した。評価対象の住宅やオブジェクトに対して重みは調整されず、チェックポイント選択に評価ロールアウトデータやパフォーマンスは使用されなかった。成功は部分点なしでタスク全体を完了することを要件とした。すべての試行は固有の初期構成から開始し、リセット条件は評価されたすべてのポリシーに同一に適用され、安全のための人間介入があった場合はロールアウトが中止され失敗と記録された。

評価者は評価開始前に固定された基準に基づいて作業した。リビングルーム整理では、シーンに散らばった13〜15個の玩具すべてを拾い上げバスケットに入れる必要があり、各玩具につき1分のタイムアウト後にロールアウトが中止された。タオル折りたたみでは、すべてのタオルを拾い上げ、折りたたんでバスケットに入れ、折りたたみの品質はコーナーの位置合わせで評価された――最高評価は4つのコーナーが1インチ以内にほぼ接触すること――そして各タオルにつき3分のタイムアウトが設定された。ベッドメイキングでは、2つの枕と2つの掛け布団のコーナーがベッド上部の3分の1まで持ち上げられ、掛け布団は滑らかに引き伸ばされる必要があり、枕は向きも評価対象となり、各枕と掛け布団の側面ごとに1分のタイムアウトが適用された。

Index事前学習の効果の分離

結果がIndexから来たものかタスク指定データ自体から来たものかを測定するため、Figureは同一のタスク指定データで2つのポリシーを訓練した。1つはランダムな重みで初期化し、もう1つはIndex事前学習済みのHelix 2.5モデルから初期化した。アーキテクチャ、最適化、ハイパーパラメータ、下流データ、評価はすべて固定され、実験変数はIndex事前学習のみとなった。Helix 2.5はランダム初期化から完全にIndexで事前学習されたのに対し、Helix 02は事前学習済みのビジョン・言語モデルから開始された。

ブラインド評価において、スクラッチから訓練されたポリシーはゼロショット試行の9%で成功したのに対し、Index事前学習ポリシーは56%で成功し、Figureはこの差を6倍以上と表現した。事前学習が唯一の変数であるため、同社はこの差が直接的に貢献度を測る指標だと述べている。Figureは、単一の評価タスクがIndex事前学習データセット全体の1.90%以上を占めることはなく、同社の知る限り、この規模でヒューマノイドにおけるゼロショット全身汎化を実証した初めての研究であると述べた。

データ効率と転移スケーリング法則

Figureは、同じタスクを評価環境で直接収集したデータで訓練された従来のHelix 02ポリシーとHelix 2.5を比較した。同社は、Helix 2.5が適応データを半分に減らしながらもそのポリシーと同等の成功率を達成し、30軒の未見住宅でもゼロショットで実行できたと報告した。さらにFigureは、全身自己修正における定性的な改善—たとえば位置を再調整するために後退したり、姿勢を変えたり、ベッド全体の周囲を移動して折り目を修正したり—を示し、これをIndex事前学習の重要な効果と位置付けた。

別途、同社はモデルサイズと下流訓練を固定したまま、Indexの事前学習データを8倍に拡大した階層的サブセットで4つのモデルを訓練し、Indexデータが倍増するたびに保持されたアクション予測損失が予測通りに減少したと報告した。Figureは、訓練開始前に小規模な実行だけを用いて最大規模の実行のテスト損失を小数点第4位まで予測し、予測誤差は全8倍データ範囲の変動の0.54%に相当すると述べた。同社はこの結果を、同社の知る限り、ヒューマノイド上で測定された初の人間からロボットへの転移スケーリング法則であり、データスケーリングのみを測定していることを指摘した。

Helix 2.5を支えるIndexデータセット

Figureは2026年8月25日にIndexを導入し、ステルス状態を終了し、4か月前に開始したデータ収集アプリをリブランドし、これを史上最も多様なロボット訓練データセットと説明しました。その発表で、Figureは108か国で264,000件のアプリダウンロード、週あたり44,000人以上のアクティブユーザー、データを収集するクリエイターがアップロードした1,600万件以上の動画、クリエイターへ支払われた15,000,000ドル、そして毎秒30分の動画アップロードが処理されていると報告しました。収集された1,000時間あたり、同社はIndexに373件のユニークタスク、1,146件のユニーク操作対象オブジェクト、116件のユニーク環境が含まれ、フィルタリング、詐欺レビュー、重複除去、再バランス、アノテーションの5段階パイプラインで処理されていると述べました。

Helix 2.5の発表では、Indexが現在、毎秒約35分の新しい人間体験を生成しており、FigureはHelixの訓練に35億ドル相当のコンピューティングリソースを投入すると述べています。同社は、一般的な物理知能に関する業務の採用を行っていると発表を締めくくりました。

オリオン・サトーは、ロボティクス、オートメーション、知能機械に焦点を当てたAI生成コラムニストです。彼の執筆は、ロボティクスの進歩が、製造、物流、ヘルスケア、日常生活を、ますます自律的なシステムを通じて、どのように形作り変えているかを探求しています。
技術的かつ実行可能な視点から、オリオンはロボティックアーキテクチャ、センサーフュージョン、制御システム、そしてAIと機械的知能の融合を分析しています。特に、オートメーションが制御された環境から、信頼性、安全性、効率性が最も重要となる現実世界への展開に移行する方法に興味を持っています。
オリオン・サトーによって執筆された記事は、AIによって生成され、Unite.AIの編集チームによって技術的正確性、明瞭性、編集基準の遵守を確保するためにレビューされています。