ロボティクスとフィジカルAI
ダイナロボティクス、DYNA-2を人間のビデオ1ミリオン時間でトレーニング、ロボットデータなし

この主張は、分野の制約がどこにあるかによって重要性を持つ。一般的なロボットポリシーは、主に人間がロボットをタスクを通じて物理的に導くテレオペレーションデータでトレーニングされてきた。そんなデータは高価で収集が遅く、ロボットの基礎モデルがどれだけスケールできるかを制限してきた。DYNA-2の賭けは、ロボットが必要とする物理的な直感が人間が何かをするビデオから学べるものであり、それをロボットのハードウェアに転用できるというものだ。
“世界と行動を想像することで、従来のビジョン言語モデルが欠けている空間的推論と接触物理学をロボットに与えることができる”とダイナは述べている。
ロボットを見ないでビデオからDYNA-2が学ぶ方法
このアーキテクチャは、ダイナがWorld-Action Modelと呼ぶもので、ビジョン言語アクションの適応ではなくビデオ生成に基づいている。事前トレーニング中、モデルは人間のビデオコーパス上で二重の目的(次のフレームと次のアクションの予測)を実行する。同社は、これによりモデルがロボットのエンボディメント間で転用可能な接触物理学と空間的推論の機能モデルを獲得することができると述べている。ロボットアーム、ヒューマノイドプロトタイプ、デクスタスな五本指のハンドなど、事前トレーニング中にロボットが現れなかったにもかかわらずである。
特定のプラットフォームへの適応には、データ収集ではなく数時間のローカルファインチューニングが必要となる。ダイナが引用する一つの例では、13分のデータで五本指のロボットハンドがボトルキャップをひねって開けることができた。15のベンチマークタスクを集計すると、人間のデータが多くトレーニングされたポリシーは、データが少ないポリシーを一貫して上回った。同社は、このスケーリング曲線が法則であると主張している。
最も明確な比較は、ダイナ自身の以前のモデルDYNA-1との比較である。DYNA-1は、同社の商用デプロイメントで動作しているビジョン言語アクションモデルで、DYNA-2と同じトレーニングステップとデータセットで物理評価を行った。ダイナによると、食事の準備や作業スペースの片付けなどのデクスタスなタスクでは、DYNA-2は物理的な混乱から人間の介入なしに回復できたが、VLAベースラインは失敗して手動でのリセットが必要だった。ビデオの共トレーニングアルゴリズムは、ユーザーのコマンドに応じて異なる動きを必要とするタスクでの指示の実行スコアを133%向上させた。
DYNA-2の数字
- 1ミリオン時間以上のエゴセントリックな人間のビデオが事前トレーニングで使用された。同社はこれを、約170年の連続的な目覚めの経験に相当するものと説明している
- 20% → 80–90%のタスク成功率が、高精度の製造タスクで事前トレーニングのスケールから達成された
- 1.55倍のタスクがDYNA-1よりもDYNA-2で完了した
- 87% vs. 46%の合格率が、DYNA-2とDYNA-1の顧客デプロイメントで達成された
- 13分のデータで五本指のハンドがボトルキャップを開けることができた
- 133%の改善が、ビデオの共トレーニングアルゴリズムによって指示の実行タスクで達成された
- 1千万時間のトレーニングデータのスケールが、同社がこのアプローチによって達成可能であると主張している目標である
ダイナのデプロイメントはすでにテストベッドだった
DYNA-2は、まだ若い会社としては異常なほど具体的な商業基盤の上に到来した。ダイナのロボットは、DYNA-1を動作させて、ホテル、レストラン、ランドリー、ジムなどで本稼働中である。同社の資料によると、DYNA-1は、1時間あたり40枚以上のシャツを折りたたみ、16時間連続で顧客サイトで動作し、24時間連続の運用で99%以上の成功率を達成している。
このデプロイメントの足跡は、研究のためのデータフライホイールでもある。
同社の公表されているロードマップは、スケールアップである。人間のビデオのスケーリング曲線が保持されれば、同社は1千万時間のトレーニングがビデオの収集ではなくテレオペレーションリグの建設になることを示唆している。1ミリオン時間の結果は、曲線が存在する証拠である。10倍のスケールで曲線が保持されるかどうかは、オープンなエンジニアリングの疑問であり、ダイナがロードマップに賭けているものである。












