ロボティクスとフィジカルAI

Google、Gemini Robotics ER 2を出荷 – マルチロボットチームワークを実現

mm
Unite.AI を Google の優先ソースに追加

Googleは、Gemini Robotics ER 2をリリースしました。これは、ロボットの高レベルプランナーとして機能するためのエンボディドリージョンモデルで、別のモデルがモーターを制御します。Gemini APIおよびGoogle AI Studioを通じて開発者に提供されており、Gemini Enterprise Agent Platformではプライベートプレビューへのアクセスが可能です。

ER 2は、ビデオ、画像、オーディオ、テキストを受け取り、シーンについて推論し、数分間実行されるタスクを計画し、次にハードウェアを移動させるために別のものを呼び出します。ビジョン言語アクションモデル、ナビゲーションAPI、または開発者がモデルに宣言されたツールとして宣言された独自の関数です。また、タスク中にはGoogle検索を呼び出すこともできます。 モデルカードでは、Gemini 3.5 Flashに基づくビジョン言語モデルとして説明されており、128,000トークンのコンテキストウィンドウと64,000トークンの出力があります。

これは、2026年4月14日にリリースされたGemini Robotics-ER 1.6の後継です。Gemini Robotics-ER 1.6では、Boston Dynamicsと共同で開発された、圧力計や化学サイトガラスなどの計器の読み取りが追加されました。ER 2は、これをデジタルディスプレイ、線形スケール、ルーラー、液体温度計に拡張し、10種類の計器でテストされています。

連続ビデオが追加するもの

実質的な変更は、ER 2が静止フレームではなくライブビデオフィードで推論することです。これにより、ロボットの自律性を制限しているステップが完了したかどうかを判断できます。

この機能から2つの機能が生まれます。進行状況の分類では、モデルはフィードの各フレームを5つの完了バンドの1つに分類する必要があります。0〜20%から80〜100%までです。Googleは57.4%の精度を報告しています。モーメントファインディングでは、クリティカルイベントが発生する正確なフレームを特定するようにモデルに指示します。たとえば、カップが十分に満たされて注ぐのを停止するポイントです。会社は、このタスクで91.3%の精度を報告しており、平均エラーは0.96秒です。また、モデルは大規模なモデルと比較して約4倍の実行速度で、計算リソースの小さな部分で実行されることを示しています。

サブセカンドタイミングが物理的な制御で重要です。ステップが60%完了したか、または完全に失敗したことを判断できるロボットは、ワークフローを再開するか、オペレーターを待つ必要はありません。ER 2は、Gemini Live APIの双方向エンドポイントを介してストリーミングされます。これは、Googleが推論ループから停止および思考のパウゼを挿入せずにアクションを実行できるようにする方法です。物理的な制御のために推論遅延を低くすることは、ロボットベンダーがロボット用の専用シリコンやシングルGPUのリアルタイムモデルを押す制約と同じです。

2つのロボット、1つのジョブ

新しい機能の1つは、マルチロボットコラボレーションです。異なるマシンがタスクのセマンティックな理解を共有し、作業を交換します。車輪ベースと足のペアは、同じジョブの異なる部分に適しています。DeepMindのデモでは、ApptronikのApollo 2ヒューマノイドとFranka Duoバイアームプラットフォームのペアを使用しています。2番目のデモでは、ER 2がBoston DynamicsのSpotのナビゲーションおよびマニピュレータAPIを駆動し、オブジェクトを音声コマンドでフェッチします。

すべてのハードウェアはGoogleが構築していません。これは、現在の市場のほとんどが機能する方法です。モデルは最先端の研究所から来ており、腕、足、グリッパーはパートナーから来ています。これは、コボットメーカーがファウンデーションモデル開発者にアピールし、プラットフォームレベルのエンボディッドスタックと同じ分割です。

ER 2は、3モデルファミリーの一部として到着しました。Gemini Roboticsチームからの同伴研究ポストでは、Gemini Robotics 2、フルヒューマノイドを足から指先まで制御するアクションモデル、およびGemini Robotics On-Device 2について説明しています。Gemini Robotics On-Device 2は、ローカルで実行され、新しいバイアームロボットに数時間以内に適応します。200個未満の例からです。これらは、オープンAPIではなく、早期アクセスパートナーに提供されます。

チームは、アクションモデル背後の成功率も公開しました。このモデルは、単一のチェックポイントから3つの異なるロボットボディを駆動しました。インスパイアハンドを装着したアポロ2は、76.3%の確率で棚からオブジェクトを選択し、68.4%の確率でテーブルから選択し、45.7%の確率で床から選択しました。22自由度のSharpaWaveハンドを使用した5本の指の操作は、さらに後ろにあります。電球の取り外しは92%、電球の取り付けは36%、ごみ袋の結び付けは44%です。DeepMindは、マルチフィンガーデクスタリティマニピュレーションはまだ課題であると説明し、これはヒューマノイドの能力の主張を評価するための有用なマーカーを設定します。

安全性の限界と最初の展開

Googleは、安全性の指示に従うことと人間の近接性のベンチマークに関する成果を報告しています。ER 2は、ヒューマノイドが近づくと停止し、エリアがクリアになると自動的に再開します。DeepMindは、近づく人間に停止することを、コラボレーションセーフティスタンダードの重要な要件と呼んでいます。これは通常、ハードウェアではなくプランニングモデルで満たされます。アポロ2の設計では、定義された影響半径内にオブジェクトが入ると動きを停止します。

DeepMindは、ASIMOV-Agenticベンチマークもリリースしました。これは、推論モデルがオーケストレーターとして安全に動作するかどうかを判断するものです。安全でないツールコールをアクションモデルから拒否し、タスクが物理的に実行可能かどうかを判断し、不確実な場合は人間に助けを求めます。

モデルカードは、展開の境界線を明確に示しています。Googleは、開発者に、ロボットモデルを安全性の重要な作業に使用しないように指示しています。医療、輸送、または故障が予測可能に死、負傷、または財産被害を引き起こす可能性のある場所です。この言語は、最初の展開の波を、検査、倉庫の取り扱い、ラボタスクに向けます。

ロボットビルダーにとって、ER 2は、Gemini APIからパートナーシップなしで呼び出せるレイヤーです。すでに動作するハードウェアを持っているチームを対象とし、次に何を実行するかを決定するために何かが必要です。

オリオン・サトーは、ロボティクス、オートメーション、知能機械に焦点を当てたAI生成コラムニストです。彼の執筆は、ロボティクスの進歩が、製造、物流、ヘルスケア、日常生活を、ますます自律的なシステムを通じて、どのように形作り変えているかを探求しています。
技術的かつ実行可能な視点から、オリオンはロボティックアーキテクチャ、センサーフュージョン、制御システム、そしてAIと機械的知能の融合を分析しています。特に、オートメーションが制御された環境から、信頼性、安全性、効率性が最も重要となる現実世界への展開に移行する方法に興味を持っています。
オリオン・サトーによって執筆された記事は、AIによって生成され、Unite.AIの編集チームによって技術的正確性、明瞭性、編集基準の遵守を確保するためにレビューされています。