AIモデルとプラットフォーム

ジェミニロボティクス:AIの推論が物理世界と出会う

mm
Unite.AI を Google の優先ソースに追加

近年、人工知能(AI)は、自然言語処理(NLP)やコンピュータビジョンなどの分野で著しく進歩しています。ただし、AIには物理世界への統合という大きな課題がありました。AIはデジタル環境で推論や複雑な問題の解決に優れていますが、これらの成果は主にデジタル環境に限定されていました。ロボティクスを通じて物理タスクを実行するには、AIは空間推論、物体操作、意思決定について深い理解を持たなければなりません。この課題に対処するために、Googleはジェミニロボティクスを導入しました。ジェミニロボティクスはロボティクスとエンボディッドAIのために特に開発されたモデルのセットです。ジェミニ2.0を基盤として、ジェミニロボティクスは先進的なAI推論と物理世界を統合し、ロボットが幅広い複雑なタスクを実行できるようにします。

ジェミニロボティクスの理解

ジェミニロボティクスは、ジェミニ2.0の基盤上に構築されたAIモデルのペアです。ジェミニ2.0は、テキスト、画像、オーディオ、ビデオを処理できる最先端のビジョン言語モデル(VLM)です。ジェミニロボティクスは本質的に、ビジョン言語アクション(VLA)モデルへのVLMの拡張であり、ジェミニモデルが視覚入力と自然言語命令を理解・解釈し、さらに物理アクションを実行できるようにします。この統合はロボティクスに不可欠であり、機械が環境を「見る」だけでなく、人間の言語の文脈で理解し、物体操作から複雑なデクスタラスタスクまでの幅広い実世界のタスクを実行できるようにします。
ジェミニロボティクスの主な強みの1つは、広範なタスクにわたって一般化する能力であり、広範な再トレーニングを必要としません。モデルはオープン語彙の命令に従い、環境の変化に適応し、初期トレーニングデータの一部ではなかった予期せぬタスクにも対処できます。これは、ダイナミックで予測不可能な環境である家庭や産業環境で作業するロボットを作成する上で特に重要です。

エンボディッド推論

ロボティクスの大きな課題の1つは、デジタル推論と物理的相互作用の間のギャップです。人間は複雑な空間関係を容易に理解し、周囲と無理なく相互作用できますが、ロボットはこれらの能力を再現するのに苦労しています。たとえば、ロボットは空間ダイナミクス、状況の適応、予測不可能な実世界の相互作用の理解に限界があります。ジェミニロボティクスは「エンボディッド推論」を取り入れてこれらの課題に対処します。エンボディッド推論は、システムが人間と同様に物理世界を理解し、相互作用できるようにします。
デジタル環境でのAI推論とは対照的に、エンボディッド推論には以下の重要なコンポーネントが含まれます:

  • 物体検出と操作:エンボディッド推論により、ジェミニロボティクスが環境内の物体を検出して識別できます。物体の把持位置を予測し、状態を決定し、ドロワーを開けたり、液体を注いだり、紙を折ったりするような動きを実行できます。
  • 軌道と把持予測:エンボディッド推論により、ジェミニロボティクスが最も効率的な動きの軌道を予測し、物体を把持するための最適な点を特定できます。この能力は、精度が求められるタスクに不可欠です。
  • 3D理解:エンボディッド推論により、ロボットが3次元空間を認識して理解できます。これは、複雑な空間操作を必要とするタスク、たとえば衣類の折りたたみや物体の組み立てに特に重要です。3Dの理解により、ロボットは多視点3D対応と3Dバウンディングボックス予測を含むタスクで優秀になります。これらの能力は、ロボットが物体を正確に扱うために不可欠です。

デクスタリティと適応:実世界タスクの鍵

物体検出と理解は重要ですが、ロボティクスの真の課題は、折り紙の狐を折ったりカードゲームをプレイしたりするような、繊細なモータースキルを必要とするタスクの実行にあります。ジェミニロボティクスは、これらのタスクに優れた性能を発揮するように特別に設計されています。

  • 繊細なモータースキル:モデルは、衣類の折りたたみ、物体の積み上げ、ゲームのプレイなどの複雑なタスクを実行できます。さらに、複数の自由度を横断する調整を必要とするタスク、たとえば両腕を使用した複雑な操作を実行できます。
  • 少数ショット学習:ジェミニロボティクスは、少数ショット学習の概念を導入し、最小限のデモンストレーションで新しいタスクを学習できます。たとえば、100回のデモンストレーションで、通常は大量のトレーニングデータを必要とするタスクを学習できます。
  • 新しいエンボディメントへの適応:ジェミニロボティクスのもう1つの重要な機能は、新しいロボットエンボディメントへの適応能力です。二腕ロボットやより多くの関節を持つヒューマノイドロボットなど、さまざまなロボットボディをシームレスに制御できます。これにより、ハードウェア構成の違いに応じてモデルを柔軟に適応させることができます。

ゼロショット制御と迅速な適応

ジェミニロボティクスの特徴の1つは、ゼロショットまたは少数ショット学習方式でロボットを制御できることです。ゼロショット制御とは、各タスクごとに特定のトレーニングを必要とせずにタスクを実行する能力を指します。

  • コード生成によるゼロショット制御:ジェミニロボティクスは、以前見たことがない特定のアクションを実行するためのコードを生成できます。たとえば、高レベルのタスク説明が与えられた場合、ジェミニは物理ダイナミクスと環境を理解する推論能力を使用して、タスクを実行するために必要なコードを生成できます。
  • 少数ショット学習:タスクがより複雑なデクスタリティを必要とする場合、モデルはデモンストレーションから学習し、すぐにタスクを効果的に実行できます。この迅速な適応能力は、特に環境の変化や予測不可能な状況が頻繁にあるロボティクス制御において重要な進歩です。

将来の影響

ジェミニロボティクスは、汎用ロボティクスにとって重要な進歩です。AIの推論能力とロボットのデクスタリティおよび適応性を組み合わせることで、ロボットが日常生活に簡単に統合され、人間のような相互作用を必要とするさまざまなタスクを実行できる将来が近づいています。
ジェミニロボティクスの潜在的な応用は広範囲にわたります。産業環境では、複雑な組み立て、検査、メンテナンスタスクに使用できます。家庭では、家事、介護、パーソナルエンターテインメントを支援できます。これらのモデルが進化を続けるにつれて、ロボットはさまざまな分野で新しい可能性を開く、広く普及する技術になる可能性があります。

まとめ

ジェミニロボティクスは、ジェミニ2.0を基盤とするモデルセットであり、ロボットがエンボディッド推論を実行できるように設計されています。これらのモデルは、エンジニアや開発者がAIを搭載したロボットを作成するのを支援し、ロボットが人間のように物理世界を理解し、相互作用できるようにします。複雑なタスクを高精度で柔軟性を持って実行する能力により、ジェミニロボティクスはエンボディッド推論、ゼロショット制御、少数ショット学習などの機能を統合しています。これらの機能により、ロボットは広範な再トレーニングを必要とせずに環境に適応できます。ジェミニロボティクスは、製造から家庭支援まで、ロボットをより能力が高く、実世界の応用でより安全にできる可能性があります。これらのモデルが進化を続けるにつれて、ロボットの将来を再定義する可能性があります。

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。