AIモデルとプラットフォーム
GoogleのAIが犬の動きを観察してロボットに移動を教える
現在の最先端のロボットでも、まだ少しぎこちない、jerkyな動きをするものが多い。ロボットがより自然で流暢な動きをするようにするために、Googleの研究者は、実際の動物の動きから学習することができるAIシステムを開発した。Googleの研究チームは、先週末にこのアプローチについての論文を公開した。この論文とブログ投稿では、研究チームはシステムの理論的根拠について説明している。論文の著者は、ロボットにより自然な動きを与えることで、ロボットが実世界のタスク、たとえばビルの異なる階層間でアイテムを配達するようなタスクを実行するのを助けることができると考える。
VentureBeatによると、研究チームはロボットを訓練するために強化学習を使用した。研究者は最初に、実際の動物の動きのクリップを収集し、強化学習(RL)技術を使用してロボットを動物の動きを模倣するように促した。この場合、研究者は、物理シミュレーターで設計された犬の動きのクリップを使用して、四本足のUnitree Laikagoロボットを訓練した。ロボットが訓練された後、ホッピング、ターン、迅速な歩行などの複雑な動きを、約2.6マイル/時という速度で実行できるようになった。
訓練データは、物理シミュレーションでトラックされた約2億の犬の動きのサンプルで構成されていた。さまざまな動きは、エージェントが学習した報酬関数とポリシーを通じて実行された。ポリシーがシミュレーションで作成された後、潜在的な空間適応という技術を使用して実世界に転送された。物理シミュレーターを使用してロボットを訓練することができるのは、実世界の動きのある側面のみであるため、研究者は、さまざまな条件下での操作をシミュレートするために、シミュレーションにさまざまな乱れをランダムに適用した。
研究チームによると、50回の試行から収集された8分間のデータを使用して、シミュレーションポリシーを実世界のロボットに適応させることができた。研究者は、実世界のロボットが、トロッティング、ターン、アラウンド、ホッピング、ペースなどのさまざまな動きを模倣できることを実証した。アニメーションアーティストによって作成されたアニメーション、たとえば、ホップとターンの組み合わせも模倣できることができた。
研究者は、論文で以下のようにまとめている。
「私たちは、リファレンス動きデータを活用することで、単一の学習ベースアプローチが、四本足ロボットのための多様な動きの自動生成を可能にすることを示した。サンプル効率的なドメイン適応技術をトレーニングプロセスに組み込むことで、私たちのシステムは、シミュレーションで学習したポリシーを、実世界の展開のために迅速に適応できる。」
強化学習プロセス中に使用された制御ポリシーには、制限があった。ハードウェアとアルゴリズムによって課せられた制約のため、ロボットができないことがいくつかあった。たとえば、走ることや大きなジャンプをすることができなかった。学習したポリシーは、手動で設計された動きと比較して、安定性があまり示されなかった。研究チームは、コントローラーをより堅牢で、さまざまな種類のデータから学習できるようにすることで、研究をさらに進めたいと考える。理想的には、将来のフレームワークバージョンは、ビデオデータから学習できるようになるだろう。










