ロボティクスとフィジカルAI
コンピュータ科学者はロボットに新しいスキルを教えるためにポジティブな強化を使用する
ジョンズ・ホプキンス大学のコンピュータ科学者は、犬などの動物を訓練するためによく使用される長期にわたる訓練テクニックであるポジティブな強化をロボットに適用し、新しいスキルを自分で教えることができるようにしました。そうした新しいスキルの中には、ブロックを積み上げる能力がありました。
ロボットの名前はスポットで、研究者によると、従来約1ヶ月かかっていたスキルを数日で習得することができます。
ポジティブな強化
チームは、ロボットのスキルセットを増やすためにポジティブな強化を使用しました。このスピードでチームがこれを行うことができるため、このようなロボットを現実の世界で展開することが容易になります。
この研究は、IEEE Robotics and Automation Lettersに「Good Robot!:Efficient Reinforcement Learning for Multi-Step Visual Tasks with Sim to Real Transfer」というタイトルで発表されました。
アンドリュー・ハントはジョンズ・ホプキンス大学の博士課程の学生であり、この研究の第一著者です。
「ここでの質問は、ロボットがスキルを習得する方法は何かということです」と彼は述べました。「私は犬を飼ったことがあり、報酬が効果的であることを知っているので、学習アルゴリズムを設計する際のインスピレーションとなりました。」
コンピュータが直感的な脳を持たないため、ポジティブな強化がコンピュータで機能する理由の1つは、基本的に空のキャンバスであるため、そこに何でも投影できることです。つまり、コンピュータは何からも学習しなければなりません。コンピュータの最も効果的な学習方法の1つは試行錯誤であり、ロボット工学者は現在もこれに取り組んでいます。
これは、研究者がロボット用の報酬システムを作成したときに実際に起こったことです。犬を訓練するときと同様に、ロボットはタスクを正しく完了すると数値ポイントを獲得します。
https://www.youtube.com/watch?v=dvxqjJBWFD4
習得したスキル
ブロックを積み上げる方法を習得する際、ロボットは構築的な行動に焦点を当てる必要がありました。この方法では、スポットロボットはブロックを積み上げる際に正しい行動をとると、高いポイントを獲得しました。一方、不正な行動ではポイントを獲得しませんでした。4つのブロックを積み上げ、最後のブロックを上に置くことで、最も高いポイントを獲得しました。
研究者はこの方法で大きな成功を収め、ロボットは数日で何週間もかかっていたスキルを習得することができました。シミュレートされたロボットを訓練することで、チームはスポットロボットに移行する前に練習時間を短縮することができました。
「ロボットは高いスコアを望みます」とハントは述べました。「ロボットはすぐに最も良い報酬を得るための正しい行動を学習します。実際、ロボットが100%の精度でタスクを完了するには1ヶ月の練習が必要でしたが、2日で達成することができました。」
ブロックを積み上げる方法を習得する以外に、ロボットはポジティブな強化を使用して、シミュレートされたナビゲーションゲームをプレイする方法など、他のタスクも習得しました。
「最初はロボットは何をしているのかわかりませんが、練習を重ねるごとに上手になります。ロボットは決して諦めず、ブロックを積み上げ続け、100%の確率でタスクを完了することができます」とハントは述べました。
この方法の可能な応用例には、家庭用ロボットを特定のタスクに訓練することや、自動運転車の改善が含まれます。
「最終的には、製品の組み立て、介護、手術など、現実の世界で複雑なタスクを実行できるロボットを開発したい」とヘイガーは述べました。「現在、これらのタスクをプログラムする方法はわかっていません。世界は複雑すぎます。しかし、このような研究は、ロボットが安全で効率的な方法で現実の世界のタスクを習得できるという考えに期待を持たせます。」












