AIモデルとプラットフォーム
ディープマインド、強化学習AIの安全なトレーニング方法を発表
強化学習は、非常に複雑なタスクを処理できるAIを生み出すという、AI開発の有望な分野である。強化学習アルゴリズムは、モバイルロボティクスシステムや自動運転車などの開発に使用されている。しかし、強化学習のトレーニング方法のため、時々、予期せぬ奇妙な行動が現れることがある。これらの行動は危険であり、AI研究者はこの問題を「安全な探索」の問題と呼んでいる。これは、AIが安全でない状態の探索に陥ることを指している。
最近、GoogleのAI研究ラボであるDeepMindは、安全な探索問題に対処し、強化学習AIをより安全な方法でトレーニングする新しい方法を提案する論文を発表した。DeepMindが提案する方法は、報酬のハッキングや報酬基準のループホールにも対処する。
DeepMindの新しい方法には、安全でない行動が発生する可能性のある状況でAIの行動を導く2つのシステムがある。DeepMindのトレーニング技術で使用される2つのモデルは、生成モデルと前方ダイナミクスモデルである。これらのモデルは、安全性の専門家によるデモンストレーションや完全にランダムな車両の軌跡などのさまざまなデータでトレーニングされる。データは、監督者によって特定の報酬値でラベル付けされ、AIエージェントは最大の報酬を得るためにパターンを学習する。安全でない状態もラベル付けされ、モデルが報酬と安全でない状態を予測することができると、ターゲット行動を実行するためにデプロイされる。
研究チームは、論文の中で、可能な行動を一から作成し、望ましい行動を示し、これらの仮想的なシナリオを可能な限り情報に富んだものにすることを目的としていることを説明している。DeepMindチームは、このアプローチをReQueST、または報酬クエリ合成によるトラジェクトリーオプティマイゼーションと呼んでいる。
ReQueSTは、4つの異なるタイプの行動につながる可能性がある。最初の行動タイプは、アンサンブル報酬モデルの不確実性を最大化することを試みる。2番目と3番目の行動タイプは、予測された報酬を最小化および最大化することを試みる。予測された報酬は、モデルが誤って予測している行動を発見するために最小化される。一方、予測された報酬は、行動ラベルが最も情報量の高いものになるように最大化される。最後に、4番目の行動タイプは、トラジェクトリーの新規性を最大化することを試みる。これにより、モデルは報酬が投影されるかどうかに関係なく、探索を続けることができる。
モデルが望ましいレベルの報酬収集に達した後、計画エージェントが学習した報酬に基づいて決定を下す。モデル予測制御スキームにより、エージェントはダイナミックモデルを使用して予測された結果を予測し、安全でない状態を避けることができる。これは、純粋に試行錯誤で学習するアルゴリズムの行動とは対照的である。
VentureBeatの報道によると、DeepMindの研究者は、自分のプロジェクトが最初の強化学習システムであり、制御された、安全な方法で学習できるということを信じている。
「私たちの知る限り、ReQueSTは、安全にunsafe状態について学習し、高次元の連続状態を持つ環境でニューラルネットワーク報酬モデルをトレーニングする最初の報酬モデリングアルゴリズムである。現在のところ、私たちは、ReQueSTの有効性を、比較的シンプルなダイナミクスを持つシミュレートドメインでしか実証していない。将来的には、よりリアルな物理学と他のエージェントが環境で動作する3DドメインでReQueSTをテストすることができる。」












