AIモデルとプラットフォーム

DeepMindとGoogle Brain、強化学習の効率化方法の開発を目指す

mm
Unite.AI を Google の優先ソースに追加

強化学習システムは、数千回のトレーニングを経て非常に複雑なタスクを実行することができる強力でロバストなシステムです。しかし、強化学習アルゴリズムは高度で時には驚くべき動作を可能にすることができますが、トレーニングには長い時間がかかり、大量のデータが必要です。これらの要因により、強化学習技術はかなり非効率的であり、最近、AlphabetのDeepMindとGoogle Brainの研究チームは、強化学習システムの作成をより効率化する方法を見つけることを目指しています。

VentureBeatによると、共同研究グループは最近、強化学習トレーニングをより効率化する方法を提案しました。提案された改善策の1つは、Adaptive Behavior Policy Sharing (ABPS)と呼ばれるアルゴリズムでした。もう1つは、Universal Value Function Approximators (UVFA)と呼ばれるフレームワークでした。ABPSは、AIエージェントのプールが適応的に選択された経験を共有できるようにします。一方、UVFAは、AIエージェントが同時に指示された探索ポリシーを調査できるようにします。

ABPSは、モデルをトレーニングする際のハイパーパラメータのカスタマイズを迅速化することを目的としています。ABPSは、さまざまなハイパーパラメータを持つ複数のエージェントが動作ポリシーの経験を共有できるようにすることで、最適なハイパーパラメータをより迅速に見つけることができます。具体的には、ABPSは、強化学習エージェントがポリシーによって許可されたアクションから選択し、次にその後の状態に基づいて報酬と観測結果が与えられるようにします。

AI強化学習エージェントは、減衰率や学習率などのさまざまなハイパーパラメータの組み合わせでトレーニングされます。モデルをトレーニングする際の目標は、モデルがハイパーパラメータの組み合わせに収束し、データ効率も向上するようにすることです。効率は、同時に多くのエージェントをトレーニングし、次の時間ステップでデプロイされるエージェントの動作のみを選択することによって向上します。ターゲットエージェントのポリシーは、アクションをサンプリングするために使用されます。遷移は共有スペースにログされ、このスペースはポリシーの選択が頻繁に発生しないように定期的に評価されます。トレーニングの終了時に、エージェントのアンサンブルが選択され、トップパフォーマンスのエージェントが最終的なデプロイメントのために選択されます。

UVFAについては、強化学習の一般的な問題である、弱く強化されたエージェントがタスクを学習しない問題に対処しようとしています。UVFAは、エージェントが同時に探索と搾取のポリシーの別々のセットを学習することでこの問題を解決しようとしています。タスクを分離することで、探索ポリシーが環境を継続的に探索できるフレームワークが作成され、搾取ポリシーが現在のタスクの報酬を最大化しようとします。UVFAの探索ポリシーは、基準となるアーキテクチャとして機能し、自然な報酬が見つからない場合でも改善を続けます。このような状況では、内在的な報酬に対応する関数が近似され、エージェントが環境内のすべての状態を探索するように促します。

VentureBeatによると、UVFAフレームワークが使用されている場合、システムの内在的な報酬がエージェントに直接入力されます。エージェントは、エピソード中のすべての入力(報酬、アクション、状態など)の表現を保持します。結果として、報酬は時間の経過とともに保持され、エージェントのポリシーは常にそれによって少なくともある程度情報が提供されます。

これは、「エピソードの新規性」と「生涯の新規性」と呼ばれる2つのモジュールを使用して実現されます。最初のモジュールの機能は、現在のエピソードのメモリを保持し、前の表現に現在の発見をマッピングすることです。これにより、エージェントはトレーニングの各ステップに対して内在的なエピソード報酬を決定できます。次に、現在の観測結果に関連付けられた状態がメモリに追加されます。一方、生涯の新規性モジュールは、エージェントが複数のエピソードを通じてどれだけ頻繁に探索するかを影響します。

Alphabet (GOOG ) (GOOGL ) /Googleチームによると、新しいトレーニング技術は、強化学習システムのトレーニングにおいて大幅な改善の可能性をすでに示しています。UVFAは、一部の基礎エージェントがさまざまなAtariゲームで2倍のパフォーマンスを発揮できるようにしました。一方、ABPSは、一部の同じAtariゲームでパフォーマンスを向上させ、トップパフォーマンスのエージェント間の分散を約25%減少させることができました。UVFAトレーニング済みアルゴリズムは、Pitfallで高いスコアを達成できました。人間のデモの工学的特徴がなく、独自に達成しました。

ブログ作家およびプログラマーで、 Machine Learning Deep Learning のトピックを専門としています。Danielは、AIの力を社会のために利用する手助けを他者に与えることを希望しています。