AIモデルとプラットフォーム

AI 研究者が開発したビデオゲーム プレーヤーモデルは、過去のイベントを記憶できる

mm
Unite.AI を Google の優先ソースに追加

Uber の AI 研究所の研究チームは最近、システムを開発しました。クラシックなアタリービデオゲームで、人間のプレイヤーや他の AI システムを上回る AI アルゴリズムです。研究者们が開発した AI システムは、過去に成功した戦略を記憶し、新しい戦略を過去の成功に基づいて作成することができます。研究チームは、開発したアルゴリズムが言語処理やロボティクスなどの他の技術分野に応用できる可能性があると考えています。

ビデオゲームをプレイできる AI システムを作成するための一般的な方法は、強化学習アルゴリズムを使用することです。強化学習アルゴリズムは、可能な行動の範囲を探索し、各行動の後に報酬または罰を与えられます。時間の経過とともに、AI モデルはより大きな報酬につながる行動を学習し、それらの行動を実行する可能性が高くなります。ただし、強化学習モデルは、他のデータポイントと一貫性のないデータポイントに遭遇したときに困難に直面します。

研究チームによると、彼らのアプローチが他の AI 研究者によって検討されなかった理由は、戦略が通常の「内発的動機」アプローチと異なるためです。内発的動機アプローチの問題は、モデルが潜在的に報酬のある領域を「忘れる」可能性があることです。この現象は「脱落」と呼ばれます。結果として、モデルは予期せぬデータに遭遇したときに、まだ探索する必要のある領域を忘れる可能性があります。

TechXploreによると、研究チームは、予期せぬデータに応じて柔軟に反応できる学習モデルを作成しようとしました。研究者们は、過去のモデルが問題を解決しようとしたときに取ったすべての行動を記憶できるアルゴリズムを導入することで、この問題を解決しました。AI モデルは、データポイントが一貫性のないものに遭遇したときに、そのメモリーマップを確認します。モデルは、どの戦略が成功し、どれが失敗したかを識別し、戦略を適切に選択します。

ビデオゲームをプレイするとき、モデルはゲームのスクリーンショットを収集し、ログを作成します。画像は類似性に基づいてグループ化され、モデルが参照できる明確な時点が形成されます。アルゴリズムは、ログに記録された画像を使用して、興味深い時点に戻り、そこから探索を続けることができます。モデルが負けていることを発見したとき、スクリーンショットに戻って別の戦略を試みます。

BBCによると、ゲームをプレイする AI エージェントが危険なシナリオに遭遇する問題もあります。エージェントが致命的なハザードに遭遇した場合、さらに探索する必要のある領域に戻ることができなくなります。これは「脱線」と呼ばれる問題です。AI モデルは、別のプロセスを使用して脱線問題を処理します。

研究チームは、モデルを 55 のアタリーゲームでプレイさせました。これらのゲームは、AI モデルのパフォーマンスをベンチマークするために一般的に使用されますが、研究者们はモデルに追加のルールを導入しました。モデルは、可能な限り高いスコアを達成するだけでなく、毎回さらに高いスコアを達成するように指示されました。モデルのパフォーマンスの結果を分析した研究者们は、モデルの AI システムが他の AI システムよりも約 85% の時間でゲームで勝利したことを発見しました。AI は特に Montezuma’s Revenge というゲームで優れており、プレイヤーはハザードを避けながら宝物を集めます。ゲームは、人間のプレイヤーと他の AI システムの記録を上回りました。

Uber の AI 研究者によると、研究チームが使用した戦略は、ロボティクスなどの産業に応用できる可能性があります。ロボットは、どの行動が成功したか、どれが失敗したか、どれがまだ試されていないかを記憶する能力から利益を得ます。

ブログ作家およびプログラマーで、 Machine Learning Deep Learning のトピックを専門としています。Danielは、AIの力を社会のために利用する手助けを他者に与えることを希望しています。