AIモデルとプラットフォーム
マインクラフトのマシンラーニング競技会でAIが競争する

ネイチャー誌の報道によると、近くに開催される新しいAI競技会、MineRL競技会が、AIエンジニアやプログラマーに、観察と例から学習するプログラムを作成するよう奨励するものです。このAIシステムのテストケースは、人気の高いクラフトとサバイバルビデオゲーム、Minecraftになります。
人工知能システムは、ビデオゲームで最近いくつかの印象的な成果を上げています。たとえば、最近、AIがストラテジーゲームStarCraft IIで世界最高のプレイヤーを破りました。しかし、StarCraft IIには、AIが訓練に使用できる明確な目標があります。一方、Minecraftのような大規模なオープンワールドサンドボックスゲームをナビゲートすることは、はるかに困難なタスクです。研究者は、AIプログラムが観察と例から学習するのを助けることを目指しています。如果に成功すれば、AIプログラムの訓練に必要な処理能力を大幅に削減できる可能性があります。
競技会の参加者には、MinecraftでテストされるAIを作成するために4日間の時間が与えられます。AIの訓練には最大8百万ステップかかります。AIの目標は、ゲーム内でダイヤモンドを見つけることです。8百万ステップの訓練時間は、現在の強力なAIモデルを訓練するために必要な時間よりもはるかに短いので、参加者は現在の訓練方法を大幅に改善する方法を設計する必要があります。
参加者が使用しているアプローチは、模倣学習と呼ばれるタイプの学習に基づいています。模倣学習は、強化学習と対比されます。強化学習は、工場のロボットアームやStarCraft IIで人間のプレイヤーを破ることができるAIなどの高度なシステムを訓練するために使用される人気のある方法です。強化学習アルゴリズムの主な欠点は、訓練するために大量のコンピュータ処理能力を必要とすることです。数百または数千のコンピュータが結合して学習する必要があります。一方、模倣学習は、はるかに効率的で計算コストの低い訓練方法です。模倣学習アルゴリズムは、人間が観察から学習するように模倣しようとします。
カーネギーメロン大学のディープラーニング理論の博士課程のウィリアム・ガスは、ネイチャー誌に、環境を探索し、パターンを学習するAIを作成することは非常に困難なタスクであると説明しました。しかし、模倣学習は、AIに環境に関する基礎知識または良い事前の仮定を提供することで、訓練を大幅に迅速化できます。
Minecraftは、複数の理由で特に有用な訓練環境です。一つの理由は、Minecraftがプレイヤーに、シンプルなブロックを使用して複雑な構造やアイテムを作成できるようにすることです。これらの構造を作成するために必要な多くのステップは、研究者がメトリックとして使用できる具体的な進歩の指標となります。Minecraftは非常に人気があり、訓練データを収集することが比較的簡単です。MineRL競技会の主催者は、ツールを作成したりブロックを破壊したりするなどのタスクを実演するために、多くのMinecraftプレイヤーを募集しました。データの生成をクラウドソーシングすることで、研究者はゲーム内で取ることができる60百万のアクションの例を収集することができました。研究者は、約1000時間のビデオを競技会チームに提供しました。
カリフォルニア大学バークレー校のコンピューターサイエンスの博士課程のロヒン・シャーは、ネイチャー誌に、この競技会は、AIの訓練を加速するために、人間がすでに生成した知識を使用することを重点とする最初の競技会であると述べました。
ガスと他の研究者は、この競技会がMinecraftを超えた結果をもたらし、より優れた模倣学習アルゴリズムの開発につながり、より多くの人にAIの訓練としての模倣学習を検討させる可能性があると希望しています。この研究は、複雑で変化する環境で人間とよりよくやり取りできるAIを作成するのを助ける可能性があります。












