AIモデルとプラットフォーム

Minecraftを模倣学習でマスターするAIの苦闘

mm
Unite.AI を Google の優先ソースに追加

過去数ヶ月間、Microsoftを含む機械学習を研究する企業が、Minecraftをプレイし、ダイヤモンドを見つけることができるAIシステムを作成するために、AI開発者チームに挑戦をしました。BBCの報道によると、AIプラットフォームはチェスや囲碁で優位性を示したものの、Minecraftのタスクをマスターするのに苦労しています。

MicrosoftのMinecraftベースのAIチャレンジは、MineRLと呼ばれ、競争結果は最近のNeurIPSカンファレンスで正式に発表されました。競争の目的は、AIを「模倣学習」のアプローチでトレーニングすることでした。模倣学習は、AIを観察を通じてトレーニングする方法です。模倣学習は、AIシステムが人間が行う行動を観察することで学習し、観察を通じて学習することを目的としています。模倣学習は、強化学習に比べて、はるかに計算コストが低く、効率的なAIトレーニング方法です。

強化学習には、多くの強力なコンピュータをネットワーク化し、数百または数千時間のトレーニングが必要です。一方、模倣学習でトレーニングされたAIは、既存の知識を基にトレーニングできるため、はるかに短時間でトレーニングできます。

模倣学習は、AIが安全に探索することができない状況で、AIをトレーニングするための実用的な応用があります。たとえば、自律車のトレーニングでは、車が目的の行動を学習するまでに、道路を自由に走行させることはできません。人間のデモストレーターのデータを使用して車をトレーニングすることで、プロセスを速くして安全にできます。

Minecraftでダイヤモンドを見つけるには、ツリーを切り倒してツールを作成したり、ダイヤモンドが含まれる洞窟を探索したり、洞窟内でダイヤモンドを見つけたりするなど、多くのステップを順序に実行する必要があります。ゲームに慣れた人間のプレイヤーであれば、約20分でダイヤモンドを見つけることができます。

660以上の異なるAIエージェントが競争に提出されましたが、ダイヤモンドを見つけることができるAIエージェントはありませんでした。AIをトレーニングするために提供されたデータは、多くの人間のプレイヤーから収集された60万フレーム以上のゲームプレイデータでした。ダイヤモンドの位置は、ゲームのインスタンスが開始されるたびにランダム化されるため、AIは人間のプレイヤーがダイヤモンドを見つけた場所を単純に探すことはできません。つまり、AIは、ツールを作成すること、ツールを使用すること、探索すること、リソースを見つけることなどの概念がどのように結びついているかを理解する必要があります。

AIエージェントがダイヤモンドを見つけることができなかったにもかかわらず、組織チームは競争の結果に満足し、多くのことが学びました。AIチームが行った研究は、AI分野を進歩させるのに役立つでしょう。

強化学習は、模倣学習よりも優れたパフォーマンスを示すことがあります。強化学習の著名な成功例の1つは、DeepMindのAlphaGoです。ただし、強化学習には大量の計算リソースが必要であり、大規模なコンピュータプロセッサを利用できない組織では使用できません。

Carnegie Mellon UniversityのPh.D.学生であり、競争の主催者であるWilliam Gussは、BBCに、MineRL競争は、計算コストの高いAIの代替手段を調査することを目的としたものであると説明しました。ガスは次のように述べています。

“…大量の計算リソースを問題に投入することは、必ずしも私たちが分野の最先端を推進するための正しい方法ではない… それは、強化学習システムへのアクセスを民主化することと正反対であり、大量の計算リソースを持つ企業に、複雑な環境でエージェントをトレーニングする能力を残すことになる。”

ブログ作家およびプログラマーで、 Machine Learning Deep Learning のトピックを専門としています。Danielは、AIの力を社会のために利用する手助けを他者に与えることを希望しています。