AIモデルとプラットフォーム
AIエージェントはバーチャルな隠れんぼでエマージェントな知能特性を示した
AIを研究することの興味深い事実の1つは、AIが自身を設計した研究者たちに驚かせるような行動や戦略をとることができるということである。これは、最近のバーチャルな隠れんぼのゲームで起こった。サンフランシスコを拠点とするAI企業OpenAIの研究者たちは、自身のAIエージェントが予想外の戦略を採用したことを発見した。これらの戦略は、研究者たちがゲーム世界で可能であるとは思っていなかったものであった。
OpenAIは、AIエージェントのグループを互いに隠れんぼをさせるために訓練した。AIプログラムは、強化学習という手法で訓練された。強化学習では、AIアルゴリズムに望ましい行動を引き出すために、フィードバックを提供する。AIはランダムな行動から始め、毎回目標に近づく行動をとると、エージェントは報酬を得る。AIは可能な限り多くの報酬を得ることを望むため、どのような行動が最も報酬をもたらすかを試行錯誤する。試行錯誤を通じて、AIは勝利に導く戦略や最も報酬をもたらす戦略を発見することができる。
強化学習は、ゲームのルールを学ぶことにおいてすでに印象的な成果を示している。OpenAIは最近、AIチームをMMORPG DOTA 2でプレイさせるために訓練した。AIは去年、人間のプレイヤーたちによる世界チャンピオンチームを破った。同様のことが、DeepMindによってゲームStarCraftでAIを訓練したときにも起こった。強化学習は、AIプログラムをピクチャーを解釈し、基本的な共通の推論を使用するように訓練するために、ピクチャーを使用したゲームピクチャーで人間とプレイさせるために使用された。
研究者たちによって作成されたバーチャルな隠れんぼのゲームでは、複数のAIエージェントが互いに対戦した。結果は、各エージェントが他のエージェントを上回り、最も多くの報酬ポイントを得ることを目指す、ある種の軍拡競争となった。OpenAIの研究者であるIgor Mordatchは、IEEE Spectrumに対して、この実験は、エージェント同士の試行錯誤のプロセスが「エージェントが独自に驚くべき行動を学ぶのに十分であることを示している」と説明した。「それは、子供たちが互いに遊ぶのと同じだ。」
どのような驚くべき行動であったかというと、研究者たちは、AIエージェントが4つの基本的な戦略を学ぶことを期待していた。これらの戦略は、25百万のシミュレートゲームの後には比較的簡単に学ばれた。ゲームは、ランプ、ブロック、壁で満たされた3D環境で行われた。AIエージェントは、互いに追跡し、ブロックを移動して隠れるための要塞を築くことを学んだ。AIの探索者は、ランプを引いて要塞の中に入ることを学んだ。一方、隠れんぼのエージェントは、探索者がランプを使用できないように、ランプを要塞の中に引いておくことを学んだ。
しかし、約3億8千万ゲームのベンチマークで、予想外のことが起こった。AIエージェントは、研究者たちが予想していなかった2つの戦略を学んだ。探索者エージェントは、箱に乗って箱を近くの要塞に向けて傾けることで、要塞の中に入り、隠れんぼのエージェントを見つけることができることを学んだ。研究者たちは、これがゲーム環境の物理的な制約内で可能であるとは気づいていなかった。隠れんぼのエージェントは、この問題に対処するために、箱を要塞の中に引いておくことを学んだ。
この隠れんぼゲームでの強化学習アルゴリズムの予想外の行動は、この場合には無害であるが、他の状況での強化学習の適用について潜在的な懸念を引き起こす。OpenAIの研究チームのメンバーであるBowen Bakerは、IEEE Spectrumに対して、これらの予想外の行動が潜在的に危険であることを説明した。ロボットが予想外の行動をとり始めたらどうなるだろうか?
「これらの環境を構築することは難しい」とBakerは説明した。「エージェントは、これらの予想外の行動を生み出すだろう。これは、将来的に、より複雑な環境で使用されたときに、安全性の問題となるだろう。」
しかし、Bakerは、強化学習戦略が現在の問題に対する革新的な解決策につながる可能性があることも説明した。強化学習で訓練されたシステムは、想像できない解決策をもたらす幅広い問題を解決することができる。












