AIモデルとプラットフォーム
未来への考えを可能にするテクニック
MIT、MIT-IBM Watson AI Lab、他の機関の研究チームは、人工知能(AI)エージェントが遠い将来を考えることを可能にする新しいアプローチを開発しました。言い換えると、AIは、他のAIエージェントの行動を考慮して、タスクを完了するときに、遠い将来について考えることができます。
この研究は、Conference on Neural Information Processing Systemsで発表される予定です。
他のエージェントの将来の行動を考慮するAI
チームが作成したマシンラーニングフレームワークにより、協力または競争するAIエージェントは、他のエージェントが将来何をするかを考慮できます。これは、次のステップだけではなく、時間が無限大に近づくにつれてです。エージェントは、その行動を他のエージェントの将来の行動に適応させ、最適な長期的な解決策に到達するのを助けます。
チームによると、このフレームワークは、例えば、失われたハイカーを探すために共同で作業する一群の自律ドローンによって使用できます。また、乗客の安全性を向上させるために、他の車両の将来の動きを予測する自律走行車によっても使用できます。
Dong-Ki Kimは、MIT Laboratory for Information and Decision Systems(LIDS)の大学院生であり、研究論文の第一著者です。
「AIエージェントが協力または競争するときに、最も重要なのは、その行動が将来のある時点で収束することです。途中で無視できる一時的な行動が多くあります。私たちが本当に気にかけるのは、この収束した行動に到達することであり、数学的にそれを可能にする方法を今持っています。」
研究者们が解決しようとした問題は、多エージェント強化学習(multi-agent reinforcement learning)であり、強化学習は、AIエージェントが試行錯誤によって学習する機械学習の一種です。
複数の協力または競争するエージェントが同時に学習する場合、プロセスははるかに複雑になります。エージェントが他のエージェントの将来のステップや自分の行動、およびそれが他者に与える影響を考慮するにつれて、問題は計算能力が不足するようになります。
無限大を考えるAI
「AIは本当にゲームの終わりを考えるのですが、ゲームがいつ終わるかはわかりません。遠い将来に勝つために、行動を無限大に適応させる方法を考える必要があります。私たちの論文は、基本的に、AIが無限大を考える新しい目的を提案しています。」
アルゴリズムに無限大を組み込むことは不可能なので、チームは、エージェントが他のエージェントと行動が収束する将来のポイントに焦点を当てるようにシステムを設計しました。これは、均衡(equilibrium)と呼ばれ、均衡点はエージェントの長期的なパフォーマンスを決定します。
多エージェントシナリオでは、複数の均衡が存在する可能性があり、有効なエージェントが他のエージェントの将来の行動に積極的に影響を与えることができます。そうすると、エージェントの視点から望ましい均衡に到達できます。すべてのエージェントが相互に影響を与え合うと、一般的な概念である「積極的な均衡」に収束します。
FURTHERフレームワーク
チームのマシンラーニングフレームワークはFURTHERと呼ばれ、エージェントが他のエージェントとの相互作用に基づいて行動を調整して積極的な均衡を達成することを可能にします。
フレームワークは、2つのマシンラーニングモジュールに依存しています。最初のモジュールは、推論モジュールであり、エージェントが他のエージェントの将来の行動と、使用する学習アルゴリズムを、前の行動に基づいて推測することを可能にします。この情報は、エージェントが行動を適応させ、他のエージェントに影響を与えるために依存する強化学習モジュールにフィードされます。
「課題は無限大を考えることでした。実用化するために、多くの数学的なツールを使用し、ある程度の仮定を行う必要がありました。」
チームは、さまざまなシナリオでFURTHERを他の多エージェント強化学習フレームワークと比較してテストし、FURTHERを使用するAIエージェントが優れた結果を示しました。
アプローチは分散型なので、エージェントは独立して学習します。さらに、他の方法に比べてスケーラビリティに優れています。なぜなら、エージェントを制御する中央コンピュータが必要ないからです。
チームによると、FURTHERは、多エージェント問題の広範な分野で使用できます。Kimは、経済学におけるその応用に特に希望的です。ここでは、時間の経過とともに行動や利益が変化する多くの相互作用するエンティティが関与する状況で、健全な政策を開発するために使用できます。












