AIモデルとプラットフォーム
ディープマインドの新しいAIは、ゲームをプレイしながらルールを学習することができる

アルファベットの子会社であるディープマインドは、ゲームをプレイしながらルールを学習することができるAIシステムを最近開発しました。ディープマインドは以前、チェス、将棋、囲碁、ビデオゲームなどのゲームをマスターすることができる印象的なAIモデルを作成しましたが、これらのモデルは事前にゲームのルールを提供する必要があります。したがって、ディープマインドの新しいAIは、以前のAIアルゴリズムよりも大きな改善を示しています。
AIシステム – MuZero
ディープマインドは、最近の論文で、新しいAIシステムの動作について詳細に説明しました。ネイチャー誌に掲載された論文によると、新しいAIシステムは、MuZeroと呼ばれます。MuZeroは、「先読み検索」と呼ばれる原理を使用して、ゲームをプレイしながらルールを学習することができます。 エンガジェットによると、MuZeroは先読み検索を使用して、対戦相手からの最も可能性の高い応答に基づいて、どの動作を実行するかを決定します。
チェスなどのゲームで可能な動作をすべて考慮する場合、MuZeroは最も可能性の高い動作と関連する動作に優先順位を付けます。MuZeroは、成功した動作と失敗した動作の両方から学習します。すべての要素をモデル化するのではなく、決定に関係する最も関連性の高い要素のみを考慮します。MuZeroは、潜在的な変数の多さを最も重要な特徴に絞り込むことができます。これらの特徴は、ツリー検索アルゴリズムで表現されます。ツリー内の可能性は、テスト環境の特徴に基づいて学習されたモデルと組み合わせられます。先読み検索は、環境の最も関連性の高い側面が特定された後に実行されます。
最終的な決定を下すために、3つの要素が考慮されます。
MuZeroは、前の選択の結果、現在の位置、次に取ることができる潜在的な動作を考慮します。このアプローチは、ディープマインドが以前使用していた基本的な先読み検索やツリー検索モデルよりも優れています。MuZeroは、AlphaZeroと同等以上の性能をチェス、将棋、囲碁で発揮し、Ms. Pac-Manをプレイしたときは、約6〜7手先までしか考慮できませんでしたが、それでも良好な性能を発揮しました。ディープマインドは、MuZeroの能力をテストするために、動作を決定する前に実行できるシミュレーションの数を制限しました。一般的に、プログラムが動作を考慮する時間が長いほど、性能が向上しました。
ディープマインドの主任研究科学者であるデビッド・シルバーは、テックエクスプロアによると、MuZeroは、環境のルールの表現を生成し、それを使用してアクションを計画する最初のAIモデルです。
「初めて、世界がどのように機能するかについての理解を構築し、チェスなどのゲームで見られるような高度な先読み計画を行うことができるシステムを持っています」とシルバーは述べました。 「(MuZero)は何もなしに開始し、試行錯誤を通じて、世界のルールを発見し、それらのルールを使用して超人的な性能を達成することができます。」
可能な応用
ルールを学習し、制約内で動作することができるAIは、さまざまな応用が可能です。MuZeroは、歴史的にAIを使用して自動化することが難しかったビデオ圧縮などのタスクに使用できます。MuZeroは、約5%の圧縮改善を達成しました。これは、GoogleとYouTubeがホストする多数のビデオに影響を及ぼす可能性があります。ビデオ以外に、ディープマインドは、同じMuZero技術を使用してタンパク質構造設計とロボティクスプログラミングにも取り組んでいます。
サウザンプトン大学のコンピューターサイエンス教授であるウェンディ・ホールによると、MuZeroは、強化学習アルゴリズムにとって「大きな前進」です。ただし、ホールは、アルゴリズムが誤用される可能性があることを心配しています。たとえば、米空軍は、MuZeroを使用してU-2偵察機からミサイルを発射することができるAIシステムを作成するために、既存の研究論文を参照しています。これは、ディープマインドの研究者が、致死的な自律兵器を使用しないことを約束し、致死的な技術が人間の管理下に留まるべきであると主張していることとは対照的です。
シルバーは、ディープマインドは、脳と同等の力と多様性を持つアルゴリズムを開発することを目指しています。柔軟で多様なアルゴリズムを作成するための第一歩は、システムがどのようにして知能を持つかを理解することであり、知能は、複雑な環境のパターンとルールを認識する能力と関連しています。












