ソートリーダー

ゲーム生成データがAIトレーニングで最も過小評価されているリソースである可能性がある

mm
Unite.AI を Google の優先ソースに追加

AI企業は、過去5年間にインターネット上のすべてのテキスト、画像、公開可能なデータを消費してきた。しかし、その供給は有限であり、AIの進歩を支えるデータが不足する時期が近づいている。

しかし、AI業界がほとんど見落としている明らかな候補がある。

私はゲームシステムを構築することを生業としており、ゲームを介して流れるデータは、ほとんどのAI研究者が扱ったことがないものである。

ゲームプラットフォームは毎日テラバイト規模の行動データを生み出す。リアルタイムの判断、経済活動、社会的交流が、一貫した物理法則に基づく環境の中で構造化されたストリームとして記録される。

これらのデータのほとんどは、AIトレーニングに使用されたことがない。DeepMindやNVIDIA (NVDA ) などの企業がこれらのデータを使用した結果、AI分野で最も重要なブレークスルーが生まれている。

AIのデータ問題

Epoch AIの研究によると、2026年から2032年の間に、公開可能な人間生成テキストデータのストックが完全に使用され尽くされることが予測されている。ChatGPT、Gemini、Claudeなどのモデルは、すでにインターネット上のすべてのデータを消費している。

AIが生成したシンセティックデータやテキストは、AIのワークアラウンドとして使用されている。しかし、モデルが自身の出力をトレーニングデータとして使用すると、モデル崩壊と呼ばれる現象が発生する。

私は、ゲームが提供するような、インタラクティブで多様な情報が必要である。ゲームは、物理的なルールに基づいた環境で、causeとeffectがリアルタイムで発生し、すべての行動が測定可能な結果をもたらす。

ゲームプラットフォームは、毎日テラバイトの行動データを生成し、プレイヤーの動き、戦略的選択、反応時間、経済的取引、社会的相互作用が構造化されたストリームで流れる。

最近の研究では、ゲーム生成データの9つのカテゴリを提案し、AI業界がこれらのデータをほとんど利用していないことを示している。

私は、これらのデータの量が、ゲーム業界では日常的にアーカイブまたは破棄されるものであることを確認している。

ゲームデータの違い

ゲームエンジンを使用して構築することで、AI研究者が扱ったことがないような構造化されたデータが大量に存在することがわかる。

ゲームエンジンは物理的なルールを適用し、オブジェクトは落下し、衝突し、破壊される。データは、モデルが推測するのではなく、システムレベルで因果関係を含む。

プレイヤーがプロジェクトを発射すると、エンジンは軌道、風抵抗、衝撃を計算する。AIは、物理的なルールが適用された環境で学習する。

ゲームでは映像、音声の合図、プレイヤー入力、環境状態が同時に発生し、一緒に記録される。この自然な同期を現実世界のデータセットで再現するには、研究者が各モダリティを手作業でラベル付けして整列させる必要があり、多額の費用がかかる。

ゲームは、エッジケースを大量に生成する。No Man’s Skyには18京個のユニークな惑星があり、AIにとってこれらのバリエーションは非常に重要である。

さらにゲームは創発的な複雑性を生み出す。OpenAIがエージェントを単純なかくれんぼ環境に置いた実験では、数億ラウンドを通じて六つの高度な戦略段階が自発的に現れた。

エージェントは動かせる物体で砦を作り、坂を使って防御を突破し、物理エンジンの不具合を利用して箱に乗り壁を越えることまで学んだ。どの行動も個別にプログラムされたものではなく、ゲーム内競争から生じた。この自己生成型の複雑性こそAI研究が大規模に必要としているもので、ゲームは高価な人間の監督なしにそれを安定して生み出せる。

これらの複雑な戦略は、ゲーム環境内で自発的に発生する。AI研究では、ゲームが提供するような、インタラクティブで多様なデータが必要である。

ゲームボードからノーベル賞まで

ゲームでトレーニングされたAIが現実世界で有効であることを示す最も明確な証拠は、ノーベル賞を受賞したシステムである。

DeepMindは2016年のAlphaGoに続き、人間の棋譜を使わずチェス、囲碁、将棋を独学したAlphaZeroを開発した。そのアーキテクチャはAlphaFoldの土台となり、50年来のタンパク質折り畳み問題を解いて、開発者に2024年ノーベル化学賞をもたらした。

CEOのDemis Hassabisは、ゲーム自体が最終目的ではなく、現実の科学問題へ応用する前にAI技術を開発・検証する最も効率的な手段だったと説明している。ゲームで標準化された「エージェント、環境、行動、報酬」の構造は、今やロボット、自動運転、産業オートメーション研究の基本枠組みになった。

DeepMindのCEO、Demis Hassabisは、ゲームはAIの開発とテストのための最も効率的な方法であると述べている。

私は、ゲーム開発の内部からこれらのデータを観察してきた。ゲームは、AIが必要とするデータを生成するインフラストラクチャである。

新しいシミュレーション層としてのゲーム

2025年12月、NVIDIAは、NitroGenをリリースし、40,000時間のゲームプレイデータを使用してトレーニングされたモデルを開発した。

NVIDIAが2025年12月に公開したNitroGenは、1,000以上のゲームから集めた4万時間のプレイ映像で学習した基盤モデルだ。公開動画とコントローラー表示から行動を抽出し、生の画素からゲーム操作を学ぶ。未経験のゲームではゼロから学習したモデルに比べ、タスク成功率を最大52%向上させた。

NitroGenは、NVIDIAがIsaac Simで物理AIとシミュレーションから現実への移行に使うGR00Tロボティクス基盤上で動く。つまりゲームエージェントと工場ロボットは同じ基礎システムを共有する。Jim Fanがこれを「行動のGPT」と表現したのは、あらゆる環境で操作を学ぶ汎用モデルを目指しているからだ。

この動きはNVIDIAに限らない。Waymoは現実の道路で試すには危険すぎる、または希少すぎる状況をゲームエンジン型の環境で再現し、自動運転車の学習に200億マイルを超えるシミュレーション走行を蓄積している。

ゲームエンジンは、外科手術のプラットフォームや都市計画のツールとしても使用されている。ゲームエンジンは、AIが学習するためのユニバーサルなシミュレーション層となっている。

誰も話さないインフラストラクチャ

AIのインフラストラクチャについて話すとき、データセンター、GPUクラスター、コンピューティングパワーについて話すことが多い。しかし、ゲーム環境について話すことはほとんどない。

AIインフラといえば通常、データセンターやGPUクラスター、計算資源を指す。だが従来型データセットが枯渇すれば、豊かな対話データを生むゲーム、シミュレーション、仮想世界がAI研究の中心へ移るのは避けられない。ゲーム業界は、次世代AIが必要とするデータを生成するインフラなのである。

AIゲーム市場は、2025年には45.4億ドルで、2035年には810億ドルに達することが予測されている。ゲームスタジオは、エンターテインメント企業と見なされているが、AIの次の世代のモデルが必要とするデータを生成するインフラストラクチャである。

イルマン・シャザエフは、Dizzaractの創設者兼CEOです。Dizzaractは、MENA地域で最大のゲームスタジオです。彼は、人工知能と現実世界の影響の交差点で働く、国連の専門家であり、UNODCプログラムの下で人工知能の研究者でもあります。