Vordenker
Spielgenerierte Daten könnten die am wenigsten geschätzte Ressource in der AI-Schulung sein

AI-Unternehmen haben in den letzten fünf Jahren jeden Text, jedes Bild und jeden öffentlich verfügbaren Datenbestand im Internet konsumiert. Diese Ressourcen sind jedoch endlich, und wir nähern uns dem Punkt, an dem einfach nicht genug Daten vorhanden sind, um den Fortschritt aufrechtzuerhalten, auf den sie angewiesen sind.
Es gibt jedoch einen offensichtlichen Kandidaten, den die AI-Industrie weitgehend übersehen hat.
Ich baue Spiel-Systeme für den Lebensunterhalt, und die Daten, die durch sie jeden Tag fließen, sind anders als alles, was die meisten AI-Forscher je bearbeitet haben. Und doch scheint fast niemand außerhalb der Spieleindustrie darauf zu achten.
Spieleplattformen generieren täglich Terabyte an Verhaltensdaten, strukturierte Datenströme aus Echtzeit-Entscheidungen, wirtschaftlicher Aktivität und sozialer Interaktion, alles innerhalb von Umgebungen, die auf konsistenten physikalischen Regeln basieren.
Fast keine dieser Daten wurden für die AI-Schulung verwendet. Und die Unternehmen, die sie verwendet haben, von DeepMind bis NVIDIA (NVDA ), haben einige der bedeutendsten Durchbrüche in diesem Bereich erzielt.
Das Datenproblem der KI
Eine Studie von Epoch AI prognostiziert, dass der Bestand an öffentlich verfügbaren, von Menschen generierten Textdaten zwischen 2026 und 2032 vollständig aufgebraucht sein wird. Die Modelle hinter ChatGPT, Gemini und Claude haben bereits im Wesentlichen alles konsumiert, was das Internet zu bieten hat.
Synthetische Daten oder Texte, die die KI generiert, um sie selbst zu füttern, sind die werkseitige Lösung der Branche. Aber Modelle, die auf ihren eigenen Ausgaben trainiert werden, verschlechtern sich im Laufe der Zeit durch ein dokumentiertes Phänomen, das Forscher Modellkollaps nennen.
Was ich glaube, dass das Feld benötigt, ist eine reiche, interaktive, multimodale Information, bei der Ursache und Wirkung in Echtzeit auftreten und jede Aktion eine messbare Konsequenz hat. Spiele produzieren genau dies, und sie tun es in einem Maß, das fast nichts anderes erreichen kann.
Spieleplattformen verarbeiten täglich Terabyte an Verhaltensdaten durch ihre Systeme. Spielerbewegungen, strategische Entscheidungen, Reaktionszeiten, wirtschaftliche Transaktionen und soziale Interaktionen fließen alle durch strukturierte, zeitgestempelte Datenströme, die die meisten KI-Forscher noch nie berührt haben.
Ein kürzlich veröffentlichtes akademisches Papier über spielgenerierte Daten legt eine neunkategoriale Taxonomie dieser Informationen vor und argumentiert, dass der größte Teil davon von der KI-Industrie noch nicht genutzt wird.
Ich kann das aus eigener Erfahrung bestätigen. Die Menge an Daten, die durch unsere Spiel-Systeme an jedem Tag fließt, würde in jedem anderen Bereich der KI-Forschung als Goldmine angesehen werden. In Spielen wird sie jedoch einfach archiviert oder weggeworfen.
Warum Spiel-Daten anders sind
Wenn man lange genug in einer Spiel-Engine arbeitet, beginnt man zu realisieren, wie viel strukturierte Daten man sitzt, die niemand in der KI-Forschung je gefragt hat. Jede Sitzung produziert synchronisierte Physik, Spieler-Verhalten und System-Effekte in Echtzeit, alles innerhalb von Umgebungen, die auf konsistenten physikalischen Regeln basieren.
Spiel-Engines erzwingen Physik. Objekte fallen, kollidieren und brechen nach konsistenten Regeln, was bedeutet, dass die Daten kausale Beziehungen auf System-Ebene tragen, anstatt Muster, die ein Modell aus Text-Korrelationen erraten muss.
Wenn ein Spieler ein Projektil startet, berechnet die Engine die Flugbahn, den Windwiderstand und den Aufprall. Die KI lernt aus einer Umgebung, die Physik direkt durch jede Interaktion demonstriert, anstatt eine, die physikalische Gesetze als statistische Approximationen behandelt.
Es gibt auch das Problem der multimodalen Ausrichtung. In einem Spiel treten visuelle Daten, Audio-Signale, Spieler-Eingaben und Umgebungs-Zustand gleichzeitig auf und werden zusammen protokolliert. Diese Art von natürlicher Synchronisation kostet in realen Datensätzen, wo Forscher normalerweise jede Modalität von Hand beschriften und ausrichten müssen, ein Vermögen.
Spiele produzieren auch Randfälle im großen Maßstab durch prozedurale Inhalts-Generierung. No Man’s Sky hat 18 Quintillionen einzigartige Planeten, und für die KI ist diese Variation enorm wichtig, da Randfälle bestimmen, ob ein Modell zuverlässig funktioniert oder gefährlich versagt.
Und dann gibt es die emergente Komplexität, die vielleicht der wertvollste Aspekt von allen ist. Als OpenAI Agenten in ein einfaches Versteckspiel einsetzte, entwickelten diese Agenten sechs verschiedene Phasen einer komplexen Strategie vollständig auf eigene Faust über Hunderte von Millionen Runden.
Sie bauten Schutzschilde aus beweglichen Objekten, nutzten Rampen, um Befestigungen zu durchbrechen, und nutzten sogar physikalische Fehler, um Kisten über Wände zu “surfen”. Nichts davon war programmiert. Alles entstand aus dem Wettbewerb innerhalb der Spiel-Umgebung, ohne eine einzige Zeile Code, die ihnen sagte, es zu tun.
Diese Art von selbstgenerierter Komplexität ist genau das, was die KI-Forschung im großen Maßstab benötigt, und Spiele sind die einzigen Umgebungen, die sie zuverlässig ohne teure menschliche Aufsicht produzieren.
Von Spielbrettern zu Nobelpreisen
Der eindeutigste Beweis dafür, dass spieltrainierte KI auf die reale Welt übertragbar ist, ist ein System, das einen Nobelpreis gewann, und es ist das Beispiel, auf das ich immer zurückkomme, wenn mich jemand fragt, warum ich meine Karriere auf Spiele und KI aufbaute.
DeepMind begann 2016 mit AlphaGo, dann baute es AlphaZero, ein System, das sich selbst das Schachspiel, Go und Shogi beibrachte, ohne menschliches Wissen. AlphaZeros Architektur wurde zur Grundlage für AlphaFold, das das 50 Jahre alte Protein-Faltung-Problem löste und seinen Erfindern den Nobelpreis für Chemie 2024 einbrachte.
DeepMind-CEO Demis Hassabis hat sich offen über diese Pipeline geäußert. Er erzählte der Scientific American, dass Spiele nie das Endziel waren, sondern die effizienteste Methode, um KI-Techniken zu entwickeln und zu testen, bevor er sie auf reale wissenschaftliche Probleme anwendete.
Ich erinnere mich daran, dass ich das gelesen habe und fühlte, als hätte jemand genau das ausgedrückt, was ich aus der Perspektive der Spiel-Entwicklung heraus über Jahre gesehen hatte.
Diese Traektorie hat sich seither über das gesamte Feld wiederholt. Die Verstärkungs-Lern-Umgebungen, die OpenAI durch Gymnasium standardisierte, bilden nun die Grundlage für Forschung in Robotik, autonomen Fahrzeugen und industrieller Automatisierung.
Die spiel-ähnliche Struktur aus Agent, Umgebung, Aktion und Belohnung begann als Forschungskonvention und ist nun zum Standard-Framework für jedes KI-System geworden, das in der physischen Welt handeln muss.
Spiele als neue Simulations-Schicht
Im Dezember 2025 veröffentlichte NVIDIA NitroGen, ein Grundmodell, das auf 40.000 Stunden Spielzeit über mehr als 1.000 Titel trainiert wurde. Das Modell beobachtet öffentlich verfügbare Spiel-Videos, extrahiert Spieler-Aktionen aus Controller-Überlagerungen und lernt, Spiele direkt aus rohen Pixeln zu spielen.
In Spielen, die es noch nie gesehen hatte, zeigte NitroGen bis zu 52% Verbesserung bei der Aufgaben-Erfüllung im Vergleich zu Modellen, die von Grund auf trainiert wurden. Die wahre Bedeutung liegt jedoch in der Architektur darunter.
NitroGen läuft auf NVIDIAs GR00T-Robotik-Framework, demselben Fundament, das das Unternehmen für physische KI und Sim-to-Real-Transfer in seiner Isaac-Sim-Plattform verwendet. Der Spiel-Agent und der Fabrik-Roboter teilen das gleiche zugrunde liegende System.
NVIDIAs Jim Fan beschrieb das Projekt als Versuch, “eine GPT für Aktionen” zu bauen, ein allgemeines Modell, das in jeder Umgebung lernen kann zu handeln.
Als jemand, der Spiel-Systeme baut, die genau die Art von Daten produzieren, die diese Modelle konsumieren, finde ich es schwer, zu betonen, was das für die Branche bedeutet, in der ich arbeite.
Und das ist nicht nur auf NVIDIA beschränkt. Waymo hat über 20 Milliarden simulierter Meilen trainiert, um seine autonomen Fahrzeuge zu trainieren, alles in spiel-ähnlichen Umgebungen, die Szenarien wiederholen, die zu gefährlich oder zu selten sind, um sie auf realen Straßen zu testen.
Chirurgische Plattformen, die auf Spiel-Engines basieren, haben dramatische Verbesserungen in der Leistung von Trainees gezeigt. Stadtplaner verwenden ähnliche Tools für die Verkehrs-Optimierung auf Stadt-Ebene.
Chirurgische Plattformen, die auf Spiel-Engines basieren, haben dramatische Verbesserungen in der Leistung von Trainees gezeigt. Stadtplaner verwenden ähnliche Tools für die Verkehrs-Optimierung auf Stadt-Ebene. Die Spiel-Engine ist zur universellen Simulations-Schicht geworden, wo immer die KI durch Interaktion mit ihrer Umgebung lernen muss.
Die Infrastruktur, über die niemand spricht
Wenn Menschen über KI-Infrastruktur sprechen, meinen sie normalerweise Rechenzentren, GPU-Cluster und Rechenleistung. In all den Jahren, die ich in der Spieleindustrie gearbeitet habe, kann ich an einer Hand die Anzahl der Male abzählen, bei denen jemand in der KI-Branche Spiel-Umgebungen im gleichen Atemzug erwähnt hat. Diese Diskrepanz wird sehr schnell geschlossen werden.
Dies wird nur offensichtlicher, wenn traditionelle Datensätze aufgebraucht sind. Die Branchen, die die reichsten interaktiven Daten produzieren, werden unweigerlich in die Mitte der KI-Forschung rücken, und Spiele, Simulationen und virtuelle Welten sind besser positioniert als alles andere, um diese Lücke zu füllen.
Das Geld folgt bereits dieser Trend. Der KI-Markt in der Spiele-Branche wurde 2025 auf 4,54 Milliarden Dollar bewertet und wird voraussichtlich bis 2035 auf 81 Milliarden Dollar ansteigen.
Die meisten Spiele-Entwickler, mit denen ich spreche, denken immer noch, sie seien Unterhaltungs-Unternehmen. Aber wenn Ihre Systeme die exakten Daten produzieren, die das nächste Generation von KI-Modellen benötigt, um trainiert zu werden, sind Sie im Infrastruktur-Geschäft, ob Sie es geplant haben oder nicht.












