Vordenker

Spielgenerierte Daten kÃķnnten die am wenigsten geschÃĪtzte Ressource in der AI-Schulung sein

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen

AI-Unternehmen haben in den letzten fÞnf Jahren jeden Text, jedes Bild und jeden Ãķffentlich verfÞgbaren Datenbestand im Internet konsumiert. Diese Ressourcen sind jedoch endlich, und wir nÃĪhern uns dem Punkt, an dem einfach nicht genug Daten vorhanden sind, um den Fortschritt aufrechtzuerhalten, auf den sie angewiesen sind.

Es gibt jedoch einen offensichtlichen Kandidaten, den die AI-Industrie weitgehend Þbersehen hat.

Ich baue Spiel-Systeme fÞr den Lebensunterhalt, und die Daten, die durch sie jeden Tag fließen, sind anders als alles, was die meisten AI-Forscher je bearbeitet haben. Und doch scheint fast niemand außerhalb der Spieleindustrie darauf zu achten.

Spieleplattformen generieren tÃĪglich Terabyte an Verhaltensdaten, strukturierte DatenstrÃķme aus Echtzeit-Entscheidungen, wirtschaftlicher AktivitÃĪt und sozialer Interaktion, alles innerhalb von Umgebungen, die auf konsistenten physikalischen Regeln basieren.

Fast keine dieser Daten wurden fÞr die AI-Schulung verwendet. Und die Unternehmen, die sie verwendet haben, von DeepMind bis NVIDIA, haben einige der bedeutendsten DurchbrÞche in diesem Bereich erzielt.

Das Datenproblem der KI

Eine Studie von Epoch AI prognostiziert, dass der Bestand an Ãķffentlich verfÞgbaren, von Menschen generierten Textdaten zwischen 2026 und 2032 vollstÃĪndig aufgebraucht sein wird. Die Modelle hinter ChatGPT, Gemini und Claude haben bereits im Wesentlichen alles konsumiert, was das Internet zu bieten hat.

Synthetische Daten oder Texte, die die KI generiert, um sie selbst zu fÞttern, sind die werkseitige LÃķsung der Branche. Aber Modelle, die auf ihren eigenen Ausgaben trainiert werden, verschlechtern sich im Laufe der Zeit durch ein dokumentiertes PhÃĪnomen, das Forscher Modellkollaps nennen.

Was ich glaube, dass das Feld benÃķtigt, ist eine reiche, interaktive, multimodale Information, bei der Ursache und Wirkung in Echtzeit auftreten und jede Aktion eine messbare Konsequenz hat. Spiele produzieren genau dies, und sie tun es in einem Maß, das fast nichts anderes erreichen kann.

Spieleplattformen verarbeiten tÃĪglich Terabyte an Verhaltensdaten durch ihre Systeme. Spielerbewegungen, strategische Entscheidungen, Reaktionszeiten, wirtschaftliche Transaktionen und soziale Interaktionen fließen alle durch strukturierte, zeitgestempelte DatenstrÃķme, die die meisten KI-Forscher noch nie berÞhrt haben.

Ein kÞrzlich verÃķffentlichtes akademisches Papier Þber spielgenerierte Daten legt eine neunkategoriale Taxonomie dieser Informationen vor und argumentiert, dass der grÃķßte Teil davon von der KI-Industrie noch nicht genutzt wird.

Ich kann das aus eigener Erfahrung bestÃĪtigen. Die Menge an Daten, die durch unsere Spiel-Systeme an jedem Tag fließt, wÞrde in jedem anderen Bereich der KI-Forschung als Goldmine angesehen werden. In Spielen wird sie jedoch einfach archiviert oder weggeworfen.

Warum Spiel-Daten anders sind

Wenn man lange genug in einer Spiel-Engine arbeitet, beginnt man zu realisieren, wie viel strukturierte Daten man sitzt, die niemand in der KI-Forschung je gefragt hat. Jede Sitzung produziert synchronisierte Physik, Spieler-Verhalten und System-Effekte in Echtzeit, alles innerhalb von Umgebungen, die auf konsistenten physikalischen Regeln basieren.

Spiel-Engines erzwingen Physik. Objekte fallen, kollidieren und brechen nach konsistenten Regeln, was bedeutet, dass die Daten kausale Beziehungen auf System-Ebene tragen, anstatt Muster, die ein Modell aus Text-Korrelationen erraten muss.

Wenn ein Spieler ein Projektil startet, berechnet die Engine die Flugbahn, den Windwiderstand und den Aufprall. Die KI lernt aus einer Umgebung, die Physik direkt durch jede Interaktion demonstriert, anstatt eine, die physikalische Gesetze als statistische Approximationen behandelt.

Es gibt auch das Problem der multimodalen Ausrichtung. In einem Spiel treten visuelle Daten, Audio-Signale, Spieler-Eingaben und Umgebungs-Zustand gleichzeitig auf und werden zusammen protokolliert. Diese Art von natÞrlicher Synchronisation kostet in realen DatensÃĪtzen, wo Forscher normalerweise jede ModalitÃĪt von Hand beschriften und ausrichten mÞssen, ein VermÃķgen.

Spiele produzieren auch RandfÃĪlle im großen Maßstab durch prozedurale Inhalts-Generierung. No Man’s Sky hat 18 Quintillionen einzigartige Planeten, und fÞr die KI ist diese Variation enorm wichtig, da RandfÃĪlle bestimmen, ob ein Modell zuverlÃĪssig funktioniert oder gefÃĪhrlich versagt.

Und dann gibt es die emergente KomplexitÃĪt, die vielleicht der wertvollste Aspekt von allen ist. Als OpenAI Agenten in ein einfaches Versteckspiel einsetzte, entwickelten diese Agenten sechs verschiedene Phasen einer komplexen Strategie vollstÃĪndig auf eigene Faust Þber Hunderte von Millionen Runden.

Sie bauten Schutzschilde aus beweglichen Objekten, nutzten Rampen, um Befestigungen zu durchbrechen, und nutzten sogar physikalische Fehler, um Kisten Þber WÃĪnde zu “surfen”. Nichts davon war programmiert. Alles entstand aus dem Wettbewerb innerhalb der Spiel-Umgebung, ohne eine einzige Zeile Code, die ihnen sagte, es zu tun.

Diese Art von selbstgenerierter KomplexitÃĪt ist genau das, was die KI-Forschung im großen Maßstab benÃķtigt, und Spiele sind die einzigen Umgebungen, die sie zuverlÃĪssig ohne teure menschliche Aufsicht produzieren.

Von Spielbrettern zu Nobelpreisen

Der eindeutigste Beweis dafÞr, dass spieltrainierte KI auf die reale Welt Þbertragbar ist, ist ein System, das einen Nobelpreis gewann, und es ist das Beispiel, auf das ich immer zurÞckkomme, wenn mich jemand fragt, warum ich meine Karriere auf Spiele und KI aufbaute.

DeepMind begann 2016 mit AlphaGo, dann baute es AlphaZero, ein System, das sich selbst das Schachspiel, Go und Shogi beibrachte, ohne menschliches Wissen. AlphaZeros Architektur wurde zur Grundlage fÞr AlphaFold, das das 50 Jahre alte Protein-Faltung-Problem lÃķste und seinen Erfindern den Nobelpreis fÞr Chemie 2024 einbrachte.

DeepMind-CEO Demis Hassabis hat sich offen Þber diese Pipeline geÃĪußert. Er erzÃĪhlte der Scientific American, dass Spiele nie das Endziel waren, sondern die effizienteste Methode, um KI-Techniken zu entwickeln und zu testen, bevor er sie auf reale wissenschaftliche Probleme anwendete.

Ich erinnere mich daran, dass ich das gelesen habe und fÞhlte, als hÃĪtte jemand genau das ausgedrÞckt, was ich aus der Perspektive der Spiel-Entwicklung heraus Þber Jahre gesehen hatte.

Diese Traektorie hat sich seither Þber das gesamte Feld wiederholt. Die VerstÃĪrkungs-Lern-Umgebungen, die OpenAI durch Gymnasium standardisierte, bilden nun die Grundlage fÞr Forschung in Robotik, autonomen Fahrzeugen und industrieller Automatisierung.

Die spiel-ÃĪhnliche Struktur aus Agent, Umgebung, Aktion und Belohnung begann als Forschungskonvention und ist nun zum Standard-Framework fÞr jedes KI-System geworden, das in der physischen Welt handeln muss.

Spiele als neue Simulations-Schicht

Im Dezember 2025 verÃķffentlichte NVIDIA NitroGen, ein Grundmodell, das auf 40.000 Stunden Spielzeit Þber mehr als 1.000 Titel trainiert wurde. Das Modell beobachtet Ãķffentlich verfÞgbare Spiel-Videos, extrahiert Spieler-Aktionen aus Controller-Überlagerungen und lernt, Spiele direkt aus rohen Pixeln zu spielen.

In Spielen, die es noch nie gesehen hatte, zeigte NitroGen bis zu 52% Verbesserung bei der Aufgaben-ErfÞllung im Vergleich zu Modellen, die von Grund auf trainiert wurden. Die wahre Bedeutung liegt jedoch in der Architektur darunter.

NitroGen lÃĪuft auf NVIDIAs GR00T-Robotik-Framework, demselben Fundament, das das Unternehmen fÞr physische KI und Sim-to-Real-Transfer in seiner Isaac-Sim-Plattform verwendet. Der Spiel-Agent und der Fabrik-Roboter teilen das gleiche zugrunde liegende System.

NVIDIAs Jim Fan beschrieb das Projekt als Versuch, “eine GPT fÞr Aktionen” zu bauen, ein allgemeines Modell, das in jeder Umgebung lernen kann zu handeln.

Als jemand, der Spiel-Systeme baut, die genau die Art von Daten produzieren, die diese Modelle konsumieren, finde ich es schwer, zu betonen, was das fÞr die Branche bedeutet, in der ich arbeite.

Und das ist nicht nur auf NVIDIA beschrÃĪnkt. Waymo hat Þber 20 Milliarden simulierter Meilen trainiert, um seine autonomen Fahrzeuge zu trainieren, alles in spiel-ÃĪhnlichen Umgebungen, die Szenarien wiederholen, die zu gefÃĪhrlich oder zu selten sind, um sie auf realen Straßen zu testen.

Chirurgische Plattformen, die auf Spiel-Engines basieren, haben dramatische Verbesserungen in der Leistung von Trainees gezeigt. Stadtplaner verwenden ÃĪhnliche Tools fÞr die Verkehrs-Optimierung auf Stadt-Ebene.

Chirurgische Plattformen, die auf Spiel-Engines basieren, haben dramatische Verbesserungen in der Leistung von Trainees gezeigt. Stadtplaner verwenden ÃĪhnliche Tools fÞr die Verkehrs-Optimierung auf Stadt-Ebene. Die Spiel-Engine ist zur universellen Simulations-Schicht geworden, wo immer die KI durch Interaktion mit ihrer Umgebung lernen muss.

Die Infrastruktur, Þber die niemand spricht

Wenn Menschen Þber KI-Infrastruktur sprechen, meinen sie normalerweise Rechenzentren, GPU-Cluster und Rechenleistung. In all den Jahren, die ich in der Spieleindustrie gearbeitet habe, kann ich an einer Hand die Anzahl der Male abzÃĪhlen, bei denen jemand in der KI-Branche Spiel-Umgebungen im gleichen Atemzug erwÃĪhnt hat. Diese Diskrepanz wird sehr schnell geschlossen werden.

Dies wird nur offensichtlicher, wenn traditionelle DatensÃĪtze aufgebraucht sind. Die Branchen, die die reichsten interaktiven Daten produzieren, werden unweigerlich in die Mitte der KI-Forschung rÞcken, und Spiele, Simulationen und virtuelle Welten sind besser positioniert als alles andere, um diese LÞcke zu fÞllen.

Das Geld folgt bereits dieser Trend. Der KI-Markt in der Spiele-Branche wurde 2025 auf 4,54 Milliarden Dollar bewertet und wird voraussichtlich bis 2035 auf 81 Milliarden Dollar ansteigen.

Die meisten Spiele-Entwickler, mit denen ich spreche, denken immer noch, sie seien Unterhaltungs-Unternehmen. Aber wenn Ihre Systeme die exakten Daten produzieren, die das nÃĪchste Generation von KI-Modellen benÃķtigt, um trainiert zu werden, sind Sie im Infrastruktur-GeschÃĪft, ob Sie es geplant haben oder nicht.

Ilman Shazhaev ist der GrÞnder und CEO von Dizzaract, dem grÃķßten Gaming-Studio in der MENA-Region. Er ist ein AI-Forscher und United-Nations-Experte im UNODC-Programm, der an der Schnittstelle von kÞnstlicher Intelligenz und realer Weltwirkung arbeitet.