Ajatusjohtajat
Peliin generoitu data saattaa olla aliarvostetuin resurssi tekoälykoulutuksessa

Tekoälyyritykset ovat viettäneet viimeiset viisi vuotta kuluttamalla jokaisen tekstin, jokaisen kuvan ja jokaisen sirpin julkisesti saatavilla olevaa dataa internetissä. Tämä tarjonta on äärellinen, ja olemme tulossa siihen pisteeseen, jossa ei ole enää riittävästi dataa ylläpitämään edistymistä, josta se on tullut riippuvaiseksi.
On kuitenkin ilmeinen ehdokas, jota tekoälyteollisuus on suurelta osin laiminlyönyt.
Rakennan pelijärjestelmiä elinkeinona, ja data, joka virtaa niiden läpi joka päivä, on aivan erilaista kuin mitä useimmat tekoälytutkijat ovat koskaan työskennelleet. Ja kuitenkin lähes kukaan pelien ulkopuolella ei näytä kiinnittävän siihen huomiota.
Pelialustat generoivat teratavun käyttäytymisdataa joka päivä, järjestelmällisiä, aikaleimattuja päätöksiä, taloudellista toimintaa ja sosiaalista vuorovaikutusta, kaikki ympäristöissä, jotka on rakennettu johdonmukaisiin fysikaalisiin sääntöihin.
Lähes tämän datan osaa ei ole käytetty tekoälykoulutukseen. Ja niiden yritysten, jotka ovat käyttäneet sitä, kuten DeepMind ja NVIDIA (NVDA ), ovat tuottaneet joitain merkittävimmistä läpimurroista alalla.
Tekoälyn datongelma
Epoch AI:n tutkimus ennustaa, että julkisesti saatavilla oleva, ihmisten luoma tekstidatan varasto on täysin käytetty jossain vaiheessa vuosien 2026 ja 2032 välillä. ChatGPT:n, Gemini:n ja Claude:n taustalla olevat mallit ovat jo kuluttaneet käytännössä kaiken, mitä internet tarjoaa.
Synteettinen data tai teksti, jonka tekoäly generoi itselleen tekoälyyn syötettäväksi, on alan tyypillinen ratkaisu. Mutta mallit, jotka on koulutettu omalla tuotoksellaan, heikkenevät ajan myötä dokumentoidun ilmiön kautta, jota tutkijat kutsuvat mallikollapsiksi.
Mielestäni ala tarvitsee rikasta, interaktiivista, monitapaista tietoa, jossa syy ja seuraus tapahtuvat reaaliajassa ja jokaisella toiminnalla on mitattavissa oleva seuraus. Pelit tuottavat täsmälleen tätä, ja ne tekevät sen mittakaavassa, jota muu ei voi vastata.
Pelialustat puskevat teratavun käyttäytymisdataa järjestelmiinsä joka päivä. Pelaajien liikkeet, strategiset valinnat, reagointiajat, taloudelliset transaktiot ja sosiaaliset vuorovaikutukset kaikki virtaavat järjestelmällisiin, aikaleimattuihin virtoihin, joita useimmat tekoälytutkijat eivät ole koskaan kosketteleita.
Viimeaikainen akateeminen tutkimus peligeneroidusta datasta esittää yhdeksän kategorioiden taksonomian tälle tiedolle ja väittää, että suurin osa siitä on kokonaan käyttämätöntä tekoälyteollisuudessa.
Voin vahvistaa sen omasta kokemuksestani. Datamäärä, joka virtaa pelijärjestelmiämme läpi millä tahansa päivänä, olisi kultakaivos missä tahansa muualla tekoälytutkimuksessa. Peleissä se vain arkistoidaan tai hävitetään.
Miksi pelidata on erilaista
Kun rakennat pelimoottorissa riittävän kauan, alat ymmärtää, kuinka paljon järjestelmällistä dataa olet istumassa, jota kukaan tekoälytutkija ei ole vielä pyytänyt. Jokainen istunto tuottaa synchronoituja fysiikkaa, pelaajan käyttäytymistä ja järjestelmätasolla olevaa syy-seuraussuhdetta mittakaavassa, jota on vaikea löytää missä tahansa muualla.
Pelimoottorit pakottavat fysiikan noudattamista. Objektit putoavat, törmäilevät ja rikkoutuvat johdonmukaisiin sääntöihin, mikä tarkoittaa, että data sisältää kausaalisia suhteita järjestelmätasolla eikä malleja, jotka arvaavat niitä tekstikorrelaatioiden perusteella.
Kun pelaaja laukaisee projektiilin, moottori laskee sen radan, ilmanvastuksen ja iskun. Tekoäly oppii ympäristöstä, joka havainnollistaa fysiikkaa suoraan jokaisessa interaktiossa, eikä ympäristöstä, joka kohdeltaa fysikaalisia lakeja tilastollisina approksimaatioina.
On myös multimodaalinen kohdistusongelma. Pelissä visuaalidata, äänihavainnot, pelaajan syötteet ja ympäristön tila tapahtuvat samanaikaisesti ja kirjataan yhdessä. Tällaisen luonnollisen synchronisaation kustannukset ovat valtavat todellisissa tietokannoissa, joissa tutkijat yleensä on merkittävä ja kohdistettava jokainen modaalinen ominaisuus käsin.
Pelit tuottavat myös reunatapauksia mittakaavassa proseduraalisen sisällön generoinnin kautta. No Man’s Sky on 18 kvintiljoonaa ainutlaatuista planeettaa, ja tekoälylle tämä vaihtelu on valtavan tärkeää, koska reunatapaukset määräävät, toimivatko mallit luotettavasti vai vaarallisesti.
Ja sitten on emergentti monimutkaisuus, joka saattaa olla arvokkain ominaisuus. Kun OpenAI asetti agenteja yksinkertaiseen piilopeliin, ne kehittivät kuusi eri vaihetta monimutkaisia strategioita kokonaan itsenään satojen miljoonien kierrosten aikana.
Ne rakensivat suojia siirrettävistä objekteista, käyttivät rampeja rikkomaan linnoituksia ja jopa hyödynsivät fysiikkavirheitä surffatakseen laatikoita seinien yli. Mitään sitä ei ohjelmoitu. Se kaikki syntyi peliympäristön sisällä ilman yhtään koodiriviä, joka olisi kertonut heille tehdä sitä.
Tällainen itsegeneroitu monimutkaisuus on täsmälleen sitä, mitä tekoälytutkimukselle tarvitaan mittakaavassa, ja pelit ovat ainoat ympäristöt, jotka tuottavat sitä luotettavasti ilman kallista ihmisen valvontaa.
Pelilautoista Nobel-palkintoihin
Selvin todiste siitä, että pelikoulutettu tekoäly siirtyy todelliseen maailmaan, on järjestelmä, joka voitti Nobel-palkinnon, ja se on esimerkki, johon viittaan aina, kun minulta kysytään, miksi rakensin urani peleistä ja tekoälystä.
DeepMind aloitti AlphaGolla vuonna 2016, sitten rakensi AlphaZeron, järjestelmän, joka opetti itselleen shakin, gon ja shogin ilman mitään ihmistietämystä. AlphaZeron arkkitehtuuri muodosti perustan AlphaFoldille, joka ratkaisi 50-vuotiaan proteiinien taittumisen ongelman ja ansaitsi luojilleen vuoden 2024 Nobelin kemianpalkinnon.
DeepMindin toimitusjohtaja Demis Hassabis on ollut avoin tästä putkistosta. Hän kertoi Scientific Americanille, että pelit eivät olleet koskaan lopullinen tavoite, vaan ainoastaan tehokkain tapa kehittää ja testata tekoälytekniikoita ennen kuin hän sovelsi niitä todellisiin tieteellisiin ongelmiin.
Muistan lukeneeni siitä ja tuntieni, että joku oli sanonut täsmälleen sen, mitä olin nähnyt pelikehityksen sisältä vuosien ajan.
Tämä trajektoria on toistunut itsensä ympäri koko alalla. Vahvistusoppimisympäristöt, joita OpenAI ensin standardoi Gymnasiumissa, muodostavat nyt tutkimuksen perustan robotiikassa, itseohjautuvissa ajoneuvoissa ja teollisessa automaatiassa.
Pelien kaltaiset rakenteet, agenteista, ympäristöstä, toiminnasta ja palkkiosta, alkoivat tutkimuksen mukavuutena ja ovat sittemmin muodostuneet oletusarvoksi mille tahansa tekoälyjärjestelmälle, joka tarvitsee toimia fyysisessä maailmassa.
Pelit uutena simulaatiokerroksena
Joulukuussa 2025 NVIDIA julkaisi NitroGenin, perusmallin, joka on koulutettu 40 000 tunnin peliajasta yli 1000 pelin parissa. Malli katsuu julkisesti saatavilla olevia pelivideoita, poimii pelaajien toiminnat ohjaimen päällysteistä ja oppii pelaamaan pelejä suoraan raakapikseleistä.
Näkymättömissä peleissä, joissa se ei ollut koskaan aiemmin ollut, NitroGen näytti jopa 52 %:n parannuksen tehtävän onnistumisessa verrattuna malleihin, jotka on koulutettu alusta alkaen. Mutta todellinen merkitys piilee arkkitehtuurissa sen alla.
NitroGen toimii NVIDIA:n GR00T-robottiikkarakenteella, samalla perustalla, jota yhtiö käyttää fyysistä tekoälyä ja simulaatiosta-todellisuuteen-siirtymistä Isaac Sim -alustalla. Pelien agentti ja tehtaan robotti jakavat saman perusrakenteen.
NVIDIA:n Jim Fan kuvasi projektiin “toimintojen GPT:n” rakentamista, yleispätevää mallia, joka oppii toimimaan missä tahansa ympäristössä.
Kuten henkilö, joka rakentaa pelijärjestelmiä, jotka tuottavat tarkalleen sitä dataa, mitä nämä mallit kuluttavat, on minulle vaikea yliarvioida, mitä se merkitsee alalle, jossa työskentelen.
Ja tämä ei rajoitu NVIDIA:han. Waymo on kirjannut yli 20 miljardia simuloitua mailia kouluttaakseen itseohjautuvia ajoneuvojaan, kaikki pelimoottorityylisissä ympäristöissä, jotka harjoittelevat skenaarioita, jotka ovat liian vaarallisia tai liian harvinaisia testatakseen oikeilla teillä.
Kirurgiset alustat, jotka on rakennettu pelimoottorien päälle, ovat osoittaneet dramaattisia parannuksia koulutettujen suorituskyvyssä. Kaupunkisuunnittelijat käyttävät samankaltaisia työkaluja liikenneoptimoimiseksi kaupunkitasolla.
Kirurgiset alustat, jotka on rakennettu pelimoottorien päälle, ovat osoittaneet dramaattisia parannuksia koulutettujen suorituskyvyssä. Kaupunkisuunnittelijat käyttävät samankaltaisia työkaluja liikenneoptimoimiseksi kaupunkitasolla. Pelimoottori on muodostunut universaaliksi simulaatiokerrokseksi, missä tahansa, missä tekoäly tarvitsee oppia vuorovaikutuksen kautta ympäristönsä kanssa.
Infrastruktuuri, josta kukaan ei puhu
Kun ihmiset keskustelevat tekoälyinfrastruktuurista, he tarkoittavat yleensä datakeskuksia, GPU-klustereita ja laskentaa. Kaiken aikaa, jonka olen työskennellyt peleissä, voin laskea yhdellä kädelläni, kuinka monta kertaa joku tekoälytilassa on maininnut peliympäristöjä samassa hengenvedossa. Tämä eroavaisuus tulee sulkeutumaan hyvin nopeasti.
Tämä tulee olemaan vielä ilmeisempää, kun perinteiset tietokannat loppuvat. Teollisuudet, jotka tuottavat rikkaimman interaktiivisen datan, siirtyvät vääjäämättä tekoälytutkimuksen keskipisteeseen, ja pelit, simulaatiot ja virtuaalimaailmat ovat paremmin asemoituneet täyttämään tämän aukon kuin mikään muu.
Rahat seuraavat jo tätä trendiä. Tekoäly pelialalla arvioitiin 4,54 miljardiksi dollariksi vuonna 2025 ja on arvioitu saavuttavan 81 miljardia dollaria vuoteen 2035 mennessä.
Useimmat pelistudiot, joilla keskustelen, ajattelevat edelleen olevansa viihdeyhtiöitä. Mutta kun järjestelmäsi generoivat tarkalleen sen datan, jota seuraavan sukupolven tekoälymallit tarvitsevat koulutukseen, olet infrastruktuuriliiketoiminnassa, olitpa siitä tietoinen tai ei.












