AI-mallit ja alustat
Tekoälyt kilpailevat Minecraftin koneoppimiskilpailussa

Kuten Nature-lehdessä ilmoitettiin, uusi tekoälykilpailu on tulossa, MineRL-kilpailu, joka rohkaisee tekoälyinsinöörejä ja koodareita luomaan ohjelmia, jotka pystyvät oppimaan havainnon ja esimerkin kautta. Näiden tekoälyjärjestelmien testitapauksena toimii erittäin suosittu crafting- ja selviytymispeli Minecraft.
Teckoälyjärjestelmien on saavutettu joitakin vaikuttavia saavutuksia viime aikoina, kun on kyse videopeleistä. Juuri äskettäin tekoäly voitti maailman parhaat pelaajat strategiapelissä StarCraft II. StarCraft II:lla on kuitenkin määriteltävissä olevat tavoitteet, jotka voidaan helpommin jakaa koherenttiin askeliin, joita tekoäly voi käyttää koulutukseen. Paljon haasteellisempaa on, kun tekoäly oppii navigoimaan suuressa, avoimessa hiekkalaatikkopelissä kuten Minecraft. Tutkijat pyrkivät auttamaan tekoälyohjelmia oppimaan havainnon ja esimerkin kautta, ja jos he onnistuvat, he voivat merkittävästi vähentää tekoälyohjelman koulutukseen tarvittavaa prosessointitehoa.
Kilpailun osallistujilla on neljä päivää aikaa luoda tekoäly, joka testataan Minecraftilla, joka kestää jopa kahdeksan miljoonaa askelta kouluttaa tekoäly. Tekoälyn tavoitteena on löytää timantti pelistä kaivamalla. Kahdeksan miljoonan askeleen koulutusaika on paljon lyhyempi kuin nykyisten voimakkaiden tekoälymallien koulutukseen tarvittava aika, joten kilpailun osallistujien on keksittävä menetelmiä, jotka parantavat merkittävästi nykyisiä koulutusmenetelmiä.
Osallistujien käyttämät lähestymistavat perustuvat jäljittelyoppiin. Jäljittelyoppi on erilainen oppimistapa kuin vahvistusoppi, jota käytetään usein koulutettaessa monimutkaisia järjestelmiä, kuten tehdasten robottikäsivarsia tai tekoälyjä, jotka voittavat ihmispelaajat StarCraft II:ssa. Vahvistusoppimisen algoritmien pääasiallinen haitta on se, että ne vaativat valtavan määrän tietokoneen prosessointitehoa koulutukseen, jolloin niitä on yhdistettävä satoihin tai jopa tuhansiin tietokoneisiin oppiakseen. Sen sijaan jäljittelyoppi on paljon tehokkaampi ja vähemmän laskennallinen tapa kouluttaa. Jäljittelyalgoritmit pyrkivät jäljittelemään, miten ihmiset oppivat havainnon kautta.
Carnegie Mellon -yliopiston syvän oppimisen teorian tohtorikoulutettava William Guss kertoi Naturelle, että saada tekoäly tutkimaan ja oppimaan kuvioita ympäristössä on erittäin haasteellinen tehtävä, mutta jäljittelyoppi antaa tekoälylle perustiedon tai hyvät oletukset ympäristöstä. Tämä voi tehdä tekoälyn kouluttamisesta paljon nopeampaa verrattuna vahvistusoppimiseen.
Minecraft on erittäin hyödyllinen koulutusympäristö useista syistä. Yksi syy on, että Minecraftissa pelaajat voivat käyttää yksinkertaisia rakennuspalikoita luodakseen monimutkaisia rakenteita ja esineitä, ja monien askelten tarve näiden rakenteiden luomiseen toimii konkreettisina edistymisen mittareina, joita tutkijat voivat käyttää. Minecraft on myös erittäin suosittu, ja tästä syystä on verrattain helppo kerätä koulutusdataa. MineRL-kilpailun järjestäjät palkkasivat monia Minecraft-pelaajia esittämään erilaisia tehtäviä, kuten työkalujen luomista ja lohkareiden murtamista. Keräämällä dataa joukkoistamalla, tutkijat pystyivät keräämään 60 miljoonaa esimerkkiä toimista, joita voidaan tehdä pelissä. Tutkijat antoivat kilpailutiimeille noin 1000 tuntia videomateriaalia.
Käytä tietoa, jonka ihmiset ovat koonneet, sanoo Kalifornian yliopiston tietojenkäsittelytieteen tohtorikoulutettava Rohin Shah Naturelle, tämä kilpailu on todennäköisesti ensimmäinen, joka keskittyy siihen, että ihmiset ovat jo luoneet tietoa, jotta tekoälyn koulutus voisi nopeutua.
Guss ja muut tutkijat toivovat, että kilpailu voi johtaa tuloksiin, joilla on vaikutuksia Minecraftin ulkopuolelle, mikä voi johtaa parempiin jäljittelyoppialgoritmeihin ja inspiroida enemmän ihmisiä käyttämään jäljittelyoppia tekoälyn koulutuksessa. Tutkimus voisi mahdollisesti auttaa luomaan tekoälyjä, jotka pystyvät paremmin vuorovaikkuun ihmisten kanssa monimutkaisissa ja muuttuvissa ympäristöissä.












