AI-mallit ja alustat
Tekoäly Kamppailee Minecraftin Hallinnassa Imitaatio-opimisen Kautta

Viime kuukausien aikana Microsoft (MSFT ) ja muut koneoppimista tutkivat yritykset haastoivat tekoäly-kehittäjien tiimit luomaan tekoälyjärjestelmän, joka voisi pelata Minecraftia ja löytää timantin pelistä. BBC:n mukaan, vaikka tekoälyalustat ovat onnistuneet hallitsemaan shakin ja gon, se on kamppaillut tehtävän hallinnassa Minecraftissa.
Microsoftin Minecraft-pohjainen tekoälyhaaste oli nimeltään MineRL, ja kilpailun tulokset julkaistiin virallisesti vastaan NeurIPS-konferenssissa. Kilpailun tarkoituksena oli kouluttaa tekoäly “imitaatio-opimisen” lähestymistavalla. Imitaatio-opiminen on menetelmä, jossa tekoäly koulutetaan havaintojen avulla. Imitaatio-opimisen tarkoituksena on antaa tekoälyjärjestelmille mahdollisuus oppia toimia havainnoimalla ihmisten toimia, oppimalla havainnoinnin kautta. Imitaatio-opiminen on verrattuna vahvistusopimiseen paljon vähemmän laskennallisen vaativampi ja tehokkaampi tapa kouluttaa tekoälyä.
Vahvistusopiminen vaatii usein monia voimakkaita tietokoneita, jotka on kytketty yhteen, ja satoja tai tuhansia tunteja koulutusta, jotta se voi olla tehokas tehtävässä. Sen sijaan tekoäly, joka on koulutettu imitaatio-opimisen menetelmällä, voidaan kouluttaa paljon nopeammin, koska tekoälyllä on jo valmiiksi tietty taso tietoa, jota se on saanut edeltäviltä ihmisoperaattoreilta.
Imitaatio-opimisella on käytännön sovelluksia tekoälyn kouluttamisessa, jossa tekoäly ei voi turvallisesti tutkia, ennen kuin se on oppinut oikeat toiminnot. Tällaisia tilanteita voivat olla esimerkiksi itseohjautuvan ajoneuvon koulutus, jossa autoa ei voida antaa vapaasti liikkua kadulla, ennen kuin se on oppinut toimimaan halutulla tavalla. Ihmisen näytön avulla voidaan kouluttaa ajoneuvo nopeammin ja turvallisemmin.
Timantin löytäminen Minecraftissa vaatii useiden askelten suorittamista peräkkäin, kuten puiden kaataminen työkalujen valmistamiseksi, luolasten tutkiminen, joissa timantit sijaitsevat, ja itse timantin löytäminen luolasta. Vaikka tehtävä on monimutkainen, ihmiselle, joka on tuttu peliin, pitäisi olla mahdollista löytää timantti noin 20 minuutissa.
Yli 660 erilaista tekoälyagenttia lähetettiin kilpailuun, mutta yksikään niistä ei onnistunut löytämään timanttia. Tekoälyä varten tarjottu koulutusdata koostui yli 60 miljoonasta pelin kehyksestä, jotka oli kerätty useilta ihmispuhujilta. Timanttien sijainnit satunnaisesti määritellään, kun peli aloitetaan, joten tekoälyt eivät voi yksinkertaisesti etsiä sieltä, missä ihmiset löysivät timantit. Toisin sanoen, tekoälyjen on muodostettava ymmärrys siitä, miten käsitteet, kuten työkalujen valmistaminen, työkalujen käyttäminen, tutkiminen ja resurssien löytäminen, liittyvät toisiinsa.
Vaikka yksikään tekoälyagentti ei onnistunut löytämään timanttia, kilpailun järjestäjätiimi oli silti tyytyväinen kilpailun tuloksiin, ja siitä, että paljon oli opittu kokeen aikana. Tekoälytiimien tekemä tutkimus voi auttaa edistämään tekoälyalan kehitystä ja löytämään vaihtoehtoja vahvistusopimisen strategioille.
Vahvistusopiminen antaa usein paremman suorituskyvyn kuin imitaatio-opiminen, ja yksi merkittävä vahvistusopimisen menestys on DeepMindin AlphaGo. Kuitenkin, kuten aiemmin mainittiin, vahvistusopiminen vaatii massiivisia laskentaresursseja, mikä rajoittaa sen käyttöä organisaatioissa, jotka eivät voi maksaa suurta määrää tietokoneita.
Carnegie Mellon -yliopiston PhD-opiskelija ja kilpailun pääjärjestäjä William Guss kertoi BBC:lle, että MineRL-kilpailun tarkoituksena oli tutkia vaihtoehtoja laskennallisesti raskaille tekoälyjärjestelmille. Guss sanoi:
“…Heittäminen massiivisia laskentaresursseja ongelmien ratkaisemiseksi ei välttämättä ole oikea tapa edistää alan kehitystä… Se toimii suoraan demokratisoimisen pääsyä vahvistusopimisen järjestelmiin vastaan, ja jättää kyvyn kouluttaa agentteja monimutkaisiin ympäristöihin yrityksille, joilla on laaja määrä laskentaresursseja.”












