AI-mallit ja alustat

Tekoälytutkijat luovat videopelimallin, joka pystyy muistamaan menneet tapahtumat

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Uberin tekoälylaboratorion tutkijaryhmä on kehittänyt äskettäin järjestelmän tekoälyalgoritmeja, jotka ylittävät sekä ihmispelaajien että muiden tekoälyjärjestelmien suorituskyvyn klassisissa Atari-videopeleissä. Tutkijoiden kehittämä tekoälyjärjestelmä pystyy muistamaan aikaisemmin onnistuneita strategioita ja luomaan uusia strategioita siitä, mitä on toiminut aiemmin. Tutkimuksen tutkijaryhmä uskoo, että heidän kehittämänsä algoritmit ovat sovellettavissa muihin teknisiin aloihin, kuten kieliprosessointiin ja robottiikkaan.

Tavallinen menetelmä tekoälyjärjestelmien luomiseen, jotka pystyvät pelaamaan videopelien, on käyttää vahvistusoppimisalgoritmia. Vahvistusoppimisalgoritmit oppivat, miten suorittaa tehtävän tutkimalla mahdollisten toimien joukkoa, ja jokaisen toiminnan jälkeen niille annetaan jokin vahvistus (palkkio tai rangaistus). Ajan myötä tekoälymalli oppii, mitkä toimet johtavat suurempiin palkkioihin, ja se muuttuu todennäköisemmäksi suorittamaan nämä toimet. Valitettavasti vahvistusoppimismallit kohtaavat vaikeuksia, kun ne kohtaavat tietopisteitä, jotka eivät ole yhdenmukaisia muiden tietojoukon kanssa.

Tutkijaryhmän mukaan heidän lähestymistapansa ei ollut aiemmin tutkittu muilla tekoälytutkijoilla, koska strategia poikkeaa “intrinsisestä motivaatiosta”, jota yleensä käytetään vahvistusoppimisessa. Intrinsisen motivaation lähestymistavan ongelma on, että malli voi olla altis “unohtamiselle” potentiaalisesti palkitseville alueille, jotka ansaitsevat edelleen tutkimista. Tätä ilmiötä kutsutaan “irtautumiseksi”. Seurauksena on, että kun malli kohtaa odottamattoman datan, se voi unohtaa alueita, jotka pitäisi edelleen tutkia.

TechXploren mukaan tutkijaryhmä pyrki luomaan oppimismallin, joka oli joustavampi ja pystyi vastaamaan odottamattomaan dataan. Tutkijat ratkaisivat ongelman esittelemällä algoritmin, joka pystyy muistamaan kaikki toimet, jotka edellinen mallin versio teki, kun se yritti ratkaista ongelman. Kun tekoälymalli kohtaa tietopisteen, joka ei ole yhdenmukainen sille, mitä se on oppinut tähän asti, malli tarkistaa muistikarttansa. Malli tunnistaa, mitkä strategiat onnistuivat ja epäonnistuivat, ja valitsee strategiat sopivasti.

Kun peliä pelataan, malli kerää pelin ruudunkaappauksia pelin aikana, luoden lokin toimistaan. Kuvat ryhmitellään yhdessä samankaltaisuuden perusteella, muodostaen selkeitä pisteitä ajassa, joihin malli voi viitata. Algoritmi voi käyttää lokitettuja kuvia palataksesi mielenkiintoiseen ajankohtaan ja jatkaa siitä tutkimista. Kun malli huomaa, että se häviää, se viittaa takaisin ruudunkaappauksiin ja kokeilee toisenlaista strategiaa.

BBC:n mukaan on myös ongelma vaarallisten tilanteiden käsittely tekoälyagentille, joka pelaa peliä. Jos agentti kohtaa vaaran, joka voi tappaa sen, se estää sen palaamasta alueille, jotka ansaitsevat tutkimista, ongelmaa kutsutaan “junausksi”. Tekoälymalli käsittelee junausongelmia erillisen prosessin kautta siihen, jota käytetään vanhojen alueiden tutkimisen edistämiseen.

Tutkijaryhmä pelasi 55 Atari-peliä. Nämä pelit ovat yleisesti käytettyjä tekoälymallien suorituskyvyn mittaukseen, mutta tutkijat lisäsivät omalle mallilleen twistin. Tutkijat esittivät pelille säännöt, joissa mallin tuli saavuttaa korkein mahdollinen piste, mutta myös yrittää saavuttaa jokaisella kerralla korkeampi piste. Kun mallin suorituskykyä analysoitiin, tutkijat totesivat, että heidän tekoälyjärjestelmänsä ylitti muita tekoälyjärjestelmiä peleissä noin 85 prosentissa tapauksista. Tekoäly suoriutui erityisen hyvin pelistä Montezuma’s Revenge, jossa pelaaja välttelee vaaroja ja kerää aarteita. Peli voitti ennätyksen ihmispelaajalle ja saavutti korkeamman pisteen kuin mikään muu tekoälyjärjestelmä.

Uberin tekoälytutkijoiden mukaan tutkijaryhmän käyttämät strategiat ovat sovellettavissa teollisuuksiin, kuten robottiikkaan. Robotit hyötyvät kyvystä muistaa, mitkä toimet ovat onnistuneet, mitkä eivät ole onnistuneet ja mitkä eivät ole vielä kokeiltu.

Blogger ja ohjelmoija, jolla on erityisalat Machine Learning ja Deep Learning -aiheissa. Daniel toivoo pystyvänsä auttamaan muita käyttämään tekoälyn voimaa sosiaaliseen hyvään.