AI-mallit ja alustat

DeepMindin uusi tekoäly pystyy oppimaan pelin säännöt pelatessaan

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Alphabetin tytäryhtiö DeepMind on kehittänyt älyjärjestelmän, joka pystyy oppimaan pelin säännöt pelatessaan. Vaikka DeepMind on luonut vaikuttavia tekoälymalleja, jotka osaavat hallita pelejä kuten shakki, shogi, go ja videopelit, nämä mallit on annettava etukäteen pelin säännöt. DeepMindin uusi tekoäly edustaa merkittävää parannusta aiempiin tekoälyalgoritmeihin, jotka oppivat pelaamaan pelejä vahvistusoppimisen kautta.

Tekoälyjärjestelmä – MuZero

DeepMind julkaisi tutkimuksen julkaisussa Nature, jossa kerrottiin, miten heidän uusi tekoälyjärjestelmä toimii. Uusi tekoäly, joka on nimeltään MuZero, pystyy oppimaan pelin säännöt pelatessaan “etsintä”-periaatteen avulla. Engadgetin mukaan MuZero käyttää etsintää määrittääkseen, mitkä liikkeet tulisi suorittaa vastustajien todennäköisimpien vastausten perusteella.

Kun otetaan huomioon kaikki mahdolliset siirrot, jotka voidaan tehdä peleissä kuten shakissa, MuZero pystyy priorisoimaan siirrot ja karsimaan ne alas vain todennäköisimpiin ja merkittävimpiin siirtoihin. MuZero oppii sekä onnistuneista että epäonnistuneista manöuvreista. Sen sijaan, että malli kaikki mahdolliset tekijät, se ottaa huomioon vain ne tekijät, jotka ovat merkittävimpiä päätöksenteon kannalta. MuZero ottaa moninaiset mahdolliset muuttujat, jotka voidaan ottaa huomioon, ja tiivistää ne vain merkittävimpiin ja vaikuttavimpiin piirteisiin. Nämä piirteet ovat edustettuina puuhakutaulukossa. Puun mahdollisuudet yhdistetään oppimalla mallilla, joka perustuu testiympäristön piirteisiin. Etsintä suoritetaan sen jälkeen, kun ympäristön merkittävimmät piirteet on tunnistettu.

Jotta lopullinen päätös voidaan tehdä, otetaan huomioon kolme tekijää.

MuZero ottaa huomioon edellisen valinnan tuloksen, sen nykyisen aseman ja mahdolliset seuraavat toimet, joita se voi tehdä. Tämä lähestymistapa on parempi kuin aiemmin DeepMindin käyttämät lähestymistavat, kuten perus etsintä ja puumallit. MuZero osoittautui vähintään yhtä hyväksi shakissa, shogissa ja gossa kuin AlphaZero, ja kun se pelasi Ms. Pac-Man -peliä, MuZero pystyi ottamaan huomioon vain noin kuusi tai seitsemän siirtoa kerrallaan. Huolimatta tästä rajoituksesta, tekoäly pystyi suoriutumaan hyvin. DeepMind kokeili myös MuZero:n kykyjä rajoittamalla määrää simulaatioita, joita se voisi suorittaa ennen kuin se joutui sitoutumaan siirtoon. Yleensä, mitä enemmän ohjelma sai aikaa harkita mahdollisia siirtoja, sitä paremmin se suoriutui.

DeepMindin pää tutkija, David Silver, selitti TechXplorelle, että MuZero on ensimmäinen tekoälymalli, joka pystyy luomaan oman edustansa ympäristön säännöistä ja käyttämään sitä suunnitella toimia.

“Ensimmäisen kerran meillä on järjestelmä, joka pystyy luomaan oman ymmärryksensä siitä, miten maailma toimii, ja käyttämään sitä tällaisessa sofistikoituneessa etsintäsuunnittelussa, jota olemme aiemmin nähneet peleissä kuten shakissa”, Silver sanoi. “(MuZero) voi aloittaa tyhjästä ja vain kokeilemalla ja virheiden kautta, sekä löytää ympäristön säännöt ja käyttää niitä saavuttaakseen supersuorituskykyä.”

Mahdolliset sovellukset

Tekoäly, joka pystyy todella oppimaan tehtävän rajoitukset ja toimimaan niiden puitteissa, on laaja valikoima mahdollisia sovelluksia. MuZero voidaan käyttää tehtävissä, kuten videopakkauksessa, joka on aiemmin ollut vaikea automatisoida tekoälyllä, johtuen monista mahdollisista videomuodoista ja pakkauksista. MuZero pystyi saavuttamaan noin 5 prosentin pakkauksen parannuksen. Tämä voi olla merkittävää Googleen ja YouTubeen isännöidyille videoille. Videoiden lisäksi DeepMind tutkii myös MuZero-tekniikoiden käyttämistä proteiinirakenteen suunnittelussa ja robotti-ohjelmoinnissa.

Wendy Hall, Southamptonin yliopiston tietojenkäsittelytieteen professori, sanoo, että MuZero edustaa “merkittävää edistystä” vahvistusoppimisalgoritmeissa. Hall on kuitenkin huolissaan, että algoritmit voivat olla väärinkäytössä. Esimerkiksi Yhdysvaltain ilmavoimat on jo viitannut varhaisiin MuZero-tutkimuspaperiin luodakseen tekoälyjärjestelmän, joka voi laukaista ohjuksia U-2-vakoilukoneista. Tämä on huolimatta siitä, että DeepMindin tutkijat ovat ilmaisseet vastustavansa algoritmien käyttämistä tappavissa aseissa ja allekirjoittaneet Tappavan Automaattisen Aseiden Sitoumuksen, jossa vaaditaan, että kaikki tappavat teknologiat pidetään ihmisen hallinnassa.

Silver selitti, että DeepMind katsoo tulevaisuuteen ja pyrkii kehittämään algoritmeja, jotka ovat yhtä voimakkaita ja monipuolisia kuin aivot. Ensimmäinen askel luomassa joustavia ja monipuolisia algoritmeja on ymmärtää, mitä tarkoittaa, että järjestelmä on älykäs, ja älykkyys on kyky havaita monimutkaisten ympäristöjen mallit ja säännöt. Tämä tarkoittaa, että DeepMind on edelläkävijä tekoälytutkimuksessa ja kehittää jatkuvasti uusia ja parempia algoritmeja.

Blogger ja ohjelmoija, jolla on erityisalat Machine Learning ja Deep Learning -aiheissa. Daniel toivoo pystyvänsä auttamaan muita käyttämään tekoälyn voimaa sosiaaliseen hyvään.