AI-mallit ja alustat

DeepMind ja Google Brain pyrkivät kehittämään menetelmiä tehostamaan vahvistusoppimisen tehokkuutta

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Vahvistusoppimisjärjestelmät voivat olla voimakkaita ja kestäviä, ja ne kykenevät suorittamaan erittäin monimutkaisia tehtäviä tuhansien koulutusjaksojen kautta. Vaikka vahvistusoppimisalgoritmit kykenevät mahdollistamaan monimutkaisia ja joskus yllättäviä käyttäytymisiä, ne vaativat koulutukseen paljon aikaa ja suuria määriä dataa. Nämä tekijät tekevät vahvistusoppimismenetelmistä melko tehokkaita, ja viime aikoina Alphabetin DeepMind- ja Google (GOOGL ) Brain -tutkimusryhmät ovat pyrkineet löytämään tehokkaampia menetelmiä vahvistusoppimisjärjestelmien luomiseksi.

VentureBeatin mukaan yhdistynyt tutkimusryhmä on ehdottanut menetelmiä, joilla voidaan tehostaa vahvistusoppimisen koulutusta. Yksi ehdotuksista oli algoritmi, joka sai nimen Adaptive Behavior Policy Sharing (ABPS), ja toinen oli kehys, joka sai nimen Universal Value Function Approximators (UVFA). ABPS sallii ryhmän tekoälyagenttien jakaa kokemuksiaan sopeutuvasti, kun taas UVFA sallii näiden agenttien tutkia yhtäaikaisesti ohjattuja tutkimuspolitiikkoja.

ABPS on tarkoitettu nopeuttamaan hyperparametrien mukauttamista mallin koulutuksessa. ABPS tekee hyperparametrien etsimisestä nopeampaa sallimalla useiden eri agenttien, joilla on eri hyperparametrit, jakaa toimintapolitiikkakokemuksiaan. Tarkemmin sanottuna ABPS sallii vahvistusoppimisagenttien valita toimia, jotka politiikka on hyväksynyt, ja sen jälkeen heille myönnetään palkkio ja havainto seuraavasta tilasta.

Tekoälyvahvistusagentit koulutetaan eri yhdistelmillä mahdollisia hyperparametreja, kuten päättymisnopeutta ja oppimisnopeutta. Mallin koulutuksen tavoitteena on, että malli supistuu hyperparametrien yhdistelmään, joka antaa sille parhaimman suorituskyvyn, ja tässä tapauksessa myös parantaa datan tehokkuutta. Tehokkuus lisääntyy kouluttamalla useita agenteja samanaikaisesti ja valitsemalla ainoastaan yhden agentin käyttäytymistä seuraavassa aikaskaalassa. Käyttäytymispolitiikka, jota kohde-agentti noudattaa, käytetään toimien näyttelemiseen. Siirtymät kirjataan jaettuun tilaan, ja tätä tilaa arvioidaan jatkuvasti, jotta politiikan valinta ei tarvitse tapahtua liian usein. Koulutuksen lopussa valitaan agenttien joukko, ja parhaimmin suorittavat agentit valitaan lopulliseen käyttöön.

UVFA:n osalta se pyrkii ratkaisemaan yhteen vahvistusoppimisen yleisistä ongelmista, jossa heikosti vahvistetut agentit eivät usein opi tehtäviä. UVFA pyrkii ratkaisemaan ongelman opettamalla agentin oppimaan erillisen joukon hyödyntämis- ja tutkimuspolitiikkoja samanaikaisesti. Tehtävien erottaminen luo kehyksen, joka sallii tutkimuspolitiikkojen jatkuvan ympäristön tutkimisen, kun taas hyödyntämispolitiikat pyrkivät maksimoimaan palkkion nykyiselle tehtävälle. UVFA:n tutkimuspolitiikat toimivat perusrakenteena, joka jatkaa parantumista, vaikka luonnollisia palkkioita ei löydy. Tällaisessa tilanteessa approksimoidaan funktio, joka vastaa intrinsistä palkkioita, joka pakottaa agenteja tutkimaan kaikki tilat ympäristössä, vaikka he usein palaavat tuttuihin tiloihin.

VentureBeatin selityksen mukaan kun UVFA-kehys on käytössä, järjestelmän intrinsiset palkkiot annetaan suoraan agentille syötteinä. Agentti pitää kirjaa kaikkien syötteiden (kuten palkkioiden, toimien ja tilan) esityksestä annetussa jaksossa. Tuloksena on, että palkkio säilyy ajan myötä, ja agentin politiikka on ainakin jossain määrin perustettu siihen.

Tämä saavutetaan “jakson uutuuden” ja “elämän uutuuden” moduulin avulla. Ensimmäisen moduulin tehtävä on pitää nykyistä, jaksoaikaisesta muistia ja kartoittaa nykyisiä löytöjä edellä mainittuun esitykseen, jotta agentti voi määritellä intrinsisen jakso-palkkion koulutuksen jokaiselle vaiheelle. Sen jälkeen tila, joka on liitetty nykyiseen havaintoon, lisätään muistiin. Samaan aikaan elämän uutuuden moduuli vaikuttaa siihen, kuinka usein agentti tutkii useiden jaksojen aikana.

Alphabetin/Google-tiimien mukaan uudet koulutusmenetelmät ovat jo osoittaneet potentiaalia merkittävän paranemisen saavuttamiseksi vahvistusoppimisjärjestelmän koulutuksessa. UVFA kykeni kaksinkertaistamaan joitain perusagenttien suorituskykyä, jotka pelasivat eri Atari-pelejä. Samaan aikaan ABPS kykeni parantamaan suorituskykyä joillakin samoilla Atari-peleillä, vähentämällä vaihtelua parhaimmin suorittavien agenttien joukossa noin 25 prosentilla. UVFA-koulutettu algoritmi kykeni saavuttamaan korkean pisteytyksen Pitfall-pelissä itsestään, ilman mitään ihmisten demojen suunnittelemia piirteitä.

Blogger ja ohjelmoija, jolla on erityisalat Machine Learning ja Deep Learning -aiheissa. Daniel toivoo pystyvänsä auttamaan muita käyttämään tekoälyn voimaa sosiaaliseen hyvään.