AI-mallit ja alustat
DeepMindin uusi menetelmä vahvistusoppimisen turvalliselle koulutukselle
Vahvistusoppiminen on lupaava keino tekoälykehityksessä, joka tuottaa tekoälyä, joka pystyy käsittelemään erittäin monimutkaisia tehtäviä. Vahvistusoppimisalgoritmit käytetään muun muassa mobiilien robotti-järjestelmien ja itseohjautuvien autojen luomisessa. Kuitenkin, vahvistusoppimisen koulutuksen vuoksi, ne voivat joskus ilmentää outoja ja odottamattomia käyttäytymisiä. Nämä käyttäytymiset voivat olla vaarallisia, ja tekoälytutkijat viittaavat tähän ongelmaan “turvallisen tutkimisen” ongelmana, jossa tekoäly jää kiinni turvattomien tilojen tutkimisessa.
Google (GOOGL ):n tekoälytutkimuslaboratorio DeepMind julkaisi äskettäin tutkimuksen, jossa esitettiin uusia menetelmiä turvallisen tutkimisen ongelman ratkaisemiseksi ja vahvistusoppimisen tekoälyjen kouluttamiseksi turvallisemmin. DeepMindin ehdottama menetelmä korjaa myös palkkion hakkerointia tai palkkion kriteerien virheitä.
DeepMindin uusi menetelmä käyttää kahta eri järjestelmää, jotka ohjaavat tekoälyjen käyttäytymistä tilanteissa, joissa voi ilmetä turvattomia käyttäytymisiä. DeepMindin koulutustekniikassa käytettävät mallit ovat generatiivinen malli ja eteenpäin suuntautuva dynaaminen malli. Molemmat mallit on koulutettu erilaisilla tiedoilla, kuten turvallisuusasiantuntijoiden esittämistä esimerkeistä ja satunnaisista ajoneuvoliikenteen reiteistä. Tiedot on merkitty ylijohdon kanssa tiettyjen palkkioarvojen kanssa, ja tekoälyagentti oppii havainnoimalla käyttäytymismalleja, jotka mahdollistavat suurimman palkkion keräämisen. Turvattomat tilat on myös merkitty, ja kun malli on onnistuneesti ennustanut palkkioita ja turvattomia tiloja, se käyttää niitä suunniteltujen toimien suorittamiseen.
Tutkimusryhmä selittää tutkimuksessa, että ideana on luoda mahdollisia käyttäytymisiä alusta alkaen, ehdottaa toivottuja käyttäytymisiä ja tehdä nämä hypoteettiset skenaariot mahdollisimman informatiivisiksi välttäen samalla suoraa häiriötä oppimisympäristössä. DeepMind-tiimi viittaa tähän lähestymistapaan ReQueST-nimellä, eli palkkion kyselysynthesoinen reitin optimoinnin kautta.
ReQueST voi johtaa neljään eri käyttäytymistyyppiin. Ensimmäinen käyttäytymistyyppi yrittää maksimoida epävarmuuden joukko-palkkiomalleissa. Toisaalta käyttäytymistyypit kaksi ja kolme yrittävät minimoida ja maksimoida ennustettuja palkkioita. Ennustettuja palkkioita minimoidaan löytääkseen käyttäytymisiä, joita malli voi väärin ennustaa. Toisaalta ennustettuja palkkioita maksimoidaan johtamaan käyttäytymismerkintöihin, joilla on korkein informaatioarvo. Lopulta neljäs käyttäytymistyyppi yrittää maksimoida reittien uudisuutta, jotta malli jatkaa tutkimista riippumatta palkkioista.
Kun malli on saavuttanut halutun palkkion keräämisen tason, suunnitteluentiteettiä käytetään päätöksentekoon oppimien palkkioiden perusteella. Tämä mallipohjainen ohjausjärjestelmä mahdollistaa agenttien oppimisen välttämään turvattomia tiloja käyttämällä dynaamista mallia ja ennustamalla mahdollisia seurauksia, toisin kuin algoritmit, jotka oppivat pelkästään kokeilemalla.
VentureBeatin mukaan DeepMind-tutkijat uskovat, että heidän projekti on ensimmäinen vahvistusoppimisen järjestelmä, joka pystyy oppimaan turvallisesti:
“Meidän tietämyksemme mukaan ReQueST on ensimmäinen palkkion mallinnusalgoritmi, joka oppii turvallisesti turvattomista tiloista ja skaalautuu kouluttamaan neurverkko-palkkion malleja ympäristöissä, joissa on korkean dimensionaaliset ja jatkuvat tilat. Tähän asti olemme vain osoittaneet ReQueST:n tehokkuuden simuloituissa domeeneissa, joissa on suhteellisen yksinkertainen dynamiikka. Yksi tulevan työn suunta on testata ReQueST 3D-domeeneissa, joissa on realistisempi fysiikka ja muut agentit, jotka toimivat ympäristössä.”












