Robotiikka ja fyysinen AI
Tietokoneen tutkijat käyttävät positiivista vahvistusta opettaakseen roboteille
Johns Hopkinsin yliopiston tietokoneen tutkijat ovat käyttäneet perinteistä koulutustekniikkaa, positiivista vahvistusta, jota usein käytetään kouluttamaan eläimiä, kuten koiria, robottiin, jotta se voisi opettaa itselleen uusia taitoja. Näiden uusien taitojen joukossa oli kyky pinota paloja.
Robotti on nimeltään Spot, ja tutkijoiden mukaan se voi oppia taitoja päivien kuluessa, mikä perinteisesti kestää noin kuukauden.
Positiivinen vahvistus
Positiivista vahvistusta käytettiin tiimin toimesta lisätäkseen robotin taitoja. Tiimin onnistuminen nopeuttaa tätä prosessia tekee näiden robottien käyttöönoton helpommaksi todellisessa maailmassa.
Tutkimus julkaistiin IEEE Robotics and Automation Letters -julkaisussa, joka on nimeltään “Hyvä robotti! Tehokas vahvistusoppiminen monivaiheisille visuaalisille tehtäville simulaatiosta todellisuuteen.”
Andrew Hundt on Johns Hopkinsin yliopiston PhD-opiskelija ja tutkimuksen pääkirjoittaja.
“Kysymys tässä on, miten saamme robotin oppimaan taidon?” hän sanoi. “Minulla on ollut koiria, joten tiedän, että palkinnot toimivat, ja se oli inspiraation lähde, kun suunnittelin oppimisalgoritmin.”
Yksi syy, miksi positiivinen vahvistus toimii tietokoneissa, on se, että niillä ei ole intuitiivisia aivoja, mikä tarkoittaa, että ne ovat tyhjä taulu, jolle voidaan heijastaa mitä tahansa. Toisin sanoen ne joutuvat oppimaan kaiken alusta. Yksi tehokkaimmista oppimistavoista tietokoneille on kokeileminen ja virheiden tekeminen, jota robotiikan tutkijat työskentelevät edelleen tänään.
Tämä on täsmälleen sitä, mitä tutkijat tekivät, kun he loivat palkkajärjestelmän robotille, samalla tavalla kuin koulutettaisiin koira antamalla sille palkintoja. Ero on siinä, että robotti saa numeerisia pisteitä, kun se suorittaa tehtävän oikein.
https://www.youtube.com/watch?v=dvxqjJBWFD4
Taidot
Kun robotti oppi pinomaan paloja, se joutui oppimaan keskittymään rakentaviin toimiin. Menetelmässä Spot-robotti sai korkeammat pisteet, kun se suoritti oikein käyttäytymisen palojen pinomisen aikana. Toisaalta se ei saanut mitään pisteitä väärästä käyttäytymisestä. Se sai korkeimman pistemäärän pinomalla neljä palikkaa, joista viimeinen oli ylhäällä.
Tutkijat saivat suurta menestystä tämän menetelmän avulla, ja robotti oppi päivien kuluessa, mitä olisi kestänyt viikkoja aiemmin. Kouluttamalla simuloitua robottia tiimi pystyi vähentämään harjoitteluaikaa ennen siirtymistä Spot-robottiin.
“Robotti haluaa korkeamman pisteytyksen”, Hundt sanoi. “Se oppii nopeasti oikean käyttäytymisen saadakseen parhaan palkinnon. Tosiasia on, että se kestäisi kuukauden harjoittelua saavuttaakseen 100 prosentin tarkkuuden. Me pystyimme tekemään sen kahdessa päivässä.”
Lisäksi palojen pinomisen, robotti käytti positiivista vahvistusta oppiakseen muita tehtäviä, kuten simuloitua navigointipeliä.
“Aluksi robotti ei tiedä, mitä se tekee, mutta se parantaa jokaisen harjoituksen myötä. Se ei koskaan luovuta ja jatkaa yrittämistä pinomalla paloja, ja se pystyy suorittamaan tehtävän 100 prosentin todennäköisyydellä”, Hundt sanoi.
Jotkut mahdolliset sovellukset tähän menetelmään ovat kouluttaminen kotirobotteja suorittamaan tiettyjä tehtäviä, sekä parantaminen autonomisten ajoneuvojen toimintaa.
“Lopullinen tavoitteemme on kehittää roboteja, jotka voivat suorittaa monimutkaisia tehtäviä todellisessa maailmassa — kuten tuotteen kokoaminen, vanhusten hoito ja leikkaukset”, Hager sanoi. “Emme tällä hetkellä tiedä, miten ohjelmoida tehtäviä, jotka ovat liian monimutkaisia. Mutta tämänkaltaiset työt osoittavat, että on lupaavaa ajatella, että robotit voivat oppia suorittamaan sellaisia tehtäviä turvallisesti ja tehokkaasti.”












