AI:n perusteet

MikÃĪ on vahvistusoppiminen?

mm
LisÃĪÃĪ Unite.AI suosikkilÃĪhteisiisi Google-palvelussa

MikÃĪ on vahvistusoppiminen?

Yksinkertaisesti sanottuna vahvistusoppiminen on koneoppimisen tekniikka, jossa koulutetaan tekoÃĪlyagentti toistamalla toimintoja ja liittÃĪmÃĪllÃĪ niihin palkintoja. Vahvistusoppimisen agentti kokeilee ympÃĪristÃķssÃĪ, tekee toimintoja ja saa palkintoja, kun oikeat toiminnat tehdÃĪÃĪn. Ajan myÃķtÃĪ agentti oppii tekemÃĪÃĪn toimintoja, jotka maksimoivat palkintonsa. TÃĪmÃĪ on nopea mÃĪÃĪritelmÃĪ vahvistusoppimiselle, mutta tarkastelemalla tarkemmin vahvistusoppimisen taustoja, voit saada paremman, intuitiivisemman ymmÃĪrryksen siitÃĪ.

Vahvistusoppimisen termi on sovellettu psykologisesta kÃĪsitteestÃĪ vahvistuksesta. Siksi tarkastellaan psykologista vahvistus-kÃĪsitettÃĪ. Psykologisessa mielessÃĪ vahvistus tarkoittaa jotain, joka lisÃĪÃĪ tietyssÃĪ toiminnassa tai vastauksessa ilmenemisen todennÃĪkÃķisyyttÃĪ. TÃĪmÃĪ vahvistuksen kÃĪsite on keskeinen ajatus operantin ehdollistamisen teoriassa, jonka psykologi B.F. Skinner esitti alun perin. TÃĪssÃĪ yhteydessÃĪ vahvistus on mitÃĪ tahansa, joka lisÃĪÃĪ tietyn kÃĪyttÃĪytymisen esiintymisen. Jos ajattelemme mahdollisia vahvistuksia ihmisille, nÃĪmÃĪ voivat olla esimerkiksi ylistys, palkankorotus tyÃķssÃĪ, makeisia ja hauskoja toimintoja.

PerinteisessÃĪ, psykologisessa mielessÃĪ on kaksi tyyppiÃĪ vahvistusta. On positiivinen vahvistus ja negatiivinen vahvistus. Positiivinen vahvistus on jonkin asian lisÃĪÃĪminen kÃĪyttÃĪytymisen lisÃĪÃĪmiseksi, kuten antaa koiralle makeinen, kun se on hyvÃĪssÃĪ kÃĪytÃķksessÃĪ. Negatiivinen vahvistus kÃĪsittÃĪÃĪ ÃĪrsykkeen poistamisen kÃĪyttÃĪytymisen aiheuttamiseksi, kuten melun sammuttaminen, jotta ujo kissa tulee esiin.

Positiivinen ja negatiivinen vahvistus

Positiivinen vahvistus lisÃĪÃĪ kÃĪyttÃĪytymisen esiintymisen, kun taas negatiivinen vahvistus vÃĪhentÃĪÃĪ sitÃĪ. YleensÃĪ positiivinen vahvistus on yleisin vahvistusoppimisessa kÃĪytetty vahvistustyyppi, koska se auttaa malleja maksimoimaan suorituskykyÃĪ tietyn tehtÃĪvÃĪn suhteen. Positiivinen vahvistus johtaa myÃķs mallin kestÃĪviin muutoksiin, muutoksiin, jotka voivat muodostua jatkuviksi kÃĪyttÃĪytymismalleiksi ja sÃĪilyÃĪ pitkÃĪÃĪn.

Toisaalta negatiivinen vahvistus tekee kÃĪyttÃĪytymisen todennÃĪkÃķisemmÃĪksi, mutta sitÃĪ kÃĪytetÃĪÃĪn enemminkin vÃĪhimmÃĪistason suorituskyvyn yllÃĪpitÃĪmiseen kuin mallin maksimaalisen suorituskyvyn saavuttamiseen. Negatiivinen vahvistus vahvistusoppimisessa auttaa mallin pysymÃĪÃĪn pois ei-toivottavista toiminnista, mutta se ei voi tehdÃĪ mallista toimintaa, joka etsii toivottuja toimintoja.

Vahvistusoppimisen agentin koulutus

Kun vahvistusoppimisen agenttia koulutetaan, on neljÃĪ erilaista ainesosaa tai tilaa kÃĪytÃķssÃĪ koulutuksessa: alkutilat (Tila 0), uusi tila (Tila 1), toiminnat ja palkinnot.

Kuvitellaan, ettÃĪ koulutamme vahvistusoppimisen agenttia pelaamaan tasohyppely-peliÃĪ, jossa tekoÃĪlyllÃĪ on tavoitteena pÃĪÃĪstÃĪ pelin loppuun liikkuessa oikealle ruudun yli. Pelin alkutila piirretÃĪÃĪn ympÃĪristÃķstÃĪ, mikÃĪ tarkoittaa, ettÃĪ pelin ensimmÃĪinen ruutu analysoidaan ja annetaan mallille. TÃĪmÃĪn tiedon perusteella malli on tehtÃĪvÃĪ toimintapÃĪÃĪtÃķs.

Koulutuksen alkuvaiheessa nÃĪmÃĪ toiminnat ovat satunnaisia, mutta kun malli vahvistetaan, tietyt toiminnat tulevat yleisemmiksi. Toiminnan tekemisen jÃĪlkeen pelin ympÃĪristÃķ pÃĪivitetÃĪÃĪn ja uusi tila tai ruutu luodaan. Jos agentin tekemÃĪ toiminta tuotti toivottavan tuloksen, esimerkiksi agentti on edelleen elossa eikÃĪ ole osunut viholliseen, agentille annetaan palkinto, ja se tulee todennÃĪkÃķisemmÃĪksi toimimaan samalla tavalla tulevaisuudessa.

TÃĪmÃĪ perusjÃĪrjestelmÃĪ toistetaan jatkuvasti, ja jokaisella kerralla agentti yrittÃĪÃĪ oppia hieman enemmÃĪn ja maksimoida palkintonsa.

Jaksoittaiset ja jatkuvat tehtÃĪvÃĪt

Vahvistusoppimisen tehtÃĪvÃĪt voidaan yleensÃĪ luokitella kahteen eri kategoriaan: jaksoittaisiin tehtÃĪviin ja jatkuviin tehtÃĪviin.

Jaksoittaiset tehtÃĪvÃĪt suorittavat oppimis-/koulutussilmukan ja parantavat suorituskykyÃĪÃĪn, kunnes tietyt lopetusehdot tÃĪyttyvÃĪt ja koulutus lopetetaan. PelissÃĪ tÃĪmÃĪ voi olla esimerkiksi pelin loppuun pÃĪÃĪseminen tai vaaran, kuten piikkien, aiheuttama kuolema. Toisaalta jatkuvat tehtÃĪvÃĪt eivÃĪt ole lopetusehtoja, ja ne jatkavat koulutusta loputtomiin, kunnes insinÃķÃķri pÃĪÃĪttÃĪÃĪ lopettaa koulutuksen.

Monte Carlo ja Temporaalinen Ero

On kaksi pÃĪÃĪasiallista tapaa opettaa, tai kouluttaa, vahvistusoppimisen agenttia. Monte Carlo -menetelmÃĪssÃĪ palkinnot annetaan agentille (sen pisteet pÃĪivitetÃĪÃĪn) vain koulutusjakson lopussa. Toisin sanoen vasta kun lopetusehto tÃĪyttyy, malli oppii, miten hyvin se suoriutui. Se voi sitten kÃĪyttÃĪÃĪ tÃĪtÃĪ tietoa pÃĪivittÃĪÃĪkseen ja kun seuraava koulutusjakso alkaa, se toimii uuden tiedon mukaisesti.

Temporaalisen eron menetelmÃĪ poikkeaa Monte Carlo -menetelmÃĪstÃĪ siinÃĪ, ettÃĪ arviointi, tai pisteiden arviointi, pÃĪivitetÃĪÃĪn koulutusjakson aikana. Kun malli siirtyy seuraavaan aikaskaalaan, arvot pÃĪivitetÃĪÃĪn.

Tutkiminen ja hyÃķdyntÃĪminen

Vahvistusoppimisen agentin koulutus on tasapainoilua, jossa tasapainotetaan kahta eri mittaria: tutkimista ja hyÃķdyntÃĪmistÃĪ.

Tutkiminen on tietojen kerÃĪÃĪminen ympÃĪristÃķstÃĪ, kun taas hyÃķdyntÃĪminen tarkoittaa jo tiedossa olevan tiedon kÃĪyttÃĪmistÃĪ palkintopisteiden ansaitsemiseen. Jos agentti tutkii vain ja ei koskaan hyÃķdyntÃĪisi ympÃĪristÃķÃĪ, toivottuja toimintoja ei koskaan tehdÃĪ. Toisaalta, jos agentti hyÃķdyntÃĪÃĪ vain ja ei koskaan tutki, se oppii vain yhden toiminnan ja ei lÃķydÃĪ muita strategioita palkintopisteiden ansaitsemiseen. Siksi tutkimisen ja hyÃķdyntÃĪmisen tasapainottaminen on kriittistÃĪ vahvistusoppimisen agentin luomisessa.

Vahvistusoppimisen soveltamisalueet

Vahvistusoppimista voidaan kÃĪyttÃĪÃĪ laajasti eri rooleissa, ja se on parhaiten sovellettavissa sovelluksiin, joissa tehtÃĪvÃĪt vaativat automaatiota.

Teollisten robottien automaatio tehtÃĪvissÃĪ, joita ne suorittavat, on yksi alue, jossa vahvistusoppiminen osoittaa olevansa hyÃķdyllinen. Vahvistusoppimista voidaan myÃķs kÃĪyttÃĪÃĪ ongelmien kuten tekstin kaivamisen ratkaisemiseen, jossa luodaan malleja, jotka pystyvÃĪt tiivistÃĪmÃĪÃĪn pitkiÃĪ tekstejÃĪ. Tutkijat ovat myÃķs kokeilleet vahvistusoppimisen kÃĪyttÃĪmistÃĪ terveydenhuoltoalalla, jossa vahvistusoppimisen agentit hoitavat tehtÃĪviÃĪ kuten hoidon politiikkojen optimointi. Vahvistusoppimista voidaan myÃķs kÃĪyttÃĪÃĪ rÃĪÃĪtÃĪlÃķidyn opetusmateriaalin luomiseen opiskelijoille.

Vahvistusoppimisen yhteenveto

Vahvistusoppiminen on voimakas menetelmÃĪ tekoÃĪlyagenttien rakentamiseen, joka voi johtaa vaikuttaviin ja joskus yllÃĪttÃĪviin tuloksiin. Agentin koulutus vahvistusoppimisen avulla voi olla monimutkainen ja haasteellinen, koska se vaatii monia koulutusjaksoja ja hienoa tasapainoa tutkimisen ja hyÃķdyntÃĪmisen vÃĪlillÃĪ. On kuitenkin, jos se onnistuu, agentti, joka on luotu vahvistusoppimisen avulla, voi suorittaa monimutkaisia tehtÃĪviÃĪ laajassa valikoimassa eri ympÃĪristÃķjÃĪ.

Blogger ja ohjelmoija, jolla on erityisalat Machine Learning ja Deep Learning -aiheissa. Daniel toivoo pystyvÃĪnsÃĪ auttamaan muita kÃĪyttÃĪmÃĪÃĪn tekoÃĪlyn voimaa sosiaaliseen hyvÃĪÃĪn.