AI:n perusteet

MikÃĪ on ylioppiminen?

mm
LisÃĪÃĪ Unite.AI suosikkilÃĪhteisiisi Google-palvelussa

MikÃĪ on ylioppiminen?

Kun koulutat neuroverkkoa, sinun on vÃĪltettÃĪvÃĪ ylioppimista. Ylioppiminen on ongelma koneoppimisessa ja tilastotieteessÃĪ, jossa malli oppii koulutusaineiston kuviot liian hyvin, selittÃĪen koulutusaineiston tÃĪydellisesti, mutta epÃĪonnistuen yleistÃĪmÃĪÃĪn ennustusvoimaansa muihin aineistoihin.

Toisin sanoen, ylioppimisen tapauksessa malli usein nÃĪyttÃĪÃĪ erittÃĪin korkeaa tarkkuutta koulutusaineistossa, mutta matalaa tarkkuutta tulevaisuuden aineistoissa, jotka suoritetaan mallissa. TÃĪmÃĪ on nopea mÃĪÃĪritelmÃĪ ylioppimiselle, mutta tarkastellaan ylioppimisen kÃĪsitettÃĪ tarkemmin. Tarkastellaan, miten ylioppiminen tapahtuu ja miten sitÃĪ voidaan vÃĪlttÃĪÃĪ.

YmmÃĪrtÃĪminen “sopeutumisesta” ja aliopeutumisesta

On hyÃķdyllistÃĪ tarkastella aliopeutumisen ja “sopeutumisen” kÃĪsitettÃĪ yleensÃĪ, kun keskustellaan ylioppimisesta. Kun koulutamme mallia, yritÃĪmme kehittÃĪÃĪ kehyksen, joka pystyy ennustamaan kohteiden luonteen tai luokan aineistossa, aineistossa kuvattujen ominaisuuksien perusteella. Mallin on kyettÃĪvÃĪ selittÃĪmÃĪÃĪn aineiston sisÃĪltÃĪmÃĪ kuviointi ja ennustamaan tulevaisuuden data-pisteiden luokat tÃĪmÃĪn kuvioiden perusteella. MitÃĪ paremmin malli selittÃĪÃĪ koulutusaineiston ominaisuuksien vÃĪlisen suhteen, sitÃĪ â€œsopeutuneempi” mallimme on.

Sininen viiva edustaa mallin ennusteita, jotka ovat aliopeutuneita, kun taas vihreÃĪ viiva edustaa paremmin sopeutunutta mallia. Kuva: Pep Roca via Wikimedia Commons, CC BY SA 3.0, (https://commons.wikimedia.org/wiki/File:Reg_ls_curvil%C3%ADnia.svg)

Malli, joka selittÃĪÃĪ huonosti koulutusaineiston ominaisuuksien vÃĪlisen suhteen ja siten epÃĪonnistuu ennustamaan tulevaisuuden data-esimerkit, on aliopeutunut. Jos piirtÃĪisit mallin ennustaman suhteen graafina, ennusteet poikkeaisivat merkittÃĪvÃĪsti. Jos olisimme graafi, jossa olisi koulutusaineiston todelliset arvot, aliopeutunut malli olisi selvÃĪsti vÃĪÃĪrÃĪ. Paremmalla sopeutumisella varustettu malli voisi kulkea data-pisteiden lÃĪpi, jokainen data-piste olisi ennustetun arvon lÃĪhellÃĪ.

Aliopeutuminen voi usein tapahtua, kun aineistoa ei ole tarpeeksi luotettavan mallin luomiseksi, tai kun yritetÃĪÃĪn suunnitella lineaarista mallia epÃĪlineaariselle aineistolle. LisÃĪÃĪ koulutusaineistoa tai ominaisuuksia usein auttaa vÃĪhentÃĪmÃĪÃĪn aliopeutumista.

Miksi emme siis luoda mallia, joka selittÃĪÃĪ jokaisen koulutusaineiston pisteen tÃĪydellisesti? Onko tÃĪydellinen tarkkuus toivottavaa? Luomalla mallin, joka on oppinut koulutusaineiston kuviot liian hyvin, aiheutamme ylioppimisen. Koulutusaineisto ja muut, tulevaisuudessa suoritettavat aineistot eivÃĪt ole tÃĪysin samanlaisia. Ne ovat todennÃĪkÃķisesti hyvin samanlaisia monilla tavoin, mutta ne myÃķs poikkeavat tÃĪrkeissÃĪ suhteissa. Siksi mallin suunnittelussa, joka selittÃĪÃĪ koulutusaineiston tÃĪydellisesti, pÃĪÃĪdytÃĪÃĪn teoriaan, joka ei yleisty hyvin muihin aineistoihin.

YmmÃĪrtÃĪminen ylioppimisesta

Ylioppiminen tapahtuu, kun malli oppii koulutusaineiston yksityiskohtia liian hyvin, aiheuttaen mallille ongelmia, kun tehdÃĪÃĪn ennusteita ulkoisista aineistoista. TÃĪmÃĪ voi tapahtua, kun malli oppii koulutusaineiston ominaisuuksien lisÃĪksi myÃķs satunnaisia muutoksia tai “mÃĪtÃĪ” aineistossa, antaen nÃĪille satunnaisille/asiallisille ilmiÃķille liian suuren merkityksen.

Ylioppiminen on todennÃĪkÃķisempÃĪÃĪ, kun ei-parametrinen koneoppimisalgoritmi kÃĪytetÃĪÃĪn, koska ne ovat joustavampia koulutusaineiston ominaisuuksien oppimisessa. Ei-parametrisissa koneoppimisalgoritmeissa on usein erilaisia parametreja ja tekniikoita, joita voidaan soveltaa rajoittamaan mallin herkkyyttÃĪ aineistoon ja siten vÃĪhentÃĪmÃĪÃĪn ylioppimista. Esimerkiksi pÃĪÃĪtÃķspuumallit ovat erittÃĪin herkkÃĪ ylioppimiselle, mutta tekniikkaa, jossa poistetaan satunnaisesti osa yksityiskohtia, joita malli on oppinut, voidaan kÃĪyttÃĪÃĪ.

Jos piirtÃĪisit mallin ennusteita x- ja y-akseleilla, sinulla olisi ennusteiden viiva, joka loikkaa edestakaisin, mikÃĪ heijastaa sitÃĪ, ettÃĪ malli on yrittÃĪnyt liian kovasti sovittaa kaikki koulutusaineiston pisteet selitykseensÃĪ.

Ylioppimisen hallitseminen

Kun koulutamme mallia, haluamme, ettÃĪ malli tekee mahdollisimman vÃĪhÃĪn virheitÃĪ. Kun mallin suorituskyky lÃĪhestyy oikein tehtyjÃĪ ennusteita koulutusaineiston kaikissa data-pisteissÃĪ, mallin sopeutuminen paranee. Hyvin sopeutunut malli pystyy selittÃĪmÃĪÃĪn lÃĪhes koko koulutusaineiston ilman ylioppimista.

Mallin suorituskyky paranee koulutuksen aikana. Mallin virheen mÃĪÃĪrÃĪ vÃĪhenee koulutuksen edetessÃĪ, mutta se laskee vain tiettyyn pisteeseen. Piste, jossa mallin suorituskyky testiaineistossa alkaa heiketÃĪ, on yleensÃĪ se piste, jossa ylioppiminen alkaa. Saadakseen parhaan sopeutumisen malliin, haluamme lopettaa mallin koulutuksen pisteessÃĪ, jossa koulutusaineistossa tapahtuu vÃĪhiten virheitÃĪ, ennen kuin virheen mÃĪÃĪrÃĪ alkaa kasvaa uudelleen. Optimaalinen lopetuspiste voidaan mÃĪÃĪrittÃĪÃĪ piirtÃĪmÃĪllÃĪ mallin suorituskyky koulutuksen aikana ja lopettamalla koulutus, kun virheen mÃĪÃĪrÃĪ on alin. On kuitenkin yksi riski tÃĪssÃĪ ylioppimisen hallitsemistavassa: testidatan kÃĪyttÃĪminen koulutuksen pÃĪÃĪttymispisteen mÃĪÃĪrittÃĪmiseen tarkoittaa, ettÃĪ testidata ei ole enÃĪÃĪ tÃĪysin “koskematon” data.

On useita tapoja, joilla voidaan vÃĪhentÃĪÃĪ ylioppimista. Yksi tapa vÃĪhentÃĪÃĪ ylioppimista on kÃĪyttÃĪÃĪ uudelleenmallinnusstrategiaa, joka toimii arvioimalla mallin tarkkuutta. Voit myÃķs kÃĪyttÃĪÃĪ validointiaineistoa testiaineiston lisÃĪksi ja piirtÃĪÃĪ koulutusaineiston tarkkuuden validointiaineiston sijaan testiaineistoa vasten. TÃĪllÃĪ tavoin testiaineisto sÃĪilyy nÃĪkemÃĪttÃķmÃĪnÃĪ. Yksi suosittu uudelleenmallinnusmenetelmÃĪ on K-kertaisen ristinvalidoinnin tekniikka. TÃĪmÃĪ tekniikka mahdollistaa aineiston jakamisen osiin, joilla malli koulutetaan, ja sitten mallin suorituskyky nÃĪissÃĪ osissa analyysoidaan arvioimaan, miten malli toimii ulkoisilla aineistoilla.

Uudelleenmallinnuksen kÃĪyttÃĪminen on yksi parhaista tavoista arvioida mallin tarkkuutta nÃĪkemÃĪttÃķmÃĪlle aineistolle, ja yhdistettynÃĪ validointiaineistoon ylioppiminen voidaan usein pitÃĪÃĪ vÃĪhÃĪisimmillÃĪÃĪn.

Blogger ja ohjelmoija, jolla on erityisalat Machine Learning ja Deep Learning -aiheissa. Daniel toivoo pystyvÃĪnsÃĪ auttamaan muita kÃĪyttÃĪmÃĪÃĪn tekoÃĪlyn voimaa sosiaaliseen hyvÃĪÃĪn.