AI:n perusteet
MikÃĪ on Few-Shot Learning?
Few-shot learning viittaa joukkoon algoritmeja ja tekniikoita, joita kÃĪytetÃĪÃĪn kehittÃĪmÃĪÃĪn tekoÃĪlymallia hyvin pienellÃĪ mÃĪÃĪrÃĪllÃĪ koulutusdataa. Few-shot learning pyrkii siihen, ettÃĪ tekoÃĪlymalli voi tunnistaa ja luokitella uuden datan ollessaan altistunut vain muutamalle koulutusinstanssille. Few-shot koulutus poikkeaa perinteisistÃĪ menetelmistÃĪ, joissa koulutetaan koneoppimismalleja, joissa yleensÃĪ kÃĪytetÃĪÃĪn suurta mÃĪÃĪrÃĪÃĪ koulutusdataa. Few-shot learning kÃĪytetÃĪÃĪn pÃĪÃĪasiassa tietokoneen nÃĪÃķn alalla.
Jotta voimme kehittÃĪÃĪ paremman intuitio few-shot learningista, tarkastelemme konseptia tarkemmin. Tarkastelemme few-shot learningin taustoja ja konsepteja, tutkimme erilaisia few-shot learningin tyyppejÃĪ ja kÃĪsittelyjÃĪ, ja tarkastelemme joitain few-shot learningiin kÃĪytettyjÃĪ malleja yleisellÃĪ tasolla. Lopulta tarkastelemme few-shot learningin sovelluksia.
MikÃĪ on Few-Shot Learning?
âFew-shot learningâ kuvaa kÃĪytÃĪnnÃķn, jossa koulutetaan koneoppimismallia vÃĪhÃĪisellÃĪ mÃĪÃĪrÃĪllÃĪ dataa. YleensÃĪ koneoppimismallit koulutetaan suurilla mÃĪÃĪrillÃĪ dataa, mitÃĪ enemmÃĪn, sitÃĪ paremmin. Few-shot learning on kuitenkin tÃĪrkeÃĪ koneoppimisen konsepti useista syistÃĪ.
Yksi syy few-shot learningin kÃĪyttÃķÃķn on, ettÃĪ se voi dramaattisesti vÃĪhentÃĪÃĪ koulutusdataa, jota tarvitaan tekoÃĪlymallin kouluttamiseen, mikÃĪ vÃĪhentÃĪÃĪ aikaa, joka kuluu suurten datasettien merkitsemiseen. Samoin few-shot learning vÃĪhentÃĪÃĪ tarvetta lisÃĪtÃĪ erityisiÃĪ ominaisuuksia eri tehtÃĪviin, kun kÃĪytetÃĪÃĪn yhteistÃĪ datasettiÃĪ luomaan eri nÃĪytteitÃĪ. Few-shot learning voi tehdÃĪ malleista robusteja ja kykeneviÃĪ tunnistamaan objekteja vÃĪhemmÃĪllÃĪ datalla, luoden yleisempiÃĪ malleja verrattuna erikoistuneisiin malleihin, jotka ovat normaalia.
Few-shot learning kÃĪytetÃĪÃĪn yleisimmin tietokoneen nÃĪÃķn alalla, koska tietokoneen nÃĪÃķn ongelmat vaativat joko suuria mÃĪÃĪriÃĪ dataa tai joustavaa mallia.
Alaluokat
âFew-shotâ learning on itse asiassa vain yksi oppimisen tyyppi, jossa kÃĪytetÃĪÃĪn vain muutamia koulutus-esimerkkejÃĪ. Koska kÃĪytetÃĪÃĪn vain âmuutamiaâ koulutus-esimerkkejÃĪ, on olemassa few-shot learningin alaluokkia, jotka liittyvÃĪt myÃķs kouluttamiseen vÃĪhÃĪisellÃĪ mÃĪÃĪrÃĪllÃĪ dataa. âOne-shotâ learning on toinen mallin kouluttamisen tyyppi, jossa opetetaan malli tunnistamaan objekti vain yhden sen kuvaamisen perusteella. Yleiset taktiikat, joita kÃĪytetÃĪÃĪn one-shot learningissa ja few-shot learningissa, ovat samat. On tÃĪrkeÃĪÃĪ muistaa, ettÃĪ âfew-shotâ learningin termejÃĪ voidaan kÃĪyttÃĪÃĪ yleisesti kuvaamaan tilanteita, joissa malli koulutetaan hyvin vÃĪhÃĪisellÃĪ mÃĪÃĪrÃĪllÃĪ dataa.
LÃĪhestymistavat Few-Shot Learningiin
Useimmat few-shot learningin lÃĪhestymistavat voidaan jakaa kolmeen kategoriaan: data-tasoiset lÃĪhestymistavat, parametri-tasoiset lÃĪhestymistavat ja metriikka-pohjaiset lÃĪhestymistavat.
Data-tasoiset LÃĪhestymistavat
Data-tasoiset lÃĪhestymistavat few-shot learningiin ovat hyvin yksinkertaisia konsepteja. Jotta voimme kouluttaa mallia, kun meillÃĪ ei ole riittÃĪvÃĪsti koulutusdataa, voimme vain hankkia enemmÃĪn koulutusdataa. On olemassa useita tekniikoita, joita data-tieteilijÃĪ voi kÃĪyttÃĪÃĪ lisÃĪtÃĪkseen koulutusdataa, jota hÃĪnellÃĪ on.
Samanlainen koulutusdata voi tukea tarkkaa kohde-dataa, jolle koulutamme luokittelijaa. Esimerkiksi, jos koulutamme luokittelijaa tunnistamaan tiettyjÃĪ koirien lajeja, mutta meillÃĪ ei ole paljon kuvia kyseisestÃĪ lajista, voimme sisÃĪllyttÃĪÃĪ paljon kuvia koirista, mikÃĪ auttaa luokittelijaa mÃĪÃĪrittÃĪmÃĪÃĪn yleiset piirteet, jotka muodostavat koiran.
Data-augmentaatio voi luoda enemmÃĪn koulutusdataa luokittelijalle. TÃĪmÃĪ tapahtuu yleensÃĪ soveltamalla muunnoksia olemassa olevaan koulutusdataan, kuten kierto-ominaisuuksia olemassa oleviin kuviin, jotta luokittelija voi tarkastella kuvia eri kulmista. GANit voidaan myÃķs kÃĪyttÃĪÃĪ luomaan uusia koulutus-esimerkkejÃĪ perustuen siihen, mitÃĪ ne oppivat vÃĪhÃĪisestÃĪ aidosta koulutusdatasta, jota meillÃĪ on.
Parametri-tasoiset LÃĪhestymistavat
Meta-oppiminen
Yksi parametri-tasoinen lÃĪhestymistapa few-shot learningiin liittyy tekniikan kÃĪyttÃķÃķn, jota kutsutaan âmeta-oppimiseksiâ. Meta-oppiminen liittyy opettamiseen mallille, mitkÃĪ ominaisuudet ovat tÃĪrkeitÃĪ koneoppimistehtÃĪvÃĪssÃĪ. TÃĪmÃĪ voidaan saavuttaa luomalla menetelmÃĪ, jolla sÃĪÃĪnnellÃĪÃĪn, miten mallin parametriavaruutta tutkitaan.
Meta-oppiminen kÃĪyttÃĪÃĪ kahta eri mallia: opettaja-mallia ja oppilas-mallia. âOpettajaâ-malli ja âoppilasâ-malli. Opettaja-malli oppii, miten kapseloida mallin parametriavaruus, kun taas oppilas-algoritmi oppii, miten tunnistaa ja luokitella kohteita datasetissÃĪ. Toisin sanoen opettaja-malli oppii, miten optimoida mallia, kun taas oppilas-malli oppii, miten luokitella. Opettaja-mallin tulokset kÃĪytetÃĪÃĪn oppilas-mallin kouluttamiseen, nÃĪyttÃĪen oppilas-mallille, miten navigoida suuren parametriavaruuden ylitse, joka johtuu liian vÃĪhÃĪisestÃĪ koulutusdatasta. SiitÃĪ johtuu âmetaâ meta-oppimisessa.
Yksi few-shot learning -mallien suurimmista ongelmista on, ettÃĪ ne voivat helposti ylioppia koulutusdatasta, koska ne usein sisÃĪltÃĪvÃĪt korkeatulotteisia avaruuksia. Rajoittamalla mallin parametriavaruutta voidaan ratkaista tÃĪmÃĪ ongelma, ja vaikka se voidaan saavuttaa soveltamalla sÃĪÃĪntelytekniikoita ja valitsemalla oikeat hÃĪviÃķfunktiot, opettaja-algoritmin kÃĪyttÃķ voi parantaa few-shot mallin suorituskykyÃĪ merkittÃĪvÃĪsti.
Few-shot learning -luokittelijamalli (oppilas-malli) pyrkii yleistÃĪmÃĪÃĪn perustuen vÃĪhÃĪiseen koulutusdataan, jota se on saanut, ja sen tarkkuus voidaan parantaa opettaja-mallin avulla, joka ohjaa sitÃĪ korkeatulotteisen parametriavaruuden ylitse. TÃĪmÃĪ yleinen arkkitehtuuri tunnetaan âgradient-pohjaisenaâ meta-oppimisena.
Koko prosessi gradient-pohjaisen meta-oppimisen kouluttamisesta on seuraava:
- Luo perus-oppilas (opettaja) -malli
- Kouluta perus-oppilas-malli tukidatassa
- Anna perus-oppilas-mallin palauttaa ennusteet kyselydatassa
- Kouluta meta-oppilas (oppilas) -malli hÃĪviÃķstÃĪ, joka johtuu luokitteluvirheestÃĪ
Meta-oppimisen Variations
Malli-agnostinen meta-oppiminen on menetelmÃĪ, jota voidaan kÃĪyttÃĪÃĪ perus gradient-pohjaisen meta-oppimisen tekniikan tÃĪydentÃĪmiseen.
Kuten mainittiin aiemmin, gradient-pohjainen meta-oppilas kÃĪyttÃĪÃĪ aiemmin opetetun opettaja-mallin kokemusta hienosÃĪÃĪtÃĪÃĪkseen itsensÃĪ ja toimittaa tarkemmin ennusteita vÃĪhÃĪisellÃĪ mÃĪÃĪrÃĪllÃĪ koulutusdataa. Kuitenkin, aloittaminen satunnaisesti alkuarvoitettuina parametreina tarkoittaa, ettÃĪ malli voi edelleen ylioppia datasta. Jotta voidaan vÃĪlttÃĪÃĪ tÃĪmÃĪ, luodaan âmalli-agnostinenâ meta-oppilas rajoittamalla opettaja-mallin vaikutusta. Sen sijaan, ettÃĪ oppilas-malli koulutettaisiin suoraan opettaja-mallin tekemien ennusteiden hÃĪviÃķstÃĪ, oppilas-malli koulutetaan hÃĪviÃķstÃĪ, joka johtuu omista ennusteistaan.
Jokaisen malli-agnostisen meta-oppimisen koulutusjakson aikana:
- Luo kopio nykyisestÃĪ meta-oppimismallista.
- Kopio koulutetaan opettaja-mallin / perus-mallin avulla.
- Kopio palauttaa ennusteet koulutusdatasta.
- Laskettu hÃĪviÃķ kÃĪytetÃĪÃĪn meta-oppimisen pÃĪivittÃĪmiseen.
Metric-Learning
Metric-learning lÃĪhestymistavat few-shot learning -mallin suunnittelussa tyypillisesti kÃĪyttÃĪvÃĪt perus etÃĪisyys-mittauksia vertailemaan nÃĪytteitÃĪ datasetissÃĪ. Metric-learning algoritmit, kuten kosinietÃĪisyys, kÃĪytetÃĪÃĪn luokittelijan luokittelua varten kysely-nÃĪytteiden perusteella niiden samankaltaisuudesta tukidatassa. Kuvaluokittelijan tapauksessa tÃĪmÃĪ tarkoittaisi vain luokittelua kuvien pintaominaisuuksien perusteella. Kun tukidatassa on valittu ja muunnettu upotusvektoriksi, tehdÃĪÃĪn sama kyselydatalle ja sitten verrataan vektorien arvoja, ja luokittelija valitsee luokan, jolla on lÃĪhimmÃĪt arvot vektoroituihin kyselyyn.
Edistyneempi metriikka-pohjainen ratkaisu on âprototyyppiverkkoâ. Prototyyppiverkot ryhmittelevÃĪt datapisteet yhdistÃĪmÃĪllÃĪ klusterointimallit metriikka-pohjaiseen luokitteluun, kuten yllÃĪ kuvattu. Kuten K-keskiarvo-klusteroinnissa, lasketaan keskipisteet luokille tukidatassa ja kyselydatassa. Sitten sovelletaan euklidista etÃĪisyysmittausta mÃĪÃĪrittÃĪmÃĪÃĪn ero kyselyjoukoissa ja tukidatassa olevien keskipisteiden vÃĪlillÃĪ ja mÃĪÃĪrittÃĪmÃĪÃĪn kyselyjoukon luokan sen mukaan, mikÃĪ tukidataluokka on lÃĪhempÃĪnÃĪ.
Useimmat muut few-shot learning -lÃĪhestymistavat ovat vain muunnelmia edellÃĪ kuvatuista perustekniikoista.
Sovellukset Few-Shot Learningiin
Few-shot learningilla on sovelluksia monissa eri tieteenalojen alueilla, kuten tietokoneen nÃĪÃķssÃĪ, luonnollisen kielen prosessoinnissa, robottiikassa, terveydenhuollossa ja signaalinkÃĪsittelyssÃĪ.
Few-shot learningin sovellukset tietokoneen nÃĪÃķn alalla sisÃĪltÃĪvÃĪt tehokkaan merkin tunnistamisen, kuvaluokittelun, objektitunnistamisen, objektin seuraamisen, liikkeen ennustamisen ja toiminnan sijainnin. Luonnollisen kielen prosessoinnin sovellukset few-shot learningiin sisÃĪltÃĪvÃĪt kÃĪÃĪnnÃķksen, lauseen tÃĪydentÃĪmisen, kÃĪyttÃĪjÃĪn aikomusten luokittelun, mielipidetutkimuksen ja moniluokan tekstin luokittelun. Few-shot learning voidaan kÃĪyttÃĪÃĪ robottiikassa auttamaan roboteja oppimaan tehtÃĪvistÃĪ vain muutamasta esimerkistÃĪ, jotta robotit voivat oppia suorittamaan toimintoja, liikkua ja navigoida ympÃĪrÃķivÃĪssÃĪ maailmassa. Few-shot lÃĪÃĪkekehitys on kehittyvÃĪ ala tekoÃĪlyterveydenhuollossa. Lopulta few-shot learningilla on sovelluksia akustisen signaalinkÃĪsittelyn alalla, joka on ÃĪÃĪnidataa analysoivien tekoÃĪlyjÃĪrjestelmien prosessi, joka antaa tekoÃĪlyjÃĪrjestelmille mahdollisuuden kloonata ÃĪÃĪniÃĪ vain muutamasta kÃĪyttÃĪjÃĪnÃĪytteestÃĪ tai ÃĪÃĪnen muunnosta yhdestÃĪ kÃĪyttÃĪjÃĪstÃĪ toiseen.












