AI-mallit ja alustat

SEER: Murrteollinen edistysaskel itseohjautuvissa tietokoneen näön malleissa?

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
SEER Framework for Self Supervised Learning

Viimeisen vuosikymmenen aikana tekoäly (AI) ja koneoppiminen (ML) ovat edistyneet valtavasti. Nykyään ne ovat tarkin ja tehokkain kuin koskaan aiemmin. Nykyaikaiset tekoäly- ja koneoppimismallit voivat tunnistaa esineitä kuvista tai videosta täsmällisesti ja luoda tekstiä ja puhetta, joka vastaa ihmisen älykkyyttä.

Nykyiset tekoäly- ja koneoppimismallit riippuvat voimakkaasti koulutusaineistosta, joka opettaa niille, miten tulkita teksti, tunnistaa esineitä kuvista tai videosta ja suorittaa muita tehtäviä.

Vaikka tekoäly- ja koneoppimismallit ovat tehokkaita, ne eivät ole täydellisiä, ja tutkijat pyrkivät kehittämään malleja, jotka voivat oppia ilman merkittyjä tai annotoituja aineistoja. Tämä lähestymistapa tunnetaan itseohjautuvana oppimisena, ja se on yksi tehokkaimmista tavoista kehittää koneoppimis- ja tekoälymalleja, joilla on “yhteinen äly” tai taustatieto ratkaista ongelmia, jotka ovat nykyisten tekoälymallien ulottumattomissa.

Itseohjautuva oppiminen on jo osoittanut tuloksia luonnollisen kielen prosessoinnissa, sillä se on mahdollistanut suurten mallien kouluttamisen valtavalle aineistolle ja johtanut useisiin läpimurtoihin luonnollisen kielen inference, konekäännös ja kysymys-vastaus -kentillä.

Facebookin kehittämä SEER-malli pyrkii maksimoimaan itseohjautuvan oppimisen mahdollisuuksia tietokoneen näön alalla. SEER eli SElf-supERvised on itseohjautuva tietokoneen näön oppimismalli, jolla on yli miljardi parametriä, ja se pystyy löytämään kuvista ja oppimaan niistä ilman oikein merkittyjä tai annotoituja aineistoja.

Itseohjautuvan oppimisen tarve tietokoneen näössä

Aineiston annotointi tai aineiston merkitseminen on esikäsittelyvaihe tekoäly- ja koneoppimismallien kehittämisessä. Aineiston annotointiprosessi tunnistaa raakaa aineistoa, kuten kuvia tai videoframeja, ja lisää aineistoon merkit, jotka määrittävät aineiston kontekstin mallille. Nämä merkit mahdollistavat mallin tehdä tarkkoja ennusteita aineistosta.

Yksi suurimmista haasteista, joita kehittäjät kohtaavat tietokoneen näön mallien kehittämisessä, on laadukkaiden annotoitujen aineistojen löytäminen. Nykyiset tietokoneen näön mallit riippuvat näistä merkityistä aineistoista oppiakseen tunnistamaan esineitä kuvista.

Aineiston annotointi ja sen käyttö tietokoneen näön malleissa asettavat seuraavat haasteet:

Aineiston laadun hallinta

Todennäköisesti suurin haaste on saada laadukkaita aineistoja jatkuvasti, sillä laadukkaat aineistot johtavat parempaan oppimiseen ja tarkempiin malleihin. Kuitenkin laadukkaiden aineistojen löytäminen on haasteellista.

Työvoiman hallinta

Aineiston merkitseminen liittyy usein työvoiman hallintaan, sillä suuri määrä työntekijöitä tarvitaan suurten määrän raakaa ja merkittämätöntä aineistoa käsittelyyn ja laadun varmistamiseen. On tärkeää, että kehittäjät löytävät tasapainon laadun ja määrän välillä aineiston merkitsemisessä.

Taloudelliset rajoitukset

Todennäköisesti suurin haaste on aineiston merkitsemiseen liittyvät taloudelliset rajoitukset, sillä aineiston merkitseminen on usein merkittävä osa koko projektin kustannuksista.

Kuten voidaan nähdä, aineiston annotointi on suuri haaste tietokoneen näön mallien kehittämisessä, erityisesti kehittäessä monimutkaisia malleja, jotka vaativat suuria määriä koulutusaineistoa. Tämä on syynä, miksi tietokoneen näön teollisuus tarvitsee itseohjautuvaa oppimista kehittääkseen monimutkaisia ja edistyneitä tietokoneen näön malleja, jotka pystyvät ratkaisemaan tehtäviä, jotka ovat nykyisten mallien ulottumattomissa.

On jo olemassa useita itseohjautuvia oppimismalleja, jotka ovat suorittaneet hyvin kontrolloiduissa ympäristöissä, pääasiassa ImageNet-aineistolla. Vaikka nämä mallit saattavat suorittaa hyvin, ne eivät tyydytä itseohjautuvan oppimisen perusvaatimukseen tietokoneen näössä: oppia mistä tahansa rajattomasta aineistosta tai satunnaisesta kuvasta, eikä vain kuratoiduista aineistoista.

SEER-malli: Johdanto

Viimeaikaiset trendit tekoäly- ja koneoppimisteollisuudessa ovat osoittaneet, että esikoulutuslähestymistavat, kuten puolivaltainen, heikkovaltainen ja itseohjautuva oppiminen, voivat parantaa suorituskykyä useimmissa syvissä oppimismalleissa alimmissa tehtävissä.

On kaksi tärkeää tekijää, jotka ovat vaikuttaneet näiden syvien oppimismallien suorituskyvyn parantamiseen.

Esikoulutus suurilla aineistoilla

Esikoulutus suurilla aineistoilla johtaa yleensä parempaan tarkkuuteen ja suorituskykyyn, sillä se altistaa mallin laajalle aineistolle. Suuri aineisto mahdollistaa mallin ymmärtää aineistossa olevia kuvioita paremmin, mikä johtaa lopulta siihen, että malli suorittaa paremmin todellisissa tilanteissa.

Jotkut parhaiten suorittavat mallit, kuten GPT-3-kielimalli ja Wav2vec 2.0-puhetunnistusmalli, on koulutettu suurilla aineistoilla. GPT-3-kielimalli käyttää esikoulutusaineistoa, jossa on yli 300 miljardia sanaa, kun taas Wav2vec 2.0-puhetunnistusmalli käyttää aineistoa, jossa on yli 53 000 tuntia äänen aineistoa.

Mallit suurella kapasiteetilla

Mallit, joilla on suurempi määrä parametreja, usein johtavat tarkempiin tuloksiin, sillä suurempi määrä parametreja mahdollistaa mallin keskittyä aineistossa oleviin kohteisiin, jotka ovat välttämättömiä, eikä häiriöihin tai meluun aineistossa.

Kehittäjät ovat aiemmin yrittäneet kouluttaa itseohjautuvia oppimismalleja merkittämättömälle tai kuratoiduille aineistoille, mutta pienemmällä aineistolla, joka sisälsi vain muutaman miljoonan kuvan. Voisivatko itseohjautuvat oppimismallit johtaa korkeaan tarkkuuteen, kun ne koulutetaan suurella määrällä merkittämätöntä ja kuratoiduitta aineistoa? Tämä on juuri se kysymys, jonka SEER-malli pyrkii vastaamaan.

SEER-malli on syvä oppimisen kehys, joka pyrkii rekisteröimään internetissä olevia kuvia riippumatta kuratoiduista tai merkityistä aineistoista. SEER-kehys mahdollistaa kehittäjien kouluttaa suuria ja monimutkaisia koneoppimismalleja satunnaisilla aineistoilla ilman valvontaa, eli malli analysoi aineiston ja oppii kuvioita ja tietoa ilman lisättyä manuaalista syöttöä.

SEER-mallin lopullinen tavoite on auttaa kehittämään strategioita esikoulutusprosessiin, joka käyttää kuratoiduitta aineistoa saavuttamaan huipputason suorituskykyä siirtymisoppimisessa. Lisäksi SEER-malli pyrkii luomaan järjestelmiä, jotka voivat jatkuvasti oppia loputtomasta aineistovirrasta itseohjautuvalla tavalla.

SEER-kehys kouluttaa suurikapasiteettisia malleja miljardien satunnaisista ja rajoittamattomista internetistä poimittujen kuvien avulla. Nämä mallit, jotka on koulutettu näillä kuvilla, eivät riipu kuvien metatiedoista tai annotaatioista koulutuksen aikana, eikä aineistoa suodateta tai kuratoida.

SEER-kehys ja RegNet: Mitä yhteistä?

Analysoitaessa SEER-mallia, se keskittyy RegNet-arkkitehtuuriin, jossa on yli 700 miljoonaa parametriä, mikä on yhtäpitävää SEER-mallin tavoitteen kanssa itseohjautuvasta oppimisesta kuratoiduilla aineistoilla kahteen tärkeään syyn:

  1. Ne tarjoavat täydellisen tasapainon suorituskyvyn ja tehokkuuden välillä.
  2. Ne ovat erittäin joustavia ja voivat skaalautua useiden parametrejen määrään.

SEER-kehys: Aikaisemmat työt eri aloilta

SEER-kehys pyrkii tutkimaan itseohjautuvan oppimisen rajoja suurten mallirakenteiden kouluttamisessa kuratoiduilla tai merkittämättömillä aineistoilla itseohjautuvalla oppimisella, ja malli hakee inspiraatiota aiemmista töistä alalla.

Valvomaton esikoulutus visuaalisille ominaisuuksille

Itseohjautuva oppiminen on jo toteutettu tietokoneen näössä menetelmien avulla, jotka käyttävät autoenkoodereita, instanssitason eroa, tai klusterointia. Viimeaikaisissa tutkimuksissa on osoitettu, että esikoulutusmallit, jotka käyttävät kontrastia oppimismenetelmää, voivat suorittaa paremmin kuin valvottu oppiminen alimmissa tehtävissä.

Tärkein oivallus valvomattomasta oppimisesta visuaalisille ominaisuuksille on, että riittävän suuren aineiston koulutuksessa ei välttämättä tarvita valvontaa. SEER-malli pyrkii tutkimaan, voivatko mallit oppia tarkkoja edustuksia, kun suuria mallirakenteita koulutetaan suurella määrällä kuratoiduitta, merkittämätöntä ja satunnaisia kuvia.

Visuaalisten ominaisuuksien oppiminen suuressa mittakaavassa

Aikaisemmat mallit ovat hyötyneet esikoulutuksesta suurilla merkityillä aineistoilla heikkovaltaisella, valvottavalla ja puolivaltaisella oppimisella ja semi-supervised oppimisella miljoonien kuratoiden kuvien kanssa. Lisäksi mallianalyysi on osoittanut, että esikoulutus suurilla aineistoilla usein johtaa parempaan tarkkuuteen verrattuna koulutukseen alusta alkaen.

Kuitenkin esikoulutus suuressa mittakaavassa usein riippuu aineiston suodatusvaiheista, jotka tekevät kuvat yhtenäisiksi kohdekäsitteiden kanssa. Nämä suodatusvaiheet käyttävät joko ennustuksia esikoulutetusta luokittelijasta tai hashtag-merkintöjä, jotka ovat usein ImageNet-luokkien synonyymejä. SEER-malli toimii eri tavalla, sillä se pyrkii oppimaan ominaisuuksia minkä tahansa satunnaisen kuvan avulla, eikä koulutusaineistoa kuratoida määrättyjen ominaisuuksien tai käsitteiden mukaan.

Kuvatunnistusarkkitehtuurien skaalautuminen

Mallit hyötyvät suurten arkkitehtuuriensa kouluttamisesta paremman laadun visuaalisille ominaisuuksille. On tärkeää kouluttaa suuria arkkitehtuureja, kun esikoulutus suuressa mittakaavassa on tärkeää, sillä malli, jolla on rajoitettu kapasiteetti, usein alikouluttaa. Tämä on erityisen tärkeää, kun esikoulutus tehdään kontrastia oppimismenetelmän avulla, sillä malli on oppinut erottamaan aineiston instansseja, jotta se voi oppia paremmin visuaalisia edustuksia.

Kuitenkin kuvatunnistuksen arkkitehtuurin skaalautuminen vaatii enemmän kuin vain syvyyden ja leveyden muuttamista, ja suuren kapasiteetin mallin rakentamiseen vaaditaan paljon kirjallisuutta. SEER-malli osoittaa RegNets-malliperheen hyödyt itseohjautuvan oppimisen käytössä suuressa mittakaavassa.

SEER: Menetelmät ja komponentit

SEER-kehys käyttää useita menetelmiä ja komponentteja esikoulutuksen aikana visuaalisten edustusten oppimiseen. SEER-kehys käyttää seuraavia menetelmiä ja komponentteja:

Itseohjautuva esikoulutus SwAV:llä

SEER-kehys koulutetaan SwAV:llä, joka on online-itseohjautuva oppimismenetelmä. SwAV on online-klusterointimenetelmä, jota käytetään kouluttamaan convnets-kehys ilman annotaatioita. SwAV-kehys toimii kouluttamalla upotusta, joka tuottaa klusterin määrityksiä johdonmukaisesti eri näkymien välillä samasta kuvasta. Järjestelmä oppii semanttisia edustuksia etsimällä klustereita, jotka ovat invariantteja datan muokkauksille.

Käytännössä SwAV-kehys vertaa eri näkymien ominaisuuksia niiden itsenäisten klusterin määritysten avulla. Jos nämä määritykset havaitsevat samat tai samanlaiset ominaisuudet, on mahdollista ennustaa yhden kuvan määritys toisen näkymän ominaisuuksien avulla.

SEER-malli käyttää K-klustereita, ja kunkin klusterin on liitetty oppimiskykyinen d-ulotteinen vektori vk. Kuvien erässä, joka sisältää B-kuvia, kunkin kuvan i on muunnettu kahteen eri näkymään: xi1 ja xi2. Näkymät on sitten piirretty convnetin avulla, ja se johtaa kahteen joukkoon ominaisuuksia: (f11, …, fB2), ja (f12, … , fB2). Kunkin ominaisuusjoukon on määritetty itsenäisesti klusterin määrityksiin Optimal Transport -ratkaisijan avulla.

Optimal Transport -ratkaisija varmistaa, että ominaisuudet jaetaan tasaisesti klustereiden kesken, ja se auttaa välttämään triviaalisia ratkaisuja, joissa kaikki edustukset on kartoitettu yhteen prototyyppiin. Tuloksena oleva määritys on sitten vaihdettu kahden joukon välillä: klusterin määritys yi1 näkymälle xi1 tulee ennustaa käyttäen ominaisuusjoukkoa fi2 näkymälle xi2, ja päinvastoin.

Prototyyppipainot ja convnet on koulutettu vähentämään tappiota kaikille esimerkeille. Klusterin ennustustappio l on periaatteessa softmaxin ja f:n, ja klusterin määrityksen pistetulo.

RegNetY: Skaalautuva malliperhe

Skaalautuvan kapasiteetin ja aineiston vaatii arkkitehtuureja, jotka ovat tehokkaita sekä muistin että ajankäytön suhteen, ja RegNets-kehys on malliperhe, joka on suunniteltu tähän tarkoitukseen.

RegNet-malliperhe on määritelty convnets-arkkitehtuureilla, joissa on 4 vaihetta, ja kussakin vaiheessa on sarja identtisiä blokkeja, ja varmistetaan, että blokin rakenne säilyy kiinteänä, pääasiassa residual-bottleneck-blokin.

SEER-kehys keskittyy RegNetY-arkkitehtuuriin ja lisää Squeeze-and-Excitation-mekanismin RegNets-arkkitehtuuriin parantamaan sen suorituskykyä. Lisäksi RegNetY-malli on 5 parametriä, jotka auttavat etsimään hyviä instansseja kiinteällä määrällä FLOPs, jotka kuluttavat kohtuullisia resursseja. SEER-malli pyrkii parantamaan tuloksiaan toteuttamalla RegNetY-arkkitehtuurin suoraan itseohjautuvassa esikoulutustehtävässä.

RegNetY 256GF -arkkitehtuuri: SEER-malli keskittyy pääasiassa RegNetY 256GF -arkkitehtuuriin RegNetY-perheessä, ja sen parametri käyttää RegNets-arkkitehtuurin skaalautumissääntöä. Parametrit on kuvattu seuraavasti.

RegNetY 256GF -arkkitehtuuri on 4-vaiheinen, ja vaiheleveydet ovat (528, 1056, 2904, 7392), ja vaiheiden syvyydet ovat (2,7,17,1), mikä johtaa yli 696 miljoonaan parametriin. Kouluttaessa 512 V100 32GB NVIDIA (NVDA ) -näytönohjaimella, kunkin iteraation kestää noin 6125 ms eräkoossa 8 704 kuvaa. Kouluttaessa mallia aineistolla, jossa on yli miljardi kuvaa, eräkoossa 8 704 kuvaa yli 512 GPU:lla, vaaditaan 114 890 iteraatiota, ja koulutus kestää noin 8 päivää.

Optimointi ja koulutus suuressa mittakaavassa

SEER-malli ehdottaa useita sopeutumisia kouluttaa itseohjautuvia menetelmiä soveltamaan ja sopeuttaa nämä menetelmät suurella mittakaavalla. Nämä menetelmät ovat:

  1. Oppimissäännön aikataulu.
  2. Muistin kulutuksen vähentäminen GPU:lla.
  3. Koulutusnopeuden optimointi.
  4. Esikoulutusaineiston suuri mittakaava.

Tutustumme niihin lyhyesti.

Oppimissäännön aikataulu

SEER-malli tutkii mahdollisuutta käyttää kahta oppimissääntöä: kosiniaalista oppimissääntöä ja kiinteää oppimissääntöä.

Kosiniallinen oppimissääntö on käytetty vertaamaan eri malleja reilusti, ja se sopeutuu päivitysten määrään. Kuitenkin kosiniallinen oppimissääntö ei sopeudu suurelle mittakaavalle, koska se painottaa kuvia, kun ne nähdään koulutuksen aikana, ja se käyttää täysiä päivityksiä aikatauluttamiseen.

Kiinteä oppimissääntö pitää oppimissäännön kiinteänä, kunnes tappio ei laske, ja sitten oppimissääntö jaetaan kahdella. Analyysi osoittaa, että kiinteä oppimissääntö toimii paremmin, koska siinä on enemmän joustavuutta koulutuksen tekemiseen. Kuitenkin, koska malli koulutetaan vain yhdellä miljardilla kuvalla, se käyttää kosiniallista oppimissääntöä kouluttaessaan suurinta mallia, RegNet 256GF:iä.

Muistin kulutuksen vähentäminen GPU:lla

Malli pyrkii myös vähentämään GPU:n muistikulutusta käyttämällä sekoitettua tarkkuutta ja asteittaista checkpointingia. Malli käyttää NVIDIA Apex -kirjaston O1-optimointitason suorittamaan operaatioita, kuten konvoluutioita ja GEMM:ejä, 16-bittisessä liukulukumuodossa. Malli käyttää myös PyTorchin gradient checkpointing -toteutusta, joka vaihtaa laskentaa muistiin.

Lisäksi malli hylkää välittömät aktivaatiot, jotka tehdään eteenpäin suorittamisen aikana, ja takaisin suorittamisen aikana, se lasketaan uudelleen nämä aktivaatiot.

Koulutusnopeuden optimointi

Sekoitetun tarkkuuden käyttäminen muistin käytön optimointiin on lisäksi hyödyllistä, koska kiihdyttimet hyötyvät FP16:n pienemmästä koosta verrattuna FP32:een, mikä parantaa läpimenoa muistin kaistanleveyden pullonkaulassa.

SEER-malli synchronoi myös BatchNorm-kerroksen GPU:iden välillä luomalla prosessiryhmät sen sijaan, että käytettäisiin globaalia synkronointia, joka yleensä kestää enemmän aikaa. Lopulta data loader, jota SEER-malli käyttää, hakee enemmän koulutuserää, mikä johtaa suurempaan määrään dataa, joka suoritetaan verrattuna PyTorchin data loaderiin.

Esikoulutusaineisto suuressa mittakaavassa

SEER-malli käyttää yli miljardi kuvaa esikoulutuksessa, ja se käyttää data loaderia, joka ottaa satunnaisia kuvia suoraan internetistä ja Instagramista. Koska SEER-malli kouluttaa nämä kuvat villinä ja online, se ei sovella niille esikäsittelyä eikä kuratoimista prosesseja, kuten de-duplikaatiota tai hashtag-suodatusta.

On huomattava, että aineisto ei ole staattinen, ja aineistossa olevat kuvat päivitetään joka kolmas kuukausi. Kuitenkin aineiston päivittäminen ei vaikuta mallin suorituskykyyn.

SEER-mallin toteutus

SEER-malli kouluttaa RegNetY 256GF:n SwAV:llä kuudella viljellyllä koko kuvasta, jokaisella kuvalla on resoluutio 2×224 + 4×96. Esikoulutusvaiheessa malli käyttää 3-kerroksista MLP:ä (Multi-Layer Perceptron) projektiopäillä, joiden ulottuvuudet ovat 10444×8192, 8192×8192 ja 8192×256.

Mallin sijaan, että käytettäisiin BatchNorm-kerroksia päässä, SEER-malli käyttää 16 000 prototyyppiä, joiden lämpötila on asetettu 0,1:een. Sinkhorn-säännöstysparametri on asetettu 0,05:een, ja se suorittaa 10 iteraatiota algoritmiin. Malli synchronoi myös BatchNorm-tilastot GPU:iden välillä ja luo useita prosessiryhmiä, kooltaan 64, synkronointia varten.

Lisäksi malli käyttää LARS (Layer-wise Adaptive Rate Scaling) -optimointia, painon katoa 10-5, aktivaatiopisteytyspisteitä ja O1-sekoitettua tarkkuuden optimointia. Malli koulutetaan stokastisen gradientin laskeutumismenetelmällä, eräkoossa 8192 satunnaisella kuvalla, jakautuneena 512 NVIDIA GPU:lle, mikä johtaa 16 kuvaa GPU:lle.

Oppimissääntö on kasattu lineaarisesti 0,15:stä 9,6:een ensimmäisten 8 000 koulutus päivityksen aikana. Lämmittelyn jälkeen malli seuraa kosinista oppimissääntöä, joka laskee loppuarvoon 0,0096. Kaiken kaikkiaan SEER-malli kouluttaa yli miljardi kuvaa 122 000 iteraatiolla.

SEER-kehys: Tulokset

Itseohjautuvan esikoulutuksen lähestymistavan tuottamien ominaisuuksien laatu tutkitaan ja analysoidaan useilla eri mittareilla ja alimmissa tehtävissä. Malli ottaa myös huomioon matalan otoksen asetelmat, joissa on rajoitettu pääsy kuvien ja niiden merkintöjen luokitteluun alimmissa tehtävissä.

Suuren esikoulutetun mallin hienosäätö

Mallin mittaa esikoulutetuilla malleilla, jotka on siirretty ImageNet-mittariin objektien luokitteluun. Tulokset suurten esikoulutettujen mallien hienosäätössä määritetään seuraavilla parametreillä.

Kokeelliset asetukset

Malli kouluttaa 6 RegNet-arkkitehtuuria eri kapasiteeteilla, nimittäin RegNetY- {8,16,32,64,128,256}GF, yli miljardin satunnaisen ja julkisen Instagram-kuvan kanssa SwAV:llä. Mallit siirretään sitten hienosäätöä varten kuvien luokitteluun ImageNetissä, joka käyttää yli 1,28 miljoonaa standardikoulutuskuva, ja siinä on 50 000 kuvan standardivahvistusjoukko arviointia varten.

Malli soveltaa samaa data-augmentaatiotekniikkaa kuin SwAV, ja hienosäätöä 35 episodin ajan SGD-optimoinnilla (Stokastinen Gradient Descent) eräkoossa 256:lla, oppimissäännöllä 0,0125, joka vähenee kymmenesosalla 30 episodin jälkeen, liikemäärällä 0,9 ja painon kadolla 10-4. Malli raportoi ylin tarkkuuden validointijoukossa käyttäen keskustan leikkausta 224×224.

Vertailu muihin itseohjautuviin esikoulutuslähestymistapoihin

Seuraavassa taulukossa vertaillaan suurinta esikoulutettua mallia RegNetY-256GF:ä olemassa oleviin esikoulutettuihin malleihin, jotka käyttävät itseohjautuvaa oppimislähestymistapaa.

Kuten voidaan nähdä, SEER-malli palauttaa yhden tarkin tarkkuuden 84,2 %:na ImageNetissä, ja yllättää SimCLRv2:n, parhaimman olemassa olevan esikoulutetun mallin, 1 %:lla.

Lisäksi seuraava kuva vertaa SEER-kehystä malleihin, joilla on eri kapasiteetit. Kuten voidaan nähdä, riippumatta mallin kapasiteetista, yhdistämällä RegNet-kehys SwAV:hen, saadaan tarkat tulokset esikoulutuksessa.

SEER-malli on esikoulutettu satunnaisilla kuvilla, ja niissä on RegNet-arkkitehtuuri ja itseohjautuva oppimismenetelmä SwAV. SEER-malli vertaillaan SimCLRv2- ja ViT-malleihin, joissa on eri verkkoarkkitehtuureja. Lopulta malli siirretään ImageNet-aineistolle, ja ylin tarkkuus ilmoitetaan.

Mallin kapasiteetin vaikutus

Mallin kapasiteetilla on merkittävä vaikutus esikoulutuksen suorituskykyyn, ja seuraava kuva vertaa sitä, kun koulutetaan alusta alkaen.

Voidaan selvästi nähdä, että esikoulutettujen mallien ylin tarkkuus on korkeampi kuin mallien, jotka on koulutettu alusta alkaen, ja ero kasvaa, kun parametreja lisätään. On myös selvää, että vaikka mallin kapasiteetti hyödyttää sekä esikoulutettuja että koulutettuja malleja, vaikutus on suurempi esikoulutetuilla malleilla, kun on kyse suuresta määrästä parametreja.

Mahdollinen syy sille, miksi mallin koulutus alusta alkaen voi johtaa ylioppimiseen, kun koulutetaan ImageNet-aineistolla, on aineiston pieni koko.

Matalan otoksen oppiminen

Matalan otoksen oppiminen tarkoittaa arvioimista SEER-mallin suorituskykyä matalan otoksen asetelmissa, eli käyttäen vain osaa koko aineistosta kuvien ja niiden merkintöjen luokitteluun.

Kokeelliset asetukset

SEER-kehys käyttää kahta aineistoa matalan otoksen oppimiseen: Places205 ja ImageNet. Lisäksi malli olettaa, että on rajoitettu pääsy aineistoon siirtymisoppimisen aikana sekä kuvien että niiden merkintöjen suhteen. Tämä rajoitettu pääsy on erilainen kuin oletusarvoinen asetus itseohjautuvassa oppimisessa, jossa malli on päässyt koko aineistoon, mutta pääsy kuvien merkintöihin on rajoitettu.

Tulokset Places205-aineistolla

Seuraava kuva osoittaa, miten esikoulutusmalli toimii eri osuuksilla Places205-aineistosta.

Lähestymistapa on verrattu esikoulutukseen ImageNet-aineistolla valvonnassa samalla RegNetY-128 GF -arkkitehtuurilla. Tulokset verrannaisuudesta ovat yllättäviä, sillä voidaan nähdä, että on vakaa voitto noin 2,5 %:n yhden tarkin tarkkuudessa riippumatta siitä, kuinka paljon koulutusaineistoa on käytettävissä hienosäätöä varten Places205-aineistolla.

Ero, joka havaitaan valvotun ja itseohjautuvan esikoulutuksen välillä, voidaan selittää aineiston luonteen erona, sillä ominaisuudet, jotka malli oppii satunnaisista kuvista, voivat olla sovellettavampia luokitteluun. Lisäksi epäyhtenäinen jakautuminen taustalla olevista käsitteistä voi olla etu esikoulutukselle epätasapainoisella aineistolla, kuten Places205.

Tulokset ImageNetissä

Yllä oleva taulukko vertaa lähestymistapaa SEER-mallissa itseohjautuviin esikoulutuslähestymistapoihin ja puolivaltaisiin lähestymistapoihin matalan otoksen oppimisessa. On huomattava, että kaikki nämä menetelmät käyttävät kaikkia 1,2 miljoonaa kuvaa ImageNet-aineistosta esikoulutukseen, ja ne rajoittavat vain pääsyn kuvien merkintöihin.

Toisaalta SEER-mallin lähestymistapa sallii sen nähdä vain 1-10 %:n ImageNet-aineistosta. Vaikka verkot ovat nähneet enemmän kuvia samasta jakautumisesta esikoulutuksen aikana, se hyödyttää näitä lähestymistapoja paljon. Mutta mitä on hämmästyttävää, on se, että vaikka SEER-malli näkee vain 1-10 %:n ImageNet-aineistosta, se on silti kykenevä saavuttamaan yhden tarkin tarkkuuden noin 80 %:n, mikä on vain hieman alempi kuin edellä mainittujen lähestymistapojen tarkkuus.

Mallin kapasiteetin vaikutus

Seuraava kuva käsittelee mallin kapasiteetin vaikutusta matalan otoksen oppimisessa: 1 %, 10 % ja 100 %:ssa ImageNet-aineistosta.

Voidaan nähdä, että kapasiteetin lisääminen voi parantaa mallin tarkkuutta, kun pääsy kuvien ja niiden merkintöjen luokitteluun vähenee aineistossa.

Siirto muihin mittareihin

Jotta voidaan arvioida SEER-mallin suorituskykyä tarkemmin, esikoulutetut ominaisuudet siirretään muihin alimpiin tehtäviin.

Lineaarien arviointi kuvien luokitteluun

Yllä oleva taulukko vertaa SEER:n esikoulutetun RegNetY-256GF:n ja RegNetY128-GF:n ominaisuuksia, jotka on esikoulutettu ImageNet-aineistolla samalla arkkitehtuurilla valvonnassa ja ilman valvontaa. Ominaisuuksien laatu arvioidaan jäädyttämällä painot ja käyttämällä lineaarista luokittelijaa ominaisuuksien päällä koulutusjoukkoa alimmissa tehtävissä. Seuraavat mittarit otetaan huomioon prosessissa: Open-Images (OpIm), iNaturalist (iNat), Places205 (Places) ja Pascal VOC (VOC).

Havaitseminen ja segmentointi

Seuraava kuva vertaa esikoulutettuja ominaisuuksia havaitsemisessa ja segmentoinnissa ja arvioi niitä.

SEER-kehys kouluttaa Mask-RCNN-mallin COCO-mittarilla esikoulutetuilla RegNetY-64GF- ja RegNetY-128GF-malleilla. Molemmat arkkitehtuuri ja alimmat tehtävät osoittavat, että SEER:n itseohjautuva esikoulutuslähestymistapa ylittää valvotun koulutuksen 1,5-2 AP-pistettä.

Vertailu heikkovaltaiseen esikoulutukseen

Useimmat internetissä olevat kuvat sisältävät metatietoa, kuten alt-tekstiä, kuvauksia tai sijainteja, jotka voivat antaa etua esikoulutuksen aikana. Aikaisemmat tutkimukset ovat osoittaneet, että ennustaminen kuratoidusta joukosta hashtag-merkintöjä voi parantaa visuaalisten ominaisuuksien laatuja.

Seuraava kuva vertaa ResNetXt101-32dx8d-arkkitehtuurin esikoulutusta satunnaisilla kuvilla saman arkkitehtuurin esikoulutuksella merkityillä kuvilla ja metadataa ja ilmoittaa yhden tarkin tarkkuuden molemmille.

Voidaan nähdä, että vaikka SEER-kehys ei käytä metatietoa esikoulutuksen aikana, sen tarkkuus on vertailukelpoinen malleihin, jotka käyttävät metatietoa esikoulutukseen.

Poistotutkimukset

Poistotutkimus tehdään arvioidakseen tietyn komponentin vaikutusta mallin kokonaisuuteen. Poistotutkimus suoritetaan poistamalla komponentti mallista kokonaan ja ymmärtämällä, miten malli suorittaa. Se antaa kehittäjille yleiskatsauksen komponentin vaikutuksesta mallin suorituskykyyn.

Mallin arkkitehtuurin vaikutus

Mallin arkkitehtuuri vaikuttaa merkittävästi mallin suorituskykyyn, erityisesti, kun mallia skaalataan tai esikoulutusaineiston määrityksiä muutetaan.

Seuraava kuva osoittaa, miten arkkitehtuurin muuttaminen vaikuttaa esikoulutettujen ominaisuuksien laatuun, kun arvioidaan lineaarisesti ImageNet-aineistoa. Ominaisuuksia voidaan tutkia suoraan, koska arviointi ei suosi mallia, joka palauttaa korkean tarkkuuden, kun se on koulutettu alusta alkaen ImageNet-aineistolla.

Voidaan nähdä, että ResNeXts- ja ResNet-arkkitehtuureilla ominaisuudet, jotka saadaan penimmäisestä kerroksesta, toimivat paremmin nykyisissä asetuksissa. Toisaalta RegNet-arkkitehtuuri ylittää muut arkkitehtuuri.

Kaiken kaikkiaan voidaan todeta, että kapasiteetin lisääminen parantaa ominaisuuksien laatua, ja on logaritminen voitto mallin suorituskyvyssä. On myös selvää, että kapasiteetin lisääminen johtaa suurempaan suorituskykyyn.

Esikoulutusaineiston skaalautuminen

On kaksi pääsyytä, miksi kouluttaminen suuremmalla aineistolla voi parantaa visuaalisten ominaisuuksien laatua, jotka malli oppii: enemmän yksilöllisiä kuvia ja enemmän parametreja. Tutustumme näihin syihin lyhyesti.

Yksilöllisten kuvien määrän lisääminen

Yllä oleva kuva vertaa kahta eri arkkitehtuuria, RegNet8 ja RegNet16, joilla on sama määrä parametreja, mutta ne on koulutettu eri määrällä yksilöllisiä kuvia. SEER-kehys kouluttaa mallit päivityksille, jotka vastaavat yhtä epochia miljardille kuville tai 32 epochille 32 yksilölliselle kuvalle, ja käyttää yksittäistä puolivälistä kosinista oppimissääntöä.

Voidaan nähdä, että mallin suorituskyky on parempi, kun sille annetaan enemmän yksilöllisiä kuvia. Tässä tapauksessa malli suorittaa hyvin, kun sille annetaan yksilöllisiä kuvia, jotka ovat suurempia kuin kuvat ImageNet-aineistossa.

Lisää parametreja

Seuraava kuva osoittaa mallin suorituskyvyn, kun se koulutetaan miljardilla kuvalla RegNet-128GF-arkkitehtuurilla. Voidaan nähdä, että suorituskyky paranee jatkuvasti, kun parametreja lisätään.

Itseohjautuva tietokoneen näkö todellisissa maailman tilanteissa

Tähän asti olemme käsitelleet, miten itseohjautuva oppiminen ja SEER-malli toimivat teoriassa. Nyt katsotaan, miten itseohjautuva tietokoneen näkö toimii todellisissa maailman tilanteissa, ja miksi SEER on tulevaisuuden itseohjautuva tietokoneen näkö.

SEER-malli kilpailee työn kanssa, jota on tehty luonnollisen kielen prosessoinnin alalla, jossa huipputason mallit käyttävät triljoonia aineistoja ja parametreja ja triljoonia sanoja tekstiä esikoulutuksessa. Suorituskyky alimmissa tehtävissä yleensä paranee, kun syötteen aineiston määrää lisätään, ja sama pätee myös tietokoneen näön tehtäville.

Mutta itseohjautuvan oppimisen käyttäminen luonnollisen kielen prosessoinnissa on erilainen kuin itseohjautuvan oppimisen käyttäminen tietokoneen näössä. Se johtuu siitä, että kun käsitellään tekstiä, semanttiset käsitteet usein murrataan yksittäisiin sanoihin, mutta kun käsitellään kuvia, mallin on päättävä, mihin pikseli kuuluu mihin käsitteeseen.

Lisäksi eri kuvat voivat olla eri näkemyksiä, ja vaikka useat kuvat voivat sisältää saman kohteen, käsite voi vaihdella merkittävästi. Esimerkiksi tietokuvassa, jossa on kissa. Vaikka pääkohteena oleva kissa on yhteinen kaikissa kuvissa, käsite voi vaihdella merkittävästi, kun kissa on seisovassa asennossa yhdessä kuvassa, leikkii pallon kanssa toisessa kuvassa jne. Koska kuvat usein sisältävät vaihtelevia käsitteitä, on tärkeää, että malli näkee suuren määrän kuvia ymmärtääkseen nämä erot saman käsitteen ympärillä.

Onnistuneen mallin skaalautuminen, jotta se toimii tehokkaasti suurten ja monimutkaisten kuvien kanssa, vaatii kaksi komponenttia:

  1. Konvoluotio- neuroverkko (CNN), joka on tarpeeksi suuri oppiakseen visuaaliset käsitteet suurelta kuvien aineistolta.
  2. Algoritmi, joka voi oppia kuvioita suurelta määrältä kuvia ilman merkintöjä, annotaatioita tai metatietoa.

SEER-malli pyrkii soveltamaan nämä komponentit tietokoneen näön alalle. SEER-malli pyrkii hyödyntämään edistystasoa, jonka SwAV on saavuttanut, itseohjautuvassa oppimisessa, joka käyttää online-klusterointia ryhmitelläkseen tai pariksi kuvat, joilla on rinnakkaiset visuaaliset käsitteet, ja hyödyntääkseen nämä samankaltaisuudet tunnistamaan paremmin kuvioita.

SwAV-arkkitehtuurin avulla SEER-malli pystyy tekemään itseohjautuvan oppimisen tietokoneen näössä paljon tehokkaammaksi ja vähentämään koulutusaikaa jopa 6-kertaisesti.

Lisäksi kouluttaminen suuressa mittakaavassa, tässä mittakaavassa yli miljardi kuvaa, vaatii mallin arkkitehtuurin, joka on tehokas sekä ajassa että muistissa, ja RegNets-mallit ovat ConvNets-malleja, jotka voivat skaalautua triljoonien parametrejä ja voidaan optimoida muistirajoitusten ja ajankäytön mukaan.

Johtopäätös: Itseohjautuva tulevaisuus

Itseohjautuva oppiminen on ollut merkittävä aihe tekoäly- ja koneoppimisteollisuudessa jo jonkin aikaa, koska se mahdollistaa tekoälymallien oppimisen suoraan suurelta määrältä satunnaisesti internetistä löytyvää aineistoa, ilman huolellisesti kuratoiduista ja merkityistä aineistoja, joiden ainoa tarkoitus on kouluttaa tekoälymalleja.

Itseohjautuva oppiminen on tärkeä tekoälyn ja koneoppimisen tulevaisuudelle, koska sillä on potentiaalia sallia kehittäjien luoda tekoälymalleja, jotka sopeutuvat hyvin todellisiin maailman tilanteisiin ja joilla on monia käyttötarkoituksia eikä vain yhtä tiettyä tarkoitusta, ja SEER on merkittävä askel itseohjautuvan oppimisen toteuttamisessa tietokoneen näön alalla.

SEER-malli ottaa ensimmäisen askeleen tietokoneen näön teollisuuden muuttamiseen ja vähentää riippuvuutta merkityistä aineistoista. SEER-malli pyrkii poistamaan aineiston annotoinnin tarpeen, mikä mahdollistaa kehittäjien työskennellä monipuolisilla ja suurilla aineistoilla. Itseohjautuvan annotaation poistaminen sallii kehittäjien kehittää ja ottaa käyttöön malleja nopeammin, mikä mahdollistaa nopeamman ja tarkemman reagoinnin nopeasti muuttuviin tilanteisiin.

Lisäksi itseohjautuvan annotaation poistaminen sallii kehittäjien kehittää ja ottaa käyttöön malleja nopeammin, mikä mahdollistaa nopeamman ja tarkemman reagoinnin nopeasti muuttuviin tilanteisiin.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.