AI-mallit ja alustat

Ikuinen laiteoppiminen lähempänä uuden koulutustekniikan ansiosta

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

MIT:n ja MIT-IBM Watson AI Lab:n tutkijaryhmä on kehittänyt uuden tekniikan, joka mahdollistaa laitekoulutuksen alle neljännesmegatavun muistilla. Uusi kehitys on vaikuttava saavutus, koska muut koulutusratkaisut tarvitsevat yleensä yli 500 megatavun muistia, mikä ylittää useimpien mikroohjainten 256 kilotavun kapasiteetin.

Kouluttamalla koneoppimismallia älykkäällä reunalla olevalla laitteella, se voi sopeutua uusiin tietoihin ja tehdä parempia ennusteita. Sanottuna, koulutusprosessi vaatii yleensä paljon muistia, joten se tehdään usein tietokeskuksessa ennen mallin käyttöönottoa laitteessa. Tämä prosessi on paljon kalliimpi ja herättää tietosuojakysymyksiä verrattuna tutkijaryhmän kehittämään uuteen tekniikkaan.

Tutkijat kehittivät algoritmit ja kehyksen siten, että vähentää laskennan määrää, joka tarvitaan mallin kouluttamiseen, mikä tekee prosessista nopeamman ja muistitehokkaamman. Tekniikka voi auttaa kouluttamaan koneoppimismallin mikroohjaimella vain muutamassa minuutissa.

Uusi tekniikka auttaa myös tietosuojassa, koska se pitää tiedot laitteessa, mikä on tärkeää, kun on kyse arkaluontoisista tiedoista. Samalla kehys parantaa mallin tarkkuutta verrattuna muihin lähestymistapoihin.

Song Han on apulaisprofessori sähkötekniikan ja tietotieteiden osastossa (EECS), MIT-IBM Watson AI Lab:n jäsen ja tutkimuspaperin seniorkirjoittaja.

“Tutkimuksemme mahdollistaa IoT-laitteiden suorittaa ei vain inferenceä, vaan myös jatkuvasti päivittää koneoppimismalleja uusiin kerätyihin tietoihin, mikä mahdollistaa ikuisen laiteoppimisen”, Han sanoi. “Matala resurssien käyttö tekee syvän oppimisen helpommaksi ja laajemmaksi, erityisesti matalatehoisille reunan laitteille.”

Tutkimuspaperi sisälsi paperi, jossa oli mukana johtavat kirjoittajat ja EECS:n tohtorikoulutettavat Ji Lin ja Ligeng Zhu, sekä MIT:n jatko-opiskelijat Wei-Ming Chen ja Wei-Chen Wang. Siihen kuului myös Chuang Gan, pääasiallinen tutkija MIT-IBM Watson AI Lab:ssa.

Tehokkaamman koulutusprosessin luominen

Tehokkaamman ja vähemmän muistivaativaisen koulutusprosessin luomiseksi tutkijaryhmä turvautui kahteen algoritmiseen ratkaisuun. Ensimmäinen on tunnettu harvaan päivitykseen, joka käyttää algoritmia, joka tunnistaa tärkeimmät painot, joita päivitetään koulutuksen aikana. Algoritmi jäädyttää painot yksi kerrallaan, kunnes tarkkuus laskee tietyn kynnyksen alapuolelle, jolloin se lopettaa. Loput painot päivitetään ja jäädytetyille painoille vastaavat aktivaatiot eivät tarvitse tallentaa muistiin.

“Koko mallin päivittäminen on hyvin kallista, koska siinä on paljon aktivaatioita, joten ihmiset taipuvat päivittämään vain viimeisen kerroksen, mutta kuten voit kuvitella, se vahingoittaa tarkkuutta”, Han sanoi. “Meidän menetelmässämme valitsemme tärkeimmät painot ja varmistamme, että tarkkuus säilyy täysin.”

Tutkijaryhmän toinen ratkaisu liittyy kvantifioidun koulutuksen ja painojen yksinkertaisen tekniikan kehittämiseen. Algoritmi pyöristää painot kahdeksaan bittiin kvantifiointiprosessin kautta, mikä myös vähentää muistin määrää koulutuksessa ja inference-prosessissa, jossa inference on prosessi, jossa malli sovelletaan tietojoukkoon ja luodaan ennuste. Algoritmi käyttää myös kvantifiointitietoista skaalauksen (QAS) tekniikkaa, joka toimii kertoimena, joka säätää painon ja gradientin suhdetta. Tämä auttaa välttämään tarkkuuden laskua, joka voi johtua kvantifioidusta koulutuksesta.

Tutkijat kehittivät järjestelmän, jota kutsutaan pienen koulutusmoottoriksi, joka suorittaa algoritmi-innovaatiot yksinkertaisella mikroohjaimella, jolla ei ole käyttöjärjestelmää. Suorittamaan enemmän työtä käännös-vaiheessa ennen mallin käyttöönottoa reunan laitteessa, järjestelmä muuttaa koulutusprosessin askeljärjestyksen.

“Me siirtämme paljon laskentaa, kuten auto-differentiaatiota ja graafin optimointia, käännös-aikaan. Me myös leikkaamme aggressiivisesti tarpeettomat operaattorit tukemaan harvaa päivitystä. Kun suoritusaika on, meillä on paljon vähemmän työtä tehdä laitteessa”, Han sanoo.

Hyvin tehokas tekniikka

Perinteiset kevyet koulutustekniikat vaativat yleensä noin 300-600 megatavun muistia, mutta tutkijaryhmän optimointi tarvitsi vain 157 kilotavua kouluttaa koneoppimismalli mikroohjaimella.

Kehys testattiin kouluttamalla tietokoneen näkömalli havaitsemaan ihmisiä kuvissa, ja se oppi suorittamaan tämän tehtävän vain 10 minuutissa. Menetelmä pystyi myös kouluttamaan mallin yli 20 kertaa nopeammin kuin muut menetelmät.

Tutkijat aikovat nyt soveltaa tekniikkaa kielen malleihin ja erilaisiin tietoihin. He haluavat myös käyttää tätä hankittua tietoa kutistamaan suurempia malleja ilman tarkkuuden menetystä, mikä voisi myös auttaa vähentämään suurten koneoppimismallien koulutuksen hiilijalanjälkeä.

Alex McFarland on AI-toimittaja ja kirjailija, joka tutkii viimeisimpiä kehityksiä tekoälyssä. Hän on tehnyt yhteistyötä useiden AI-startup-yritysten ja julkaisujen kanssa maailmanlaajuisesti.