AI-mallit ja alustat

Tutkijat löytävät syvän oppimisen neuroverkoista tehokkaat aliverkkorakenteet

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Syvän oppimisen neuroverkkorakenteet ovat usein massiivisia ja vaativat valtavat määrät laskentatehoa, mutta uusi löytö osoittaa, miten tämä voidaan leikata alas suorittamaan tehtäviä tehokkaammin. Jonathan Frankle ja hänen tiiminsä MIT:stä ovat kehittäneet “arpaonnen hypoteesin”, joka osoittaa, miten siellä on hoikempia aliverkkorakenteita suuremmissa neuroverkoissa. Nämä aliverkkorakenteet voivat suorittaa tehtävän käden ulottuvilla tehokkaammin vähemmällä laskentateholla, ja yksi suurimmista haasteista on löytää nämä aliverkkorakenteet, tai voittoarpaonnat, kuten tiimi niitä kutsuu.

Tiimi löysi nämä aliverkkorakenteet BERT:stä, joka on huipputason koneoppimismenetelmä luonnollisen kielen prosessoinnissa (NLP). NLP, joka on tekoälynn (AI) alatutkimusala, vastaa ihmisen kielen tulkitsemisesta ja analysoimisesta, ja sitä käytetään sovelluksissa, kuten ennustavassa tekstin generoinnissa ja chatboteissa.

Kuitenkin BERT on suuri ja vaatii supertietokoneen laskentatehoa, joka on monille käyttäjille esteettä. Uuden löydön myötä nämä aliverkkorakenteet voivat avata pääsyn tähän teknologiaan, jotta enemmät käyttäjät voivat hyödyntää sitä kehittääkseen NLP-työkaluja.

“Olemme saavuttamassa pistettä, jossa meidän on tehtävä nämä mallit hoikemmaksi ja tehokkaammaksi”, Frankle sanoo.

Hänen mukaansa tämä kehitys voi “laskea esteitä” NLP:lle.

BERT – “Hirvittävän kallista”  

BERT on perustavanlaatuinen asia, kuten Google -hakukone, ja se on saanut paljon huomiota siitä lähtien, kun Google julkaisi sen vuonna 2018. Se on menetelmä neuroverkkojen luomiseksi ja se on koulutettu yrittämällä useita kertoja täyttää tyhjä kirjoituskappale. Yksi BERTin vaikuttavimmista ominaisuuksista on sen valtava alkuperäinen koulutusaineisto.

Se voidaan sitten säätää käyttäjien mukaan tiettyihin tehtäviin, kuten asiakaspalveluun chatbottiin, mutta jälleen kerran, se vaatii valtavat määrät laskentatehoa, ja mahdollisuus, että parametreja on jopa miljardi.

“Standardi BERT-malli nykyään – puutarhavarieti – on 340 miljoonaa parametriä”, Frankle sanoo. “Tämä on hirvittävän kallista. Tämä on paljon enemmän kuin meidän laskentakapasiteetti.”

Hänen mukaansa, johtava tekijä Tianlong Chen University of Texas at Austinista, mallit, kuten BERT “kärsivät valtavasta verkkokokoisesta”, mutta kiitos uuden tutkimuksen, “arpaonnen hypoteesi näyttää olevan ratkaisu”.

Tehokkaat aliverkkorakenteet 

Chen ja tiimi etsivät pienempää mallia BERT:stä ja vertasivat löydetyistä aliverkkorakenteista suorituskykyä alkuperäisen BERT-mallin kanssa. Tämä testattiin useissa eri NLP-tehtävissä, mukaan lukien kysymysten vastaaminen ja sanan täyttäminen lauseessa.

Tiimi löysi onnistuneita aliverkkorakenteita, jotka olivat 40-90 prosenttia hoikempia kuin alkuperäinen BERT-malli, ja todellinen prosentti riippui tehtävästä. Lisäksi he voivat tunnistaa ne ennen tehtäväkohtaisia hienosäätöjä, mikä johtaa edelleen vähemmän laskentakustannuksiin. Yksi etu oli, että jotkut aliverkkorakenteet, jotka oli valittu tiettyyn tehtävään, voitiin myöhemmin käyttää toiseen tehtävään.

“Olin jonkin verran yllättynyt, että tämä toimi”, Frankle sanoo. “En ollut ottanut sitä itsestäänselvyytenä. Odotin paljon sekavampaa tulosta kuin mitä saimme.”

Ari Morcos, Facebook (META ) AI Researchin tutkija, sanoo, että tämä löytö on “vakuuttava”, ja “Nämä mallit ovat yhä yleisempiä. On tärkeää ymmärtää, onko arpaonnen hypoteesi pitävä.”

Morcos sanoo myös, että jos nämä aliverkkorakenteet voivat toimia dramaattisesti vähemmällä laskentateholla, se “olisi hyvin vaikuttavaa, koska nämä erittäin suuret mallit ovat tällä hetkellä hyvin kalliita suorittaa.”

“En tiedä, kuinka paljon suuremmaksi voimme kasvaa käyttäen näitä supertietokoneiden laskentatehoa”, Frankle lisää. “Meidän on pakko laskea esteitä.”

“Toivomme, että tämä laskee kustannuksia, että se tekee sen helpommaksi kaikille…pienille yrityksille, jotka vain omistavat kannettavan tietokoneen”, hän päättelee.

Tutkimus on tarkoitus esittää Neuraalisen tietojenkäsittelyn järjestelmien konferenssissa.

Alex johtaa Unite.AI:n tekoälypohjaista uutistoimintaa, yhdistäen journalismia, tutkimusta ja automaatiota tukeakseen ajantasaista ja skaalautuvaa tekoälyn kattavuutta. Hänen työnsä auttaa varmistamaan, että nousevat tekoälykehitykset saadaan esiin tehokkaasti samalla kun julkaisun toimitukselliset standardit säilyvät.