AI-modeller og plattformer
Forskere oppdager høyeffektive undernettverk i dype læring neuralnettverk
Dype læring neuralnettverk er ofte massive og krever enorme mengder beregningskraft, men en ny oppdagelse viser hvordan dette kan reduseres for å fullføre oppgaver mer effektivt. Jonathan Frankle og hans team fra MIT har kommet frem til “lottery ticket-hypotesen”, som viser hvordan det finnes slankere undernettverk innenfor de større neuralnettverkene. Disse undernettverkene kan fullføre oppgaven mer effektivt med mindre beregningskraft, og en av de største utfordringene er å finne disse undernettverkene, eller “vinnende lottotall” som teamet refererer til dem.
Teamet oppdaget disse undernettverkene innenfor BERT, den beste maskinlæringsmetoden for naturlig språkbehandling (NLP). NLP, som er en undergren av kunstig intelligens (AI), er ansvarlig for å tyde og analysere menneskespråk, og brukes i applikasjoner som prediktiv tekstgenerering og chatboter.
Men BERT er stor og krever superdatamaskinkraft, som er utilgjengelig for de fleste brukere. Med den nye oppdagelsen av disse undernettverkene, kan det åpne opp for at flere brukere kan bruke teknologien til å utvikle NLP-verktøy.
“Vi nærmer oss punktet der vi må gjøre disse modellene slankere og mer effektive,” sier Frankle.
Ifølge ham kan denne utviklingen “redusere inngangsbarrierer” for NLP.
BERT – “Obscenely dyrt”
BERT er grunnleggende for ting som Google -søkemotoren og har mottatt mye oppmerksomhet siden Google lanserte det i 2018. Det er en metode for å lage neuralnettverk og er trent ved å forsøke å fylle inn tomme passasjer i skriveverk. En av de mest imponerende egenskapene ved BERT er dens massive innledende treningsdataset.
Det kan deretter justeres av brukerne for spesifikke oppgaver, som kundeservice-chatboter, men igjen krever det massive mengder beregningskraft, med mulighet for parametre som når 1 milliard.
“En standard BERT-modell i dag – den vanlige typen – har 340 millioner parametre,” sier Frankle. “Dette er rett og slett for dyrt. Dette er langt utenfor beregningskapasiteten til deg eller meg.”
Ifølge hovedforfatter Tianlong Chen fra University of Texas at Austin, lider modeller som BERT “under enormt nettverksstørrelse”, men takket være den nye forskningen, “synes lottery ticket-hypotesen å være en løsning.”
Effektive undernettverk
Chen og teamet lette etter en mindre modell innenfor BERT, og de sammenlignet de oppdagede undernettverkenes prestasjoner med den opprinnelige BERT-modellen. Dette ble testet på en rekke ulike NLP-oppgaver, inkludert å svare på spørsmål og fylle inn tomme ord i en setning.
Teamet oppdaget suksessfulle undernettverk som var imponerende 40 til 90 prosent slankere enn den opprinnelige BERT-modellen, med den faktiske prosenten avhengig av oppgaven. I tillegg kunne de identifisere dem før oppgavesspesifikk finjustering, noe som resulterer i enda lavere beregningskostnader. En annen fordel var at noen av undernettverkene valgt for en spesifikk oppgave kunne deretter gjenbrukes for en annen.
“Jeg var litt sjokkert over at dette faktisk fungerte,” sier Frankle. “Dette er ikke noe jeg tok for gitt. Jeg forventet et mye mer rotete resultat enn det vi fikk.”
Ifølge Ari Morcos, en forsker ved Facebook (META ) AI Research, er denne oppdagelsen “overbevisende”, og “Disse modellene blir stadig mer utbredt. Så det er viktig å forstå om lottery ticket-hypotesen holder.”
Morcos sier også at hvis disse undernettverkene kunne kjøres med drastisk mindre beregningskraft, ville dette “være svært betydningsfullt, ettersom disse ekstremt store modellene i dag er svært dyre å kjøre.”
“Jeg vet ikke hvor mye større vi kan gå med disse superdatamaskin-lignende beregningene,” sier Frankle. “Vi må redusere inngangsbarrieren.”
“Håpet er at dette vil senke kostnadene, at dette vil gjøre det mer tilgjengelig for alle…til de små guttene som bare har en bærbar datamaskin,” konkluderer han.
Forskningen skal presenteres på Konferansen om neurale informasjonsbehandlingsystemer.












