AI-modeller och plattformar

Forskare Upptäcker Högpresterande Subnätverk Inom Djupa Inlärningsneurala Nätverk

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Djupa inlärningsneurala nätverk är ofta enorma och kräver stora mängder beräkningskraft, men en ny upptäckt visar hur detta kan minskas för att slutföra uppgifter mer effektivt. Jonathan Frankle och hans team från MIT har kommit med “lottery ticket-hypotesen”, som visar hur det finns smalare subnätverk inom de större neurala nätverken. Dessa subnätverk kan slutföra uppgiften till hands mer effektivt med mindre krävd beräkningskraft, med en av de största utmaningarna att hitta dessa subnätverk, eller vinnande lotteribiljetter som teamet kallar dem.

Teamet upptäckte dessa subnätverk inom BERT, den toppmoderna maskinlärningstekniken för naturligt språkbehandling (NLP). NLP, som är en undergrupp till artificiell intelligens (AI), ansvarar för att tolka och analysera mänskligt språk, och används för tillämpningar som förutsägande textgenerering och chattbotar.

Men BERT är stor och kräver superdatorberäkningskraft, som är otillgänglig för de flesta användare. Med den nya upptäckten av dessa subnätverk kan det öppna upp tillgången, och tillåta fler användare att utnyttja tekniken för att utveckla NLP-verktyg.

”Vi är på väg att nå en punkt där vi måste göra dessa modeller smalare och mer effektiva”, säger Frankle.

Enligt honom kan denna utveckling ”minska inträdesbarriärerna” för NLP.

BERT – “Obscenely Expensive”  

BERT är grundläggande för saker som Google :s sökmotor och har fått mycket uppmärksamhet sedan Google släppte det 2018. Det är en metod för att skapa neurala nätverk och tränas genom att försöka fylla i tomma passager i skriven text. En av de mest imponerande funktionerna i BERT är dess enorma initiala träningsdataset.

Det kan sedan justeras av användare för specifika uppgifter, som kundtjänstchattbotar, men igen, det kräver enorma mängder bearbetningskraft, med möjligheten att parametrar når 1 miljard.

”En standard-BERT-modell idag – den vanliga sorten – har 340 miljoner parametrar”, säger Frankle. ”Detta är bara obscenlt dyrt. Det är långt bortom den beräkningsförmåga som du eller jag har.”

Enligt huvudförfattaren Tianlong Chen från University of Texas at Austin lider modeller som BERT ”av enorm nätverksstorlek”, men tack vare den nya forskningen ”verkar lottery ticket-hypotesen vara en lösning”.

Effektiva Subnätverk 

Chen och teamet letade efter en mindre modell belägen inom BERT, och de jämförde de upptäckta subnätverkens prestationer med den ursprungliga BERT-modellen. Detta testades på en mängd olika NLP-uppgifter, inklusive att svara på frågor och fylla i tomma ord i en mening.

Teamet upptäckte framgångsrika subnätverk som var imponerande 40 till 90 procent smalare än den ursprungliga BERT-modellen, med den faktiska procentsatsen beroende på uppgiften. Utöver detta kunde de identifiera dem innan uppgiftsspecifik finjustering, vilket resulterar i ännu lägre beräkningskostnader. En annan fördel var att vissa av subnätverken som valdes för en specifik uppgift kunde återanvändas för en annan.

”Jag var ganska chockad över att det fungerade”, säger Frankle. ”Det är inte något som jag tog för givet. Jag förväntade mig ett mycket rörigare resultat än vad vi fick.”

Enligt Ari Morcos, en forskare på Facebook (META ) AI Research, är denna upptäckt ”övertygande”, och ”Dessa modeller blir alltmer utbredda. Så det är viktigt att förstå om lottery ticket-hypotesen håller.”

Morcos säger också att om dessa subnätverk kunde köras med drastiskt mindre beräkningskraft, då skulle detta ”vara mycket betydelsefullt med tanke på att dessa extremt stora modeller för närvarande är mycket dyra att köra.”

”Jag vet inte hur mycket större vi kan gå med hjälp av dessa superdatorberäkningar”, tillägger Frankle. ”Vi måste minska inträdesbarriärerna.”

”Hoppet är att detta kommer att sänka kostnaderna, att detta kommer att göra det mer tillgängligt för alla…för de små killarna som bara har en laptop”, avslutar han.

Forskningen kommer att presenteras på Conference on Neural Information Processing Systems.

Alex leder Unite.AI:s AI‑drivna nyhetsverksamhet och kombinerar journalistik, forskning och automation för att stödja snabb och skalbar bevakning av artificiell intelligens. Hans arbete bidrar till att nya AI‑utvecklingar framträder effektivt samtidigt som publikationen upprätthåller sina redaktionella standarder.