AI-mallit ja alustat

BlackMamba: Sekoittujen asiantuntijoiden esittely tila-avaruusmalleissa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Suurten kielimallien (LLM) kehitys, jotka perustuvat vain dekooderin transformer-malleihin, on vaikuttanut merkittävästi luonnollisen kielen prosessoinnin (NLP) alaan sekä edistänyt monia syvän oppimisen sovelluksia, kuten vahvistusoppimista, aikasarja-analyysiä, kuvankäsittelyä ja paljon muuta. Kuitenkin, vaikka ne ovat skaalautuvia ja tarjoavat vahvan suorituskyvyn, LLM:t, jotka perustuvat vain dekooderin transformer-malleihin, kohtaavat edelleen merkittäviä haasteita. Vaikka ne ovat ilmaisuvoimaisia, transformer-johtuvien LLM-mallien huomioimekanismi vaatii laajoja laskentaresursseja sekä inference- että koulutusvaiheessa, mikä edellyttää muistia, joka kasvaa sekvenssin pituuden mukaan ja laskentaoperaatioita (FLOPs), jotka kasvavat neliösuhteessa. Tämä korkea laskentavaatimus rajoittaa mallien kontekstipituutta, tekee itsestään riippuvaisen generoinnin kalliiksi mittakaavan mukaan ja estää mallien oppimisen jatkuvista datastroomeista ja kyvyn prosessoida sekvenssejä tehokkaasti rajattomalla pituudella.

Viime aikoina tila-avaruusmallit (SSM) ovat osoittaneet merkittäviä kykyjä ja suorituskykyä, kilpaillen transformer-rakenteen malleja suurissa mallinnusmittauksissa saavuttaen muistimonimuodon, joka on suoraan verrannollinen sekvenssin pituuteen, ja lineaarisen ajan. Lisäksi Mamba, äskettäin julkaistu tila-avaruusmalli, on osoittanut erinomaista suorituskykyä kielimallinnuksessa ja pitkän sekvenssin prosessoinnissa. Samalla Sekoittujen asiantuntijoiden (MoE) mallit ovat myös osoittaneet vaikuttavaa suorituskykyä vähentäen merkittävästi inference- ja koulutuslaskentaoperaatioita, vaikka se tapahtuu suuremman muistijalan kustannuksella. Mamba- ja MoE-mallien pohjalta tämä artikkeli käsittelee BlackMambaa, uutta arkkitehtuuria, joka yhdistää Mamba-tila-avaruusmallin Sekoittujen asiantuntijoiden malleihin hyödyntäen kumpienkin kehysten tarjoamia etuja. BlackMamban kokeet ovat osoittaneet sen kyvyn ylittää olemassa oleva Mamba-kehys ja transformer-viitearvot sekä koulutuslaskentaoperaatioissa että inference-suorituskyvyssä. BlackMamban poikkeuksellinen suorituskyky osoittaa, että se pystyy yhdistämään Mamban ja MoE-kehysten kyvyt erinomaisesti, tarjoten nopean ja kustannustehokkaan inferenssin MoE:stä ja lineaarisen monimuotoisuuden Mambasta.

Tämä artikkeli pyrkii kattamaan BlackMamban kehystä syvällisemmin. Tutkimme mekanismia, menetelmää ja arkkitehtuuria sekä vertaamme sitä valokuvien ja videoiden generointikehyksiin. Aloita meille.

BlackMamba: Sekoittujen asiantuntijoiden esittely tila-avaruusmalleissa

Suurten kielimallien (LLM) kehitys, erityisesti ne, jotka perustuvat vain dekooderin transformer-rakenteisiin, on vaikuttanut merkittävästi luonnollisen kielen prosessoinnin (NLP) alaan ja laajentunut moniin syvän oppimisen sovelluksiin, kuten vahvistusoppimiseen, aikasarja-analyysiin, kuvankäsittelyyn ja muuhun. Kuitenkin, vaikka ne ovat skaalautuvia ja tarjoavat vahvan suorituskyvyn, nämä dekooderin transformer-pohjaiset LLM:t kohtaavat edelleen merkittäviä haasteita. Dekooderin transformer-pohjaisten LLM-mallien huomioimekanismi, joka on transformer-pohjaisten LLM-mallien avainominaisuus, vaatii laajoja laskentaresursseja sekä inference- että koulutusvaiheessa. Tämä edellyttää muistia, joka kasvaa sekvenssin pituuden mukaan ja laskentaoperaatioita (FLOPs), jotka kasvavat neliösuhteessa. Tämä korkea laskentavaatimus rajoittaa mallien kontekstipituutta, tekee itsestään riippuvaisen generoinnin kalliiksi mittakaavan mukaan ja estää mallien oppimisen jatkuvista datastroomeista ja kyvyn prosessoida sekvenssejä tehokkaasti rajattomalla pituudella.

Viime vuosina on tehty merkittäviä ponnisteluita ylittääkseen nämä rajoitukset, ja huomio on kohdistunut kehittämään vaihtoehtoisia arkkitehtuureja, kuten tila-avaruusmalleja (SSM) ja Sekoittujen asiantuntijoiden (MoE) malleja. Tila-avaruusmallien avainetu on lineaarinen laskentamonimuoto sekvenssin pituuden suhteen, toisin kuin transformer-mallien neliösuhteinen monimuotoisuus. Teoreettisesti lineaarinen laskentamonimuoto sekvenssin pituuden suhteen mahdollistaa tila-avaruusmallien prosessoinnin suurempia sekvenssejä kuin transformer-mallit tietylle laskentaoperaatioiden määrälle, ja tekee itsestään riippuvaisen generoinnin kustannusvakioksi ilman KV-välimuistia. Äskettäin kehitetyt tila-avaruusmallit, kuten RWKV ja Mamba, ovat osoittaneet tehokkaan pitkän sekvenssin inferenssin ja koulutuksen sekä kilpailevan kielimallinnuksen suorituskyvyn transformer-malleihin verrattuna. Toisaalta Sekoittujen asiantuntijoiden mallit ovat saavuttaneet suosiota vaihtoehtoisina tiheille transformer-malleille, koska ne mahdollistavat merkittävän vähennyksen inference- ja koulutuslaskentaoperaatioissa, vaikka se tapahtuu suuremman muistijalan kustannuksella.

Tämä arkkitehtuuri kehitys tarjoaa merkittäviä etuja perinteisiin transformer-malleihin verrattuna ja edustaa mielenkiintoista suuntaa tulevaisuuden kehitykselle. Oletamme, että yhdistämällä nämä parannukset yhdistettyyn Mamba-MoE-malliin, voimme merkittävästi kiihdyttää kielimallinnuksen tehokkuutta ja nopeutta ylittäen perinteisten transformer-mallien suorituskyvyn. Odotetut edut Mamba-MoE-arkkitehtuurista verrattuna perinteiseen tiheään transformer-malliin ovat seuraavat:

Mamba: Saavuttaa lineaarisen laskentamonimuodon suhteessa sekvenssin pituuteen sekä koulutus- että inference-vaiheessa. Se mahdollistaa itsestään riippuvaisen generoinnin tapahtua vakioajassa ja muistinkäytössä.

MoE: Tarjoaa inference-nopeuden ja koulutuslaskentaoperaatioiden tehokkuuden, joka on vertailukelpoinen pienemmän, tiheän vertailumallin kanssa, säilyttäen samalla mallin laadun, joka vastaa mallin, jolla on vastaava määrä parametreja kuin tiheämpi versio.

On kuitenkin tärkeää todeta, että transformer-arkkitehtuurin mallit ovat edelleen alan johtavia ja ovat osoittaneet johdonmukaista ja merkittävää suorituskykyä kielimallinnuksessa ja sekvenssin prosessoinnissa. Transformer-arkkitehtuuri perustuu itsehuomioon, joka suorittaa kaiken kaikkia vertailun sekvenssin eri tokenien välisen pistetulon samankaltaisuuden ja suorittaa lineaarisen kartan ulostulovektoriin. Transformer-malli koostuu itsehuomiolohkoista, jotka on pinottu MLP- (Moni-Layer-Perceptron) lohkojen väliin, ja jokainen MLP-lohko koostuu kahden kerroksen MLP:stä annetulla aktivaatiofunktiolla.

BlackMamba: Arkkitehtuuri ja Menetelmä

Tila-avaruusmallit

Tila-avaruusmallit kuuluvat sekvenssimallien ryhmään, joilla on lineaarinen monimuotoisuus sekvenssin pituuden suhteen. Tila-avaruusmallien arkkitehtuuri muistuttaa enemmän rekurrenttisia neuroverkkoja ja konvoluutioverkkoja kuin huomioon perustuvaa arkkitehtuuria, ja se perustuu jatkuvaan dynaamiseen järjestelmään, joka kartoittaa yhdenulotteisen funktion impliciteen latenttiavaruuteen. Lineaariset dynaamiset järjestelmät tekevät rinnakkaislaskennat tehokkaiksi joko assosiatiivisen tai konvoluutio-skannauksen avulla. Käytännön tilanteissa tila-avaruusmallien rekurrentti luonne on ollut syy, miksi niitä ei ole vielä otettu laajasti käyttöön korkean paralleelyn AI-laitteissa, kuten GPU:ssa. Kuitenkin uusien tila-avaruusmallien, kuten RWKV:n ja Mamban, kehitys on käyttänyt rinnakkais-skannausytimiä kartoittaakseen rekurrenttiset operaatiot tehokkaasti GPU:lle, mahdollistaen uusien arkkitehtuurien koulutuksen tehokkuudella, joka on vertailukelpoinen transformer-mallien saavutuksiin.

Transformer-mallien sisäinen neliösuhteinen monimuotoisuus sekvenssin pituuden suhteen on tunnettu rajoitus, joka haittaa päättelyä ja ymmärtämistä hyvin pitkien kontekstien yli. Viimeaikaiset innovaatiot ovat esittäneet kontekstipituuden laajentamisen, mahdollistaen transformer-mallien koulutuksen toteutettavissa olevalla mittakaavalla ennen soveltamista paljon pidempiin konteksteihin inference-vaiheessa. Kuitenkin inference-prosessi edellyttää edelleen merkittävää määrää laskentaresursseja ja muistia, erityisesti KV-välimuistin ylläpitämiseksi, mikä tekee siitä resursseja vaativan yrityksen. Viimeaikaiset tutkimukset ovat keskittyneet parantamaan tila-avaruusmallien ilmaisuvoimaa sisällyttämällä syöte-riippuvaisia porttimekanismeja, jotka muistuttavat transformer-mallien huomioimekanismeja.

Nämä ponnistelut pyrkivät säilyttämään tila-avaruusmallien lineaarisen etenemisen, mahdollistaen tehokkaan suorittamisen joko konvoluution tai valikoivan skannauksen kautta. Tämä lähestymistapa supistaa merkittävästi suorituskyvyn eroa transformer-mallien kanssa käytännön sovelluksissa. Näiden edistysten joukossa Mamba erottuu tila-avaruusmallina, joka heijastaa aiemman tutkimuksen tavoitteita ja osoittaa vaikuttavaa suorituskykyä, joka on vertailukelpoinen transformer-mallien kanssa jopa 2,8 miljardin parametrin mittakaavassa. Se saavuttaa tämän soveltamalla syöte-riippuvaisia portteja tila-avaruusmallin (SSM) rekursioon, varmistaa samalla tehokkaan laskennan käyttämällä erikoistuneita valikoivia skannausytimiä.

Sekoittujen asiantuntijoiden mallit

Sekoittujen asiantuntijoiden (MoE) mallit saavuttavat eron inferenssin kustannuksen ja kokonaisten parametricountin välillä valikoivasti aktivoimalla parametreja eteenpäin. Sen sijaan, että kaikki parametrit käytetään, nämä mallit ohjaavat tokenit tiettyihin monikerroksisiin perceptron-asiantuntijiin. Ihanteellisesti kunkin asiantuntijan on tarkoitus prosessoida tietyn tyyppistä syötettä, ja reititysmekanismi, joka on compacti neuroverkko, määrittää sopivimman asiantuntijan kullekin tokenille. Tämä lähestymistapa pyrkii säilyttämään mallin kattavan ilmaisuvoiman, joka on vertailukelpoinen tiheämmän konfiguraation kanssa, mutta huomattavasti vähemmän laskentavaatimukset. Tyypillisesti reitittäjä on lineaaristen kerrosten kartoitus tokeneista asiantuntijoiden indekseihin, ja kunkin asiantuntijan on vain standardi transformer-monikerroksinen perceptron. Kuitenkin kehittäjät ovat edelleen etsimässä optimaalista koulutusmenetelmää reitittäjälle, koska asiantuntijoiden määritysongelma on ei-differensoituvaa, ja Sekoittujen asiantuntijoiden mallit usein kamppailevat latausbalanssin ja koulutusvakaan kanssa laitteiston tehokkuuden vuoksi.

Arkkitehtuuri

BlackMamban ydin on standardi transformer-malli, joka koostuu vuorotellen MLP- ja huomiolohkoista, jotka on lisätty jatkuvasti residuaalivirtaukseen. Useimmat Sekoittujen asiantuntijoiden mallit korvaavat vain monikerroksisen perceptronin transformer-mallissa reititetyn asiantuntijakerroksella. Toisaalta BlackMamban kehys korvaa sekä monikerroksisen perceptronin transformer-mallissa reititetyn asiantuntijakerroksella että huomiolohkon Mamba-tila-avaruusmallin kerroksella. BlackMamban arkkitehtuuri on esitetty seuraavassa kuvassa.

Koulutus ja tietojoukko

BlackMamban malli on koulutettu yli 300 miljardin tokenin joukossa, ja se käyttää SwiGLU-aktivaatiofunktiota asiantuntijoiden monikerroksisille perceptroneille. Kehys koulutetaan 8 asiantuntijan kanssa, ja kehittäjät ovat löytäneet tämän oikean tasapainon ja kompromissin mallin muistijalan ja inference-kustannuksen välillä. Kustomoitu tietojoukko, jota käytetään BlackMamban kouluttamiseen, koostuu sekoituksesta aiemmin olemassa olevista avoimen lähdekoodin tietojoista, kuten Starcoder, SlimPajama, Pile ja muita. Seuraava taulukko osoittaa painoarvoja kullekin tietojoukolle, jota käytetään BlackMamban kouluttamiseen. Yhteensä tietojoukossa on 1,8 biljoonaa tokenia.

BlackMamba: Tulokset

Varmistamaan reilun vertailun Mamban ja BlackMamban välillä, kehittäjät ovat kouluttaneet molemmat mallit samojen koulutusparametrien kanssa samalla koulutusdatalla. BlackMamban kehys pystyy ylittämään sekä Mamban että transformer-mallit saman eteenpäin menevän mallin koossa sekä inference-ajassa että koulutuslaskentaoperaatioissa. Seuraava kuva osoittaa ajan, joka kuluu generoimaan sekvenssi annetun pituuden mukaan itsestään riippuvaisesti yhdestä aloitus-tokenista, sekvenssin pituuden funktiona.

Lisäksi Sekoittujen asiantuntijoiden ja Mamban mallien viive-etuja yhdistetään BlackMamban kehykseen, mikä johtaa merkittävästi nopeampiin inference-aikoihin verrattuna transformer-malleihin, puhdas Mamba-malleihin ja MoE-malleihin. Lisäksi BlackMamban kehys on erittäin tehokas pitkän sekvenssin generoinnissa, ja sen etu on suoraan verrannollinen sekvenssin pituuteen. Seuraava kuva osoittaa tokenien määrän, jotka on määritetty BlackMamban malleille, joilla on 340 miljoonaa ja 640 miljoonaa parametriä. Kuten voidaan nähdä, useimmat kerrokset osoittavat korkean tason asiantuntijatasapainoa parantuneen Sinkhorn-algoritmin ansiosta, jonka BlackMamban mallit ovat toteuttaneet.

Seuraava taulukko kattaa BlackMamban kehysvertailuarvot useiden avoimen lähdekoodin esikoulutettujen kielimallien kanssa. Kuten voidaan havaita, BlackMamban kehys pystyy kilpailemaan ja ylittämään useimpien kehyksien suorituskyvyn kaikilla viitearvoilla. Lisäksi on huomattava, että mallit, jotka ylittävät BlackMamban, ovat huomattavasti suurempia parametreja, ja suorituskyvyn ero on vähäinen, osoittaen BlackMamban kehyskyvyn vähemmän parametreilla.

Lopputajat

Tässä artikkelissa olemme keskustelleet BlackMambasta, uudesta arkkitehtuurista, joka yhdistää Mamba-tila-avaruusmallin Sekoittujen asiantuntijoiden malleihin hyödyntäen kumpienkin kehysten tarjoamia etuja. BlackMamban kokeet ovat osoittaneet sen kyvyn ylittää olemassa oleva Mamba-kehys ja transformer-viitearvot sekä koulutuslaskentaoperaatioissa että inference-suorituskyvyssä. BlackMamban poikkeuksellinen suorituskyky osoittaa, että se pystyy yhdistämään Mamban ja MoE-kehysten kyvyt erinomaisesti, tarjoten nopean ja kustannustehokkaan inferenssin MoE:stä ja lineaarisen monimuotoisuuden Mambasta. Olemme keskustelleet siitä, miten BlackMamban arkkitehtuuri pystyy ylittämään vahvat koulutetut suuret kielimallit, olemassa olevan Mamba-kehys ja Sekoittujen asiantuntijoiden mallit sekä koulutuslaskentaoperaatioissa että inference-kustannuksessa. Lisäksi BlackMamban kehys perii sekä Sekoittujen asiantuntijoiden mallien että Mamba-kehysmallien generoinnin ja vähentää koulutusta samanaikaisesti.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.