Modele și platforme AI
BlackMamba: O Introducere în MoE pentru Modele cu Spațiu de Stare
Dezvoltarea Modelelor de Limbaj Mare (LLM) construite din modele de transformator doar cu decodificator a jucat un rol crucial în transformarea domeniului de Procesare a Limbajului Natural (NLP), precum și în avansarea diverselor aplicații de învățare profundă, incluzând învățarea prin întărire, analiza seriei de timp, prelucrarea imaginilor și multe altele. Cu toate acestea, în ciuda scalabilității și a performanței puternice, LLM-urile construite din modele de transformator doar cu decodificator încă se confruntă cu deficiențe semnificative. Deși sunt expresive, mecanismul de atenție din LLM-urile derivate din transformator necesită resurse computaționale ridicate atât în timpul inferenței, cât și al antrenamentului, necesitând o cantitate substanțială de memorie pentru lungimea secvenței și operații computaționale (FLOPs) care cresc pătratic. Această cerință computațională ridicată limitează lungimea contextului modelului, face ca generarea autoregresivă să fie proporțional de scumpă cu scala modelului și împiedică modelul să învețe din fluxuri de date continue și să proceseze secvențe de lungime nelimitată în mod eficient.
În ultimul timp, Modelele cu Spațiu de Stare (SSM) au demonstrat capacități și performanțe remarcabile, concurând cu modelele de arhitectură de transformator în benchmark-uri de modelare la scară largă, iar complexitatea lor de memorie este o funcție liniară a lungimii secvenței, față de complexitatea pătratică oferită de transformatori. Teoretic, complexitatea liniară cu respectarea lungimii secvenței permite Modelelor cu Spațiu de Stare să proceseze secvențe mai lungi decât modelele de arhitectură de transformator pentru un anumit buget de FLOPS sau operații cu virgulă flotantă pe secundă și să facă generarea autoregresivă constantă în ceea ce privește calculul, fără a necesita o cache KV. Modelele cu Spațiu de Stare recent dezvoltate, incluzând Mamba, RetNet și altele, au demonstrat inferență și antrenament eficient pe secvențe lungi, precum și performanțe competitive în sarcini de modelare a limbajului, comparativ cu transformatorii cu proprietăți de scalare similare. În același timp, modelele Mixture of Expert (MoE) au arătat, de asemenea, performanțe impresionante, reducând semnificativ întârzierea și costul computațional al inferenței, chiar dacă la expense de o amprentă de memorie mai mare. Construind pe baza modelelor Mamba și MoE, acest articol va discuta BlackMamba, o arhitectură nouă care combină modelul Mamba cu Spațiu de Stare cu modelele MoE pentru a valorifica beneficiile oferite de ambele cadre. Experimentele pe BlackMamba au demonstrat capacitatea sa de a depăși cadrul existent Mamba și liniile de bază ale transformatorului atât în ceea ce privește FLOPs de antrenament, cât și inferență. Performanța excepțională a cadrului BlackMamba arată că poate combina eficient capacitățile cadrului Mamba și MoE, oferind inferență rapidă și eficientă din MoE, împreună cu generare liniar-complexă din Mamba.
… (rest of the translation)












