Fundamentele AI
Ascensiunea Modelelor Mixture-of-Experts: Cum Modelele Sparse AI Reshapă Viitorul Învățării Automate
Modelele Mixture-of-Experts (MoE) revolutionează modul în care scalăm inteligența artificială. Prin activarea doar a unei părți a componentelor unui model la un moment dat, MoE oferă o abordare nouă pentru gestionarea compromisului dintre dimensiunea modelului și eficiența computațională. În contrast cu modelele dense tradiționale care utilizează toți parametrii pentru fiecare intrare, MoE ating dimensiuni uriașe de parametri, menținând în același timp inferența și costurile de antrenare sub control. Acest progres a declanșat o valură de cercetare și dezvoltare, determinând atât gigantii tehnologiei, cât și startup-urile să investească masiv în arhitecturi bazate pe MoE.
Cum Funcționează Modelele Mixture-of-Experts
La baza lor, modelele MoE constau în multiple sub-rețele specializate numite “experți”, supravegheați de un mecanism de porționare care decide care experți ar trebui să gestioneze fiecare intrare. De exemplu, o propoziție introdusă într-un model de limbaj poate implica doar doi din opt experți, reducând drastic încărcătura computațională.
Acest concept a fost adus în mainstream de Switch Transformer și GLaM de la Google (GOOGL ), unde experții au înlocuit straturile feed-forward tradiționale din Transformeri. Switch Transformer, de exemplu, direcționează token-urile către un singur expert per strat, în timp ce GLaM utilizează rutarea top-2 pentru o performanță îmbunătățită. Aceste proiecte au demonstrat că MoE pot egala sau depăși modele dense, cum ar fi GPT-3, utilizând semnificativ mai puțină energie și computație.
Cheia inovației stă în computația condiționată. În loc de a activa întregul model, MoE activează doar părțile cele mai relevante, ceea ce înseamnă că un model cu sute de miliarde sau chiar trilioane de parametri poate rula cu eficiența unuia care este cu ordine de mărime mai mic. Acest lucru permite cercetătorilor să mărească capacitatea fără creșteri liniare în computație, o realizare de neatins cu metodele tradiționale de scalare.

Apliții Reale ale MoE
Modelele MoE și-au făcut deja marca în mai multe domenii. GLaM și Switch Transformer de la Google au arătat rezultate de top în modelarea limbajului, cu costuri de antrenare și inferență mai mici. Z-Code MoE de la Microsoft (MSFT ) este operațional în instrumentul său de traducere, gestionând peste 100 de limbi cu o acuratețe și eficiență mai bună decât modelele anterioare. Acestea nu sunt doar proiecte de cercetare – ele alimentează servicii live.
În viziunea computerizată, arhitectura V-MoE de la Google a îmbunătățit acuratețea clasificării pe benchmark-uri precum ImageNet, iar modelul LIMoE a demonstrat o performanță puternică în sarcini multimodale care implică atât imagini, cât și text. Capacitatea experților de a se specializa – unii gestionând text, alții imagini – adaugă o nouă stratificare de capacitate sistemelor de inteligență artificială.
Sistemele de recomandare și platformele de învățare multi-task au beneficiat, de asemenea, de la MoE. De exemplu, motorul de recomandare al YouTube a adoptat o arhitectură similară cu MoE pentru a gestiona obiective precum timpul de vizionare și rata de click-through mai eficient. Prin atribuirea diferiților experți pentru diferite sarcini sau comportamente ale utilizatorilor, MoE ajută la construirea unor motoare de personalizare mai robuste.
Beneficii și Provocări
Principalul avantaj al MoE este eficiența. Ele permit modele masive să fie antrenate și implementate cu mult mai puțină computație. De exemplu, modelul Mixtral 8×7B de la Mistral AI are 47B de parametri totali, dar activează doar 12,9B pe token, oferindu-i eficiența unui model de 13B, în timp ce concurează cu modele precum GPT-3.5 în ceea ce privește calitatea.
MoE promovează, de asemenea, specializarea. Deoarece diferiți experți pot învăța modele distincte, modelul general devine mai bun în gestionarea intrărilor diverse. Acest lucru este deosebit de util în sarcini multilingve, multi-domeniu sau multimodale, unde un model dens universal poate subperforma.
Cu toate acestea, MoE vin cu provocări de inginerie. Antrenarea lor necesită un echilibru atent pentru a asigura că toți experții sunt utilizați eficient. Supraîncărcarea memoriei este o altă preocupare – deși doar o fracțiune din parametri sunt activi pe inferență, toți trebuie încărcați în memorie. Distribuirea eficientă a computației pe GPU-uri sau TPU-uri nu este trivială și a condus la dezvoltarea unor cadre specializate, cum ar fi DeepSpeed de la Microsoft și GShard de la Google.
În ciuda acestor obstacole, beneficiile de performanță și cost sunt suficient de substanțiale, astfel încât MoE sunt acum văzute ca o componentă critică a proiectării de inteligență artificială la scară largă. Pe măsură ce mai multe unelte și infrastructură mature, aceste provocări sunt treptat depășite.
Cum se Compară MoE cu Alte Metode de Scalare
Scalarea tradițională densă crește dimensiunea modelului și computația proporțional. MoE sparg această liniaritate prin creșterea numărului total de parametri fără creșterea computației pe intrare. Acest lucru permite modelelor cu trilioane de parametri să fie antrenate pe aceeași hardware care anterior era limitată la zeci de miliarde.
În comparație cu ensembling-ul de modele, care introduce, de asemenea, specializare, dar necesită multiple treceri complete, MoE sunt mult mai eficiente. În loc de a rula mai multe modele în paralel, MoE rulează doar unul – dar cu beneficiul mai multor căi de experți.
MoE completează, de asemenea, strategii precum scalarea datelor de antrenare (de exemplu, metoda Chinchilla). În timp ce Chinchilla subliniază utilizarea mai multor date cu modele mai mici, MoE extind capacitatea modelului, menținând computația stabilă, făcându-le ideale pentru cazurile în care computația este blocajul.
În cele din urmă, în timp ce tehnici precum pruning-ul și cuantificarea reduc dimensiunea modelului după antrenare, MoE cresc capacitatea modelului în timpul antrenării. Ele nu sunt o înlocuire pentru compresie, ci un instrument ortogonal pentru creșterea eficientă.
Companiile care Conduc Revoluția MoE
Gigantii Tehnologiei
Google a inițiat o mare parte din cercetarea MoE de astăzi. Modelele lor Switch Transformer și GLaM au escaladat la 1,6T și 1,2T parametri, respectiv. GLaM a egalat performanța GPT-3, utilizând doar o treime din energia necesară. Google a aplicat, de asemenea, MoE în viziune (V-MoE) și sarcini multimodale (LIMoE), aliniindu-se cu viziunea lor mai largă Pathways pentru modele universale de inteligență artificială.
Microsoft a integrat MoE în producție prin modelul Z-Code în Microsoft Translator. De asemenea, a dezvoltat DeepSpeed-MoE, permițând antrenarea rapidă și inferența cu latență scăzută pentru modele cu trilioane de parametri. Contribuțiile lor includ algoritmi de rutare și biblioteca Tutel pentru computație eficientă MoE.
Meta a explorat MoE în modele de limbaj la scară largă și sisteme de recomandare. Modelul lor MoE de 1,1T a demonstrat că poate egala calitatea modelului dens, utilizând 4 ori mai puțină computație. Deși modelele LLaMA sunt dense, cercetarea Meta în MoE continuă să informeze comunitatea mai largă.
Amazon (AMZN ) susține MoE prin platforma SageMaker și eforturile interne. A facilitat antrenarea modelului Mixtral de la Mistral și se presupune că utilizează MoE în servicii precum Alexa AI. Documentația AWS promovează activ MoE pentru antrenarea de modele la scară largă.
Huawei și BAAI din China au dezvoltat, de asemenea, modele MoE record, cum ar fi PanGu-Σ (1.085T parametri). Acest lucru demonstrează potențialul MoE în limbaj și sarcini multimodale, subliniind atracția sa globală.
Startup-uri și Concurenți
Mistral AI este copilul-minune al inovației MoE în cod deschis. Modelele lor Mixtral 8×7B și 8×22B au demonstrat că MoE pot depăși modele dense, cum ar fi LLaMA-2 70B, rulând la o fracțiune din cost. Cu peste 600 de milioane de euro în finanțare, Mistral pariază puternic pe arhitecturi sparse.
xAI, fondat de Elon Musk, se spune că explorează MoE în modelul lor Grok. Deși detalii sunt limitate, MoE oferă o cale pentru startup-uri precum xAI să concureze cu jucători mai mari fără a necesita computație masivă.
Databricks, prin achiziția MosaicML, a lansat DBRX, un model MoE deschis proiectat pentru eficiență. De asemenea, oferă infrastructură și rețete pentru antrenarea MoE, reducând barierele pentru adoptare.
Alți jucători, cum ar fi Hugging Face, au integrat suport MoE în bibliotecile lor, facilitând dezvoltatorilor să construiască pe aceste modele. Chiar dacă nu construiesc MoE ele însele, platformele care le permit sunt cruciale pentru ecosistem.
Concluzie
Modelele Mixture-of-Experts nu sunt doar o tendință – ele reprezintă o schimbare fundamentală în modul în care construim și scalăm sisteme de inteligență artificială. Prin activarea selectivă a doar unei părți a rețelei, MoE oferă puterea modelelor masive fără costul prohibitiv. Pe măsură ce infrastructura software se maturizează și algoritmii de rutare se îmbunătățesc, MoE sunt poziționate să devină arhitectura implicită pentru inteligența artificială multi-domeniu, multilingvă și multimodală.
Indiferent dacă sunteți cercetător, inginer sau investitor, MoE oferă o perspectivă asupra unui viitor în care inteligența artificială este mai puternică, eficientă și adaptabilă ca niciodată.












