Modele și platforme AI
Ultimul model MoE 8x7B al Mistral AI
care este o companie de startup deschisă cu sediul la Paris a provocat normele prin lansarea celui mai recent model de limbaj mare (LLM), MoE 8x7B, prin intermediul unui simplu link de torrent. Acest lucru se împotrivește abordării tradiționale a Google cu lansarea Gemini, generând conversații și entuziasm în comunitatea de inteligență artificială.
Abordarea Mistral AI pentru lansări a fost întotdeauna neconvențională. Adesea renunțând la însoțitorii obișnuiți de articole, bloguri sau comunicate de presă, strategia lor a fost unic eficientă în capturarea atenției comunității de inteligență artificială.
Recent, compania a realizat o evaluare remarcabilă de $2 miliarde în urma unei rundă de finanțare conduse de Andreessen Horowitz. Această rundă de finanțare a fost istorică, stabilind un record cu o rundă de seed de 118 milioane de dolari, cea mai mare din istoria Europei. Dincolo de succesele de finanțare, implicarea activă a Mistral AI în discuțiile despre Actul UE privind inteligența artificială, pledând pentru o reglementare redusă în inteligența artificială deschisă.
De ce MoE 8x7B atrage atenția
Descrierea “GPT-4 redus” a lui Mixtral 8x7B utilizează un cadru de amestec de experți (MoE) cu opt experți. Fiecare expert are 111 miliarde de parametri, cuplați cu 55 miliarde de parametri de atenție partajați, pentru un total de 166 miliarde de parametri pe model. Acestă alegere de proiectare este semnificativă, deoarece permite ca doar doi experți să fie implicați în inferența fiecărui token, subliniind o schimbare către un procesare mai eficientă și concentrată.
Una dintre principalele caracteristici ale lui Mixtral este capacitatea sa de a gestiona un context extins de 32.000 de tokeni, oferind o gamă largă de posibilități pentru gestionarea sarcinilor complexe. Capabilitățile multilingve ale modelului includ suport robust pentru engleză, franceză, italiană, germană și spaniolă, deservind o comunitate de dezvoltatori globală.
Pregătirea prealabilă a lui Mixtral implică date provenite de pe webul deschis, cu o abordare de pregătire simultană atât pentru experți, cât și pentru routere. Această metodă asigură că modelul nu este doar vast în spațiul său de parametri, ci și fin reglat la nuanțele datelor la care a fost expus.

Mixtral 8x7B obține un scor impresionant
Mixtral 8x7B depășește LLaMA 2 70B și rivalizează cu GPT-3.5, mai ales notabil în sarcina MBPP cu o rată de succes de 60,7%, semnificativ mai mare decât a omologilor săi. Chiar și în sarcina riguroasă MT-Bench, destinată modelelor de urmărire a instrucțiunilor, Mixtral 8x7B obține un scor impresionant, aproape egal cu GPT-3.5
Înțelegerea cadrului de amestec de experți (MoE)
Modelul de amestec de experți (MoE), deși a căpătat recent atenție datorită incorporării sale în modelele de limbaj de ultimă generație, cum ar fi MoE 8x7B al Mistral AI, are rădăcini în concepte fundamentale care datează de mai mulți ani. Să reexaminăm originile acestei idei prin intermediul unor cercetări semnificative.
Conceptul de MoE
Amestecul de experți (MoE) reprezintă o schimbare de paradigmă în arhitectura rețelelor neuronale. În contrast cu modelele tradiționale care utilizează o rețea omogenă pentru a procesa toate tipurile de date, MoE adoptă o abordare mai specializată și modulară. Acesta constă în multiple rețele de “experți”, fiecare proiectat pentru a gestiona tipuri specifice de date sau sarcini, supravegheat de o “rețea de porți” care direcționează dinamic datele de intrare către expertul cel mai potrivit.

Un strat de amestec de experți (MoE) încorporat într-un model de limbaj recurent (Sursă)
Imaginea de mai sus prezintă o vedere de ansamblu a unui strat MoE încorporat într-un model de limbaj. La esență, stratul MoE este compus din multiple sub-rețele feed-forward, denumite “experți”, fiecare cu potențialul de a se specializa în procesarea diferitelor aspecte ale datelor. O rețea de porți, evidențiată în diagramă, determină care combinație de experți este implicată pentru o anumită intrare. Această activare condiționată permite rețelei să-și crească semnificativ capacitatea fără o creștere corespunzătoare a cerințelor computaționale.
Funcționalitatea stratului MoE
În practică, rețeaua de porți evaluează intrarea (denumită G(x) în diagramă) și selectează un set restrâns de experți pentru a o procesa. Această selecție este modulată de ieșirile rețelei de porți, determinând în mod efectiv “votul” sau contribuția fiecărui expert la ieșirea finală. De exemplu, așa cum se arată în diagramă, doar doi experți pot fi selectați pentru calcularea ieșirii pentru fiecare token specific, făcând procesul eficient prin concentrarea resurselor computaționale acolo unde sunt cele mai necesare.

Encoder Transformer cu straturi MoE (Sursă)
Ilustrația de mai sus prezintă un encoder tradițional Transformer și unul îmbunătățit cu straturi MoE. Arhitectura Transformer, larg cunoscută pentru eficacitatea sa în sarcinile legate de limbaj, este în mod tradițional compusă din straturi de auto-atenție și feed-forward. Introducerea straturilor MoE înlocuiește unele dintre aceste straturi, permițând modelului să se extindă cu privire la capacitate într-un mod mai eficient.
În modelul îmbunătățit, straturile MoE sunt fragmentate pe multiple dispozitive, demonstrând o abordare model-paralelă. Acest lucru este critic atunci când se extinde la modele foarte mari, deoarece permite distribuirea încărcăturii computaționale și a cerințelor de memorie pe un cluster de dispozitive, cum ar fi GPU-uri sau TPU-uri. Această fragmentare este esențială pentru antrenarea și implementarea modelelor cu miliarde de parametri într-un mod eficient, așa cum este demonstrat de antrenarea modelelor cu sute de miliarde până la un trilion de parametri pe cluster de computere de mare scară.
Abordarea MoE rară cu ajustare de instrucțiuni pe LLM
Articolul intitulat “Amestec de experți rari (MoE) pentru modelarea limbajului scalabil” discută o abordare inovatoare pentru îmbunătățirea modelelor de limbaj mare (LLM) prin integrarea arhitecturii de amestec de experți cu tehnici de ajustare de instrucțiuni.
Acesta subliniază o provocare comună în care modelele MoE subperformează în comparație cu modelele dense de aceeași capacitate computațională atunci când sunt ajustate pentru sarcini specifice, datorită discrepanțelor dintre pregătirea generală și ajustarea specifică a sarcinii.
Ajustarea de instrucțiuni este o metodologie de antrenare în care modelele sunt rafinate pentru a urma mai bine instrucțiunile de limbaj natural, îmbunătățind în mod eficient performanța lor în sarcini. Articolul sugerează că modelele MoE arată o îmbunătățire notabilă atunci când sunt combinate cu ajustarea de instrucțiuni, mai mult decât omologii lor denși. Această tehnică aliniază reprezentările pre-antrenate ale modelului pentru a urma instrucțiunile într-un mod mai eficient, conducând la creșteri semnificative de performanță.
Cercetătorii au efectuat studii în trei configurații experimentale, dezvăluind că modelele MoE subperformează inițial în ajustarea directă a sarcinilor specifice. Cu toate acestea, atunci când se aplică ajustarea de instrucțiuni, modelele MoE excelează, mai ales atunci când sunt suplimentate cu ajustarea specifică a sarcinii. Acest lucru sugerează că ajustarea de instrucțiuni este un pas vital pentru modelele MoE pentru a depăși modelele dense în sarcinile descendente.
De asemenea, introduce FLAN-MOE32B, un model care demonstrează aplicarea cu succes a acestor concepte. Notabil, acesta depășește FLAN-PALM62B, un model dens, în sarcinile de referință, utilizând doar o treime din resursele computaționale. Acest lucru demonstrează potențialul modelelor MoE rare combinate cu ajustarea de instrucțiuni pentru a stabili noi standarde pentru eficiența și performanța LLM.
Implementarea amestecului de experți în scenarii din lumea reală
Versatilitatea modelelor MoE le face ideale pentru o gamă largă de aplicații:
- Procesarea limbajului natural (NLP): Modelele MoE pot gestiona nuanțele și complexitățile limbajului uman într-un mod mai eficient, făcându-le ideale pentru sarcinile avansate de NLP.
- Procesarea imaginilor și a videourilor: În sarcinile care necesită procesare de înaltă rezoluție, MoE poate gestiona diferite aspecte ale imaginilor sau cadrelor video, îmbunătățind atât calitatea, cât și viteza de procesare.
- Soluții personalizate de inteligență artificială: Companiile și cercetătorii pot adapta modelele MoE la sarcini specifice, conducând la soluții de inteligență artificială mai țintite și eficiente.
Provocări și considerații
Deși modelele MoE oferă numeroase beneficii, ele prezintă și provocări unice:
- Complexitate în antrenare și ajustare: Natura distribuită a modelelor MoE poate complica procesul de antrenare, necesitând o echilibrare și o ajustare atentă a experților și a rețelei de porți.
- Managementul resurselor: Gestionarea eficientă a resurselor computaționale pe multiple experți este crucială pentru maximizarea beneficiilor modelelor MoE.
Incorporarea straturilor MoE în rețelele neuronale, mai ales în domeniul modelelor de limbaj, oferă o cale către scalarea modelelor la dimensiuni anterior inaccesibile din cauza constrângerilor computaționale. Calculul condiționat permis de straturile MoE permite o distribuție mai eficientă a resurselor computaționale, făcând posibil antrenarea unor modele mai mari și mai capabile. Pe măsură ce vom continua să cerem mai mult de la sistemele noastre de inteligență artificială, arhitecturi precum Transformerul echipat cu MoE sunt probabil să devină standardul pentru gestionarea sarcinilor complexe și de mare scară în diverse domenii.













