AI-modeller och plattformar
Mistral AI:s senaste Mixture of Experts (MoE) 8x7B-modell
som är ett Parisbaserat företag som utvecklar öppen källkod, har utmanat normer genom att släppa sin senaste stora språkmodell (LLM), MoE 8x7B, via en enkel torrentlänk. Detta skiljer sig från Googles traditionella tillvägagångssätt med deras Gemini-utgåva, vilket har väckt diskussioner och entusiasm inom AI-samhället.
Mistral AI:s tillvägagångssätt för utgåvor har alltid varit otraditionellt. Ofta har de avstått från de vanliga tillbehören som papper, blogginlägg eller pressmeddelanden, och deras strategi har varit unikt effektiv för att fånga AI-samhällets uppmärksamhet.
Nyligen uppnådde företaget en anmärkningsvärd $2 miljarders värdering efter en finansieringsrunda ledd av Andreessen Horowitz. Denna finansieringsrunda var historisk och satte rekord med en $118 miljoner stor seedrunda, den största i europeisk historia. Utöver finansieringsframgångar är Mistral AI aktivt engagerat i diskussioner om EU:s AI-lag, där de förespråkar minskad reglering av öppen källkod inom AI.
Varför MoE 8x7B väcker uppmärksamhet
Beskriven som en “nedskalad GPT-4”, använder Mixtral 8x7B en Mixture of Experts (MoE)-ramverk med åtta experter. Varje expert har 111 miljarder parametrar, kombinerat med 55 miljarder delade uppmärksamhetsparametrar, vilket ger totalt 166 miljarder parametrar per modell. Detta designval är betydelsefullt eftersom det tillåter att endast två experter är involverade i inferensen av varje token, vilket markerar en förskjutning mot mer effektiv och fokuserad AI-bearbetning.
En av de viktigaste aspekterna av Mixtral är dess förmåga att hantera en omfattande kontext på 32 000 token, vilket ger tillräckligt med utrymme för att hantera komplexa uppgifter. Modellens flerspråkiga förmågor omfattar robust stöd för engelska, franska, italienska, tyska och spanska, vilket tillgodoser en global utvecklarsamhälle.
Förträningen av Mixtral omfattar data från den öppna webben, med en samtidig träningsmetod för både experter och routrar. Denna metod säkerställer att modellen inte bara är omfattande i sin parameterutrymme utan också finjusterad till nyanserna i den omfattande datan den har exponerats för.

Mixtral 8x7B uppnår en imponerande poäng
Mixtral 8x7B överträffar LLaMA 2 70B och rivaliserar GPT-3.5, särskilt noterbart i MBPP-uppgiften med en 60,7-procentig framgångsgrad, vilket är betydligt högre än dess motsvarigheter. Även i den rigorösa MT-Bench, som är utformad för modeller som följer instruktioner, uppnår Mixtral 8x7B en imponerande poäng, nästan i nivå med GPT-3.5
Att förstå Mixture of Experts (MoE)-ramverket
Mixture of Experts (MoE)-modellen, som nyligen har fått uppmärksamhet på grund av dess inkorporering i state-of-the-art-språkmodeller som Mistral AI:s MoE 8x7B, har sina rötter i grundläggande koncept som går tillbaka flera år. Låt oss återbesöka ursprunget till denna idé genom seminella forskningsartiklar.
Konceptet MoE
Mixture of Experts (MoE) representerar en paradigmförskjutning i neurala nätverksarkitektur. Till skillnad från traditionella modeller som använder ett enda, homogent nätverk för att bearbeta alla typer av data, antar MoE en mer specialiserad och modulär tillvägagångssätt. Det består av flera “expertnätverk”, var och en utformad för att hantera specifika typer av data eller uppgifter, övervakade av ett “gatingnätverk” som dynamiskt styr indata till den mest lämpliga experten.

En Mixture of Experts (MoE)-lager inbäddat i en rekurrent språkmodell (Källa)
Ovanstående bild presenterar en högnivåvy över ett MoE-lager inbäddat i en språkmodell. I dess essens består MoE-lagret av flera feed-forward-undernätverk, benämnda “experter”, var och en med potentialen att specialisera sig i att bearbeta olika aspekter av datan. Ett gatingnätverk, markerat i diagrammet, bestämmer vilken kombination av dessa experter som ska engageras för en given indata. Denna villkorsbetingade aktivering tillåter nätverket att signifikant öka sin kapacitet utan en motsvarande ökning av beräkningskraven.
Funktionalitet i MoE-lagret
I praktiken utvärderar gatingnätverket indata (betecknat som G(x) i diagrammet) och väljer en sparsam uppsättning experter för att bearbeta den. Detta urval moduleras av gatingnätverkets utdata, vilket effektivt bestämmer “rösten” eller bidraget från varje expert till den slutliga utdatan. Till exempel, som visas i diagrammet, kan endast två experter väljas för att beräkna utdatan för varje specifik token, vilket gör processen effektiv genom att koncentrera beräkningsresurserna där de behövs mest.

Transformer-encoder med MoE-lager (Källa)
Den andra illustrationen ovan kontrasterar en traditionell Transformer-encoder med en som kompletterats med ett MoE-lager. Transformer-arkitekturen, som är välkänd för sin effektivitet i språkrelaterade uppgifter, består traditionellt av självuppmärksamhets- och feed-forward-lager staplade i sekvens. Införandet av MoE-lager ersätter vissa av dessa feed-forward-lager, vilket möjliggör för modellen att skalas med avseende på kapacitet mer effektivt.
I den kompletterade modellen är MoE-lagren shardade över flera enheter, vilket visar en modellparallell tillvägagångssätt. Detta är avgörande när man skalor upp till mycket stora modeller, eftersom det tillåter distribution av beräkningsbördan och minneskraven över en kluster av enheter, såsom GPU:er eller TPU:er. Denna shardning är avgörande för att träna och distribuera modeller med miljarder av parametrar effektivt, som bevisas av utbildningen av modeller med hundratals miljarder till över en biljon parametrar på stora beräkningskluster.
Den glesa MoE-metoden med instruktionsjustering på LLM
Artikeln med titeln “Sparse Mixture-of-Experts (MoE) för skalbar språkmodellering” diskuterar en innovativ metod för att förbättra stora språkmodeller (LLM) genom att integrera Mixture of Experts-arkitekturen med instruktionsjusteringstekniker.
Den belyser en vanlig utmaning där MoE-modeller underpresterar jämfört med täta modeller med samma beräkningskapacitet när de finjusteras för specifika uppgifter på grund av skillnader mellan allmän förträning och uppgiftsspecifik finjustering.
Instruktionsjustering är en träningsmetod där modeller raffineras för att bättre följa naturliga språkinstruktioner, vilket effektivt förbättrar deras uppgiftsprestanda. Artikeln föreslår att MoE-modeller visar en anmärkningsvärd förbättring när de kombineras med instruktionsjustering, mer än sina täta motsvarigheter. Denna teknik justerar modellens förtränade representationer för att följa instruktioner mer effektivt, vilket leder till signifikanta prestandaförbättringar.
Forskarna genomförde studier i tre experimentella uppsättningar, vilket visade att MoE-modeller initialt underpresterar i direkt uppgiftsspecifik finjustering. Men när instruktionsjustering tillämpas, överträffar MoE-modellerna, särskilt när de kompletteras med uppgiftsspecifik finjustering. Detta tyder på att instruktionsjustering är ett avgörande steg för MoE-modeller för att överträffa täta modeller i nedströmsuppgifter.
Den introducerar också FLAN-MOE32B, en modell som demonstrerar den framgångsrika tillämpningen av dessa koncept. Noterbart överträffar den FLAN-PALM62B, en tät modell, på benchmarkuppgifter medan den endast använder en tredjedel av beräkningsresurserna. Detta visar potentialen för glesa MoE-modeller kombinerade med instruktionsjustering för att sätta nya standarder för LLM-effektivitet och prestanda.
Att implementera Mixture of Experts i verkliga scenarier
MoE-modellernas flexibilitet gör dem idealiska för en mängd olika tillämpningar:
- Naturlig språkbehandling (NLP): MoE-modeller kan hantera nyanserna och komplexiteten i mänskligt språk mer effektivt, vilket gör dem idealiska för avancerade NLP-uppgifter.
- Bild- och videobearbetning: I uppgifter som kräver högupplöst bearbetning kan MoE hantera olika aspekter av bilder eller videofrimer, vilket förbättrar både kvalitet och bearbetningshastighet.
- Anpassade AI-lösningar: Företag och forskare kan anpassa MoE-modeller till specifika uppgifter, vilket leder till mer riktade och effektiva AI-lösningar.
Utmaningar och överväganden
Medan MoE-modeller erbjuder många fördelar presenterar de också unika utmaningar:
- Komplexitet i träning och justering: Den distribuerade naturen hos MoE-modeller kan komplicera träningsprocessen, vilket kräver noggrann balansering och justering av experter och gatingnätverk.
- Resursadministration: Effektiv hantering av beräkningsresurser över flera experter är avgörande för att maximera fördelarna med MoE-modeller.
Inkludering av MoE-lager i neurala nätverk, särskilt inom området språkmodeller, erbjuder en väg mot att skalera modeller till storlekar som tidigare var omöjliga på grund av beräkningsbegränsningar. Den villkorsbetingade beräkningen som möjliggörs av MoE-lager tillåter en mer effektiv distribution av beräkningsresurser, vilket gör det möjligt att träna större och mer kapabla modeller. När vi fortsätter att kräva mer av våra AI-system är arkitekturer som MoE-utrustade Transformer sannolikt att bli standarden för att hantera komplexa, storskaliga uppgifter inom olika områden.













