AI-modeller og plattformer
Mistral AI’s nyeste Mixture of Experts (MoE) 8x7B-modell
som er et Paris-basert open-source modell-selskap, har utfordret normene ved å slippe sin nyeste store språkmodell (LLM), MoE 8x7B, gjennom en enkel torrent-lenke. Dette er i kontrast til Googles tradisjonelle tilnærming med deres Gemini-utgivelse, og har ført til samtaler og begeistring innen AI-samfunnet.
Mistral AI’s tilnærming til utgivelser har alltid vært uvanlig. Ofte har de forkastet de vanlige tilleggene som papirer, blogger eller pressemeldinger, og deres strategi har vært unikt effektiv i å fange AI-samfunnets oppmerksomhet.
Nylig oppnådde selskapet en bemerkelsesverdig $2 milliarder verdi etter en finansieringsrunde ledet av Andreessen Horowitz. Denne finansieringsrunden var historisk og satte en rekord med en $118 millioner seed-runde, den største i europeisk historie. Foruten finansieringssuksess, er Mistral AI aktivt engasjert i diskusjoner rundt EU AI-loven, og forkjemper for redusert regulering av open-source AI.
Hvorfor MoE 8x7B trekker oppmerksomhet
Beskrevet som en “skalert ned GPT-4”, bruker Mixtral 8x7B en Mixture of Experts (MoE)-ramme med åtte eksperter. Hver ekspert har 111 milliarder parametre, kombinert med 55 milliarder delt oppmerksomhetsparametre, for å gi en total på 166 milliarder parametre per modell. Dette designvalget er betydelig, da det tillater bare to eksperter å være involvert i inferensen av hver token, og høydepunkter en skiftning mot mer effektiv og fokusert AI-behandling.
En av de viktigste høydepunktene ved Mixtral er dens evne til å håndtere en omfattende kontekst på 32 000 token, og gir god plass for å håndtere komplekse oppgaver. Modellens flerspråklige evner inkluderer robust støtte for engelsk, fransk, italiensk, tysk og spansk, og betjener en global utvikler-samfunn.
Forutrening av Mixtral innebærer data fra det åpne nettet, med en samtidig treningstilnærming for både eksperter og routere. Denne metoden sikrer at modellen ikke bare er stor i parameterrommet, men også finjustert til nyansene i de omfattende dataene den har vært utsatt for.

Mixtral 8x7B oppnår en imponerende score
Mixtral 8x7B overgår LLaMA 2 70B og rivaliserer GPT-3.5, særlig merkbart i MBPP-oppgaven med en 60,7% suksessrate, som er betydelig høyere enn dens motparter. Selv i den strenge MT-Bench, som er tilpasset instruksjonsbaserte modeller, oppnår Mixtral 8x7B en imponerende score, nærmest like GPT-3.5
Forståelsen av Mixture of Experts (MoE)-rammen
Mixture of Experts (MoE)-modellen, som har fått nylig oppmerksomhet på grunn av dens inkorporering i state-of-the-art språkmodeller som Mistral AI’s MoE 8x7B, er faktisk rotfestet i grunnleggende konsepter som daterer tilbake flere år. La oss se på opphavet til denne ideen gjennom seminale forskningspapirer.
Konseptet MoE
Mixture of Experts (MoE) representerer en paradigmeskift i neurale nettverksarkitektur. I motsetning til tradisjonelle modeller som bruker ett enkelt, homogent nettverk til å prosessere alle typer data, adopterer MoE en mer spesialisert og modulær tilnærming. Den består av flere “ekspert”-nettverk, hver designet for å håndtere spesifikke typer data eller oppgaver, overvåket av en “gating”-nettverk som dynamisk dirigerer inndata til den mest passende eksperten.

En Mixture of Experts (MoE)-lag innbygget i en rekurrent språkmodell (Kilde)
Bildet over presenterer en høytnivå-oversikt over en MoE-lag innbygget i en språkmodell. I sin essens består MoE-laget av flere feed-forward undernettverk, betegnet som “eksperter”, hver med potensialet til å spesialisere seg i å prosessere ulike aspekter av dataene. En gating-nettverk, høydepunktet i diagrammet, bestemmer hvilken kombinasjon av disse eksperter som er engasjert for en gitt inndata. Denne betingede aktivering tillater nettverket å øke sin kapasitet uten en tilsvarende økning i beregningskrav.
Funksjonaliteten til MoE-laget
I praksis vurderer gating-nettverket inndataene (betegnet som G(x) i diagrammet) og velger en sparsom mengde eksperter til å prosessere dem. Denne valget er modulert av gating-nettverkets utdata, og bestemmer effektivt “stemmen” eller bidraget til hver ekspert til den endelige utdataen. For eksempel, som vist i diagrammet, kan bare to eksperter være valgt for å beregne utdataene for hver bestemt token, og gjør prosessen effektiv ved å konsentrere beregningsressursene der de er mest nødvendige.

Transformer Encoder med MoE-lag (Kilde)
Den andre illustrasjonen over kontrasterer en tradisjonell Transformer-encoder med en som er utvidet med en MoE-lag. Transformer-arkitekturen, som er vidt kjent for sin effektivitet i språkrelaterte oppgaver, består tradisjonelt av selv-oppmerksomhet og feed-forward-lag stakk i sekvens. Innføringen av MoE-lag erstatter noen av disse feed-forward-lagene, og muliggjør at modellen kan skaleres med hensyn til kapasitet mer effektivt.
I den utvidede modellen er MoE-lagene shardet over flere enheter, og viser en modell-parallell tilnærming. Dette er kritisk når man skal skalerer til svært store modeller, da det tillater distribusjon av beregningslasten og minnekravene over en cluster av enheter, som GPU-er eller TPU-er. Denne shardingen er essensiell for å trene og deployere modeller med milliarder av parametre effektivt, som vist ved treningen av modeller med hundre milliarder til over en billion parametre på store beregningscluster.
Sparse MoE-tilnærming med instruksjonstuning på LLM
Artikkelen “Sparse Mixture-of-Experts (MoE) for Scalable Language Modeling” diskuterer en innovativ tilnærming for å forbedre store språkmodeller (LLM) ved å integrere Mixture of Experts-arkitekturen med instruksjonstuningsteknikker.
Den høydepunkter en vanlig utfordring hvor MoE-modeller underpresterer i forhold til tette modeller av lik beregningskapasitet når de finjusteres for bestemte oppgaver, på grunn av diskrepanser mellom generell forutrening og oppgave-spesifik finjustering.
Instruksjonstuning er en treningsmetodikk hvor modeller refines til å følge naturlige språkinstruksjoner bedre, og effektivt forbedrer deres oppgaveprestasjon. Artikkelen foreslår at MoE-modeller viser en merkbar forbedring når de kombineres med instruksjonstuning, mer enn deres tette motparter. Denne teknikken justerer modellens forutrente representasjoner til å følge instruksjoner mer effektivt, og fører til betydelige prestasjonsforbedringer.
Forskerne utførte studier over tre eksperimentelle oppsett, og avdekket at MoE-modeller initialt underpresterer i direkte oppgave-spesifik finjustering. Men når instruksjonstuning blir anvendt, overgår MoE-modeller, særlig når de suppleres med oppgave-spesifik finjustering. Dette antyder at instruksjonstuning er en vital skritt for MoE-modeller til å overgå tette modeller på nedstrømsoppgaver.
Den introduserer også FLAN-MOE32B, en modell som demonstrerer den suksessfulle anvendelsen av disse konseptene. Merkverdig overgår den FLAN-PALM62B, en tett modell, på benchmark-oppgaver, mens den bare bruker en tredjedel av beregningsressursene. Dette viser potensialet for sparse MoE-modeller kombinert med instruksjonstuning til å sette nye standarder for LLM-effektivitet og prestasjon.
Implementering av Mixture of Experts i virkelige scenarier
Flerebruksmodellene til MoE gjør dem ideelle for en rekke anvendelser:
- Naturlig språkbehandling (NLP): MoE-modeller kan håndtere nyansene og kompleksitetene i menneskespråk mer effektivt, og gjør dem ideelle for avanserte NLP-oppgaver.
- Bilde- og video-behandling: I oppgaver som krever høyoppløst behandling, kan MoE håndtere ulike aspekter av bilder eller video-rammer, og forbedrer både kvalitet og behandlingshastighet.
- Tilpassede AI-løsninger: Bedrifter og forskere kan tilpasse MoE-modeller til bestemte oppgaver, og fører til mer målrettede og effektive AI-løsninger.
Ufordringer og betraktninger
MoE-modeller tilbyr mange fordeler, men de presenterer også unike utfordringer:
- Kompleksitet i trening og finjustering: Den distribuerte naturen til MoE-modeller kan komplisere treningsprosessen, og krever omhyggelig balansering og finjustering av eksperter og gating-nettverk.
- Ressursforvaltning: Effektivt forvaltning av beregningsressurser over flere eksperter er kritisk for å maksimere fordelen av MoE-modeller.
Innføring av MoE-lag i neurale nettverk, særlig i domenet til språkmodeller, tilbyr en vei mot å skalerer modeller til størrelser som tidligere var umulige på grunn av beregningsbegrensninger. Den betingede beregningen som muliggjøres av MoE-lag tillater en mer effektiv distribusjon av beregningsressurser, og gjør det mulig å trene større og mer kapable modeller. Ettersom vi fortsetter å kreve mer av våre AI-systemer, er arkitekturer som MoE-utstyrt Transformer sannsynligvis å bli standarden for å håndtere komplekse, storstilte oppgaver over ulike domener.













