AI-modeller og platforme

Mistral AI’s Seneste Mixture of Experts (MoE) 8x7B Model

mm
Føj Unite.AI til dine foretrukne kilder på Google

Mistral AI

som er en Paris-baseret open-source model startup har udfordret normerne ved at udgive deres seneste store sprogmodel (LLM), MoE 8x7B, gennem en simpel torrent link. Dette modsiger Googles traditionelle tilgang med deres Gemini-udgivelse, hvilket har ført til diskussioner og begejstring inden for AI-samfundet.

Mistral AI’s tilgang til udgivelser har altid været ukonventionel. Ofte har de afstået fra de sædvanlige ledsagende artikler, blogs eller pressemeddelelser, og deres strategi har været unikt effektiv til at fange AI-samfundets opmærksomhed.

For nylig opnåede virksomheden en bemærkelsesværdig $2 milliards vurdering efter en kapitalrunde ledet af Andreessen Horowitz. Denne kapitalrunde var historisk og satte en rekord med en $118 millioner seed-runde, den største i europæisk historie. Ud over finansieringssucces har Mistral AI’s aktive deltagelse i diskussioner om EU’s AI-lov, hvor de har advokeret for reduceret regulering af open-source AI.

Hvorfor MoE 8x7B tiltrækker opmærksomhed

Beskrevet som en “skaleret ned GPT-4”, bruger Mixtral 8x7B en Mixture of Experts (MoE) ramme med otte eksperter. Hver ekspert har 111 mia. parametre, kombineret med 55 mia. fælles opmærksomhedsparametre, hvilket giver en samlet total på 166 mia. parametre pr. model. Dette designvalg er betydeligt, da det kun kræver, at to eksperter er involveret i inferensen af hver token, hvilket fremhæver en skiftning mod mere effektiv og fokuseret AI-behandling.

En af de vigtigste højdepunkter ved Mixtral er dets evne til at håndtere en omfattende kontekst på 32.000 tokens, hvilket giver god plads til at håndtere komplekse opgaver. Modellens multilingvale egenskaber omfatter robust støtte til engelsk, fransk, italiensk, tysk og spansk, hvilket tilgodeser en global udviklerfællesskab.

For-træningen af Mixtral indebærer data fra det åbne web, med en samtidig træningsmetode for både eksperter og routere. Denne metode sikrer, at modellen ikke kun er omfattende i sin parameterplads, men også fint afstemt til nuancerne i de omfattende data, den er blevet udsat for.

Mixtral 8x7B opnår en imponerende score

Mixtral 8x7B opnår en imponerende score

Mixtral 8x7B overgår LLaMA 2 70B og rivaliserer GPT-3.5, især bemærkelsesværdigt i MBPP-opgaven med en succesrate på 60,7%, hvilket er betydeligt højere end dens modparter. Selv i den strenge MT-Bench, der er tilpasset instruktionsfølgende modeller, opnår Mixtral 8x7B en imponerende score, næsten på niveau med GPT-3.5

Forståelse af Mixture of Experts (MoE) rammen

Mixture of Experts (MoE) modellen, der har fået fornyet opmærksomhed på grund af dens integration i state-of-the-art sprogmodeller som Mistral AI’s MoE 8x7B, har faktisk rødder i grundlæggende koncepter, der daterer tilbage flere år. Lad os gensende oprindelsen af denne idé gennem grundlæggende forskningsartikler.

Konceptet MoE

Mixture of Experts (MoE) repræsenterer en paradigmeskift i neural netværksarkitektur. I modsætning til traditionelle modeller, der bruger et enkelt, homogent netværk til at behandle alle typer data, adopterer MoE en mere specialiseret og modulær tilgang. Den består af multiple “ekspert”-netværk, hver designet til at håndtere specifikke typer data eller opgaver, overvåget af et “gating network”, der dynamisk dirigerer inputdata til den mest passende ekspert.

En Mixture of Experts (MoE) lag indlejret i en rekurrerende sprogmodel

En Mixture of Experts (MoE) lag indlejret i en rekurrerende sprogmodel (Kilde)

 

Ovenstående billede præsenterer en højniveauoversigt over en MoE-lag indlejret i en sprogmodel. I dens kerne består MoE-laget af multiple feed-forward undernetværk, betegnet “eksperter”, hver med potentialet til at specialisere sig i at behandle forskellige aspekter af data. Et gating network, fremhævet i diagrammet, bestemmer, hvilken kombination af disse eksperter der er involveret for en given input. Denne betingede aktivering tillader netværket at øge sin kapacitet uden en tilsvarende stigning i computermæssig krav.

Funktionalitet af MoE-laget

I praksis evaluerer gating networket input (betegnet som G(x) i diagrammet) og vælger en sparsom mængde eksperter til at behandle det. Denne valg er moduleret af gating networkets output, der effektivt bestemmer “stemmen” eller bidraget fra hver ekspert til den endelige output. For eksempel, som vist i diagrammet, kan kun to eksperter være valgt til at beregne outputtet for hver specifik token, hvilket gør processen effektiv ved at koncentrere computermæssige ressourcer, hvor de er mest nødvendige.

 

Transformer Encoder med MoE-lag (Kilde)

Den anden illustration ovenfor kontrasterer en traditionel Transformer-encoder med en, der er suppleret med en MoE-lag. Transformer-arkitekturen, der er vidt kendt for sin effektivitet i sprogrelaterede opgaver, består traditionelt af selv-attention og feed-forward lag, stablet i sekvens. Indføringen af MoE-lag erstatter nogle af disse feed-forward lag, hvilket muliggør, at modellen kan skaleres med hensyn til kapacitet mere effektivt.

I den supplerede model er MoE-lagene shardet over multiple enheder, hvilket viser en model-parallelt tilgang. Dette er kritisk, når der skal skaleres til meget store modeller, da det tillader en distribution af den computermæssige belastning og hukommelseskrav over en cluster af enheder, såsom GPU’er eller TPU’er. Denne sharding er afgørende for at træne og implementere modeller med milliarder af parametre effektivt, som det er dokumenteret ved træningen af modeller med hundredvis af milliarder til over en billion parametre på store computorklynger.

Den sparsomme MoE-tilgang med instruktionsafstemning på LLM

Artiklen med titlen “Sparse Mixture-of-Experts (MoE) for Scalable Language Modeling” diskuterer en innovativ tilgang til at forbedre store sprogmodeller (LLM) ved at integrere Mixture of Experts-arkitekturen med instruktionsafstemningsmetoder.

Den fremhæver en almindelig udfordring, hvor MoE-modeller underpræsterer i forhold til tætte modeller af samme computermæssige kapacitet, når de afstemmes til bestemte opgaver på grund af diskrepancer mellem generel for-træning og opgave-specifik afstemning.

Instruktionsafstemning er en træningsmetode, hvor modellerne afstemmes til bedre at følge naturlige sproginstruktioner, hvilket effektivt forbedrer deres opgavepræstation. Artiklen foreslår, at MoE-modeller viser en bemærkelsesværdig forbedring, når de kombineres med instruktionsafstemning, mere end deres tætte modparte. Denne metode afstemmer modellens for-trænede repræsentationer til at følge instruktioner mere effektivt, hvilket fører til betydelige præstationsforbedringer.

Forskerne gennemførte studier over tre eksperimentelle opsætninger, der afslørede, at MoE-modeller initialt underpræsterer i direkte opgave-specifik afstemning. Men når instruktionsafstemning anvendes, overgår MoE-modellerne, især når de yderligere suppleres med opgave-specifik afstemning. Dette antyder, at instruktionsafstemning er et afgørende skridt for MoE-modeller til at overgå tætte modeller på downstream-opgaver.

Effekten af instruktionsafstemning på MOE

Effekten af instruktionsafstemning på MOE

Den introducerer også FLAN-MOE32B, en model, der demonstrerer den succesfulde anvendelse af disse koncepter. Bemærkelsesværdigt overgår den FLAN-PALM62B, en tæt model, på benchmark-opgaver, mens den kun bruger en tredjedel af de computermæssige ressourcer. Dette viser potentialet for sparsomme MoE-modeller kombineret med instruktionsafstemning til at sætte nye standarder for LLM-effektivitet og præstation.

Implementering af Mixture of Experts i virkelige scenarier

Denne modells fleksibilitet gør den ideel til en række anvendelser:

  • Naturlig sprogbehandling (NLP): MoE-modeller kan håndtere nuancerne og kompleksiteten af menneskesprog mere effektivt, hvilket gør dem ideelle til avancerede NLP-opgaver.
  • Billede- og videobehandling: I opgaver, der kræver højopløst behandling, kan MoE håndtere forskellige aspekter af billeder eller video-frames, hvilket forbedrer både kvalitet og behandlingshastighed.
  • Tilpassede AI-løsninger: Virksomheder og forskere kan tilpasse MoE-modeller til specifikke opgaver, hvilket fører til mere målrettede og effektive AI-løsninger.

MoE-modeller tilbyder mange fordele, men de præsenterer også unikke udfordringer:

  • Kompleksitet i træning og afstemning: Den distribuerede natur af MoE-modeller kan komplicere træningsprocessen, hvilket kræver omhyggelig afstemning og balancering af eksperter og gating network.
  • Ressourcehåndtering: Effektivt at håndtere computermæssige ressourcer på tværs af multiple eksperter er afgørende for at maksimere fordelene ved MoE-modeller.

Inklusion af MoE-lag i neurale netværk, især i sprogmodeller, tilbyder en vej til at skalerer modeller til størrelser, der tidligere var umulige på grund af computermæssige begrænsninger. Den betingede beregning, der aktiveres af MoE-lag, tillader en mere effektiv distribution af computermæssige ressourcer, hvilket gør det muligt at træne større, mere kapable modeller. Da vi fortsætter med at kræve mere af vores AI-systemer, er arkitekturer som MoE-udstyret Transformer sandsynligvis på vej til at blive standarden for håndtering af komplekse, storstile opgaver på tværs af forskellige domæner.

Jeg har brugt de sidste fem år på at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har ført mig til at bidrage til over 50 forskellige software-ingeniørprojekter, med en særlig fokus på AI/ML. Min fortsatte nysgerrighed har også ført mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.