AI-modellen en platforms
Mistral AI’s Laatste Mixture of Experts (MoE) 8x7B Model
dat een Parijse open-source model startup is, heeft de normen uitgedaagd door zijn laatste grote taalmodel (LLM) te publiceren, MoE 8x7B, via een eenvoudige torrent-link. Dit staat in contrast met de traditionele aanpak van Google met hun Gemini-release, wat gesprekken en opwinding binnen de AI-gemeenschap heeft veroorzaakt.
Mistral AI’s benadering van releases is altijd onconventioneel geweest. Vaak zonder de gebruikelijke begeleidende papers, blogs of persberichten, is hun strategie uniek effectief gebleken in het trekken van de aandacht van de AI-gemeenschap.
Onlangs bereikte het bedrijf een opmerkelijke $2 miljard waardering na een financieringsronde geleid door Andreessen Horowitz. Deze financieringsronde was historisch, met een record van $118 miljoen seed-geld, de grootste in de Europese geschiedenis. Buiten de financieringssuccessen om, is Mistral AI actief betrokken bij discussies over de EU AI-wet, waarbij zij pleiten voor minder regulering in open-source AI.
Waarom MoE 8x7B aandacht trekt
Omschreven als een “geschaalde GPT-4”, gebruikt Mixtral 8x7B een Mixture of Experts (MoE) framework met acht experts. Elke expert heeft 111B parameters, gekoppeld aan 55B gedeelde aandachtparameters, om een totaal van 166B parameters per model te geven. Deze ontwerpkeuze is significant, omdat het alleen twee experts toelaat om betrokken te zijn bij de inferentie van elk token, wat een verschuiving naar meer efficiënte en gefocuste AI-verwerking aangeeft.
Een van de belangrijkste hoogtepunten van Mixtral is zijn vermogen om een uitgebreide context van 32.000 tokens te beheren, wat een ruime mogelijkheid biedt voor het afhandelen van complexe taken. De multilinguale mogelijkheden van het model omvatten robuuste ondersteuning voor Engels, Frans, Italiaans, Duits en Spaans, waarmee een wereldwijd ontwikkelaarsgemeenschap wordt bediend.
De pre-training van Mixtral bestaat uit gegevens afkomstig van het open web, met een gelijktijdige trainingsaanpak voor zowel experts als routers. Deze methode zorgt ervoor dat het model niet alleen uitgebreid is in zijn parameters, maar ook fijn afgestemd is op de nuances van de gegevens waaraan het is blootgesteld.

Mixtral 8x7B behaalt een indrukwekkende score
Mixtral 8x7B overtreft LLaMA 2 70B en rivaliseert met GPT-3.5, vooral opvallend in de MBPP-taak met een succespercentage van 60,7%, aanzienlijk hoger dan zijn tegenhangers. Zelfs in de strenge MT-Bench, die is afgestemd op instructievolgende modellen, behaalt Mixtral 8x7B een indrukwekkende score, die bijna overeenkomt met GPT-3.5
Het begrijpen van de Mixture of Experts (MoE) Framework
Het Mixture of Experts (MoE) model, dat onlangs aandacht heeft getrokken vanwege de integratie in state-of-the-art taalmodellen zoals Mistral AI’s MoE 8x7B, is eigenlijk geworteld in fundamentelere concepten die enkele jaren teruggaan. Laten we de oorsprong van dit idee bekijken via seminale onderzoeksartikelen.
Het Concept van MoE
Mixture of Experts (MoE) vertegenwoordigt een paradigma-shift in neurale netwerkarchitectuur. In tegenstelling tot traditionele modellen die één homogeen netwerk gebruiken om alle soorten gegevens te verwerken, past MoE een meer gespecialiseerde en modulaire aanpak toe. Het bestaat uit meerdere ‘expert’-netwerken, elk ontworpen om specifieke soorten gegevens of taken te verwerken, onder toezicht van een ‘gating’-netwerk dat dynamisch invoergegevens naar de meest geschikte expert leidt.

Een Mixture of Experts (MoE) laag ingebed in een recurrent taalmodel (Bron)
De bovenstaande afbeelding toont een hoogoverzicht van een MoE-laag ingebed in een taalmodel. In wezen bestaat de MoE-laag uit meerdere feed-forward sub-netwerken, genaamd ‘experts’, elk met het potentieel om te specialiseren in het verwerken van verschillende aspecten van de gegevens. Een gating-netwerk, gemarkeerd in de diagram, bepaalt welke combinatie van deze experts wordt geactiveerd voor een bepaalde invoer. Deze conditionele activatie stelt het netwerk in staat om zijn capaciteit aanzienlijk te vergroten zonder een overeenkomstige toename in computationele vraag.
Functionaliteit van de MoE-laag
In de praktijk evalueert het gating-netwerk de invoer (aangegeven als G(x) in de diagram) en selecteert een schaarse set experts om deze te verwerken. Deze selectie wordt gemoduleerd door de uitvoer van het gating-netwerk, wat effectief bepaalt de ‘stem’ of bijdrage van elke expert aan de uiteindelijke uitvoer. Bijvoorbeeld, zoals getoond in de diagram, kunnen alleen twee experts worden gekozen voor het berekenen van de uitvoer voor elk specifiek invoertoken, waardoor het proces efficiënt wordt door computationele middelen te concentreren waar ze het meest nodig zijn.

Transformer Encoder met MoE-lagen (Bron)
De tweede illustratie toont een traditionele Transformer-encoder met een MoE-laag. De Transformer-architectuur, breed erkend om zijn effectiviteit in taalgerelateerde taken, bestaat traditioneel uit self-attention en feed-forward lagen gestapeld in sequentie. De introductie van MoE-lagen vervangt sommige van deze feed-forward lagen, waardoor het model kan schalen met betrekking tot capaciteit meer effectief.
In het aangepaste model zijn de MoE-lagen verdeeld over meerdere apparaten, waarbij een model-parallelle aanpak wordt getoond. Dit is kritiek bij het schalen naar zeer grote modellen, omdat het de computationele last en geheugeneisen toelaat te worden verdeeld over een cluster van apparaten, zoals GPU’s of TPU’s. Deze verdeling is essentieel voor het trainen en implementeren van modellen met miljarden parameters op een efficiënte manier, zoals aangetoond door het trainen van modellen met honderden miljarden tot meer dan een triljoen parameters op grote compute-clusters.
De Sparse MoE-aanpak met instructie-afstemming op LLM
Het artikel getiteld “Sparse Mixture-of-Experts (MoE) voor schaalbare taalmodellering” bespreekt een innovatieve aanpak om Large Language Models (LLM’s) te verbeteren door de Mixture of Experts-architectuur te integreren met instructie-afstemmingstechnieken.
Het benadrukt een veelvoorkomende uitdaging waarbij MoE-modellen onderpresteren in vergelijking met dichte modellen van gelijke computationele capaciteit wanneer ze worden afgestemd voor specifieke taken vanwege discrepanties tussen algemene pre-training en taakspecifieke afstemming.
Instructie-afstemming is een trainingsmethodologie waarbij modellen worden verfijnd om natuurlijke taalinstructies beter te volgen, wat effectief hun taakprestaties verbetert. Het artikel suggereert dat MoE-modellen een opmerkelijke verbetering vertonen wanneer ze worden gecombineerd met instructie-afstemming, meer dan hun dichte tegenhangers. Deze techniek brengt de pre-getrainde representaties van het model in overeenstemming met instructies, wat leidt tot aanzienlijke prestatieverbeteringen.
De onderzoekers voerden studies uit in drie experimentele opstellingen, waaruit bleek dat MoE-modellen aanvankelijk onderpresteren bij directe taakspecifieke afstemming. Echter, wanneer instructie-afstemming wordt toegepast, presteren MoE-modellen uitstekend, vooral wanneer ze worden aangevuld met taakspecifieke afstemming. Dit suggereert dat instructie-afstemming een cruciale stap is voor MoE-modellen om dichte modellen te overtreffen in downstream-taken.
Het introduceert ook FLAN-MOE32B, een model dat de succesvolle toepassing van deze concepten demonstreert. Opvallend presteert het beter dan FLAN-PALM62B, een dicht model, op benchmarktaken, terwijl het slechts één derde van de computationele middelen gebruikt. Dit toont het potentieel van sparse MoE-modellen in combinatie met instructie-afstemming om nieuwe standaarden te zetten voor LLM-efficiëntie en prestaties.
Implementatie van Mixture of Experts in reële scenario’s
De veelzijdigheid van MoE-modellen maakt ze ideaal voor een reeks toepassingen:
- Natuurlijke Taalverwerking (NLP): MoE-modellen kunnen de nuances en complexiteiten van menselijke taal effectiever verwerken, waardoor ze ideaal zijn voor geavanceerde NLP-taken.
- Beeld- en videoverwerking: In taken die hoge resolutievere verwerking vereisen, kan MoE verschillende aspecten van beelden of videoframes beheren, waardoor zowel kwaliteit als verwerkingsnelheid worden verbeterd.
- Aanpasbare AI-oplossingen: Bedrijven en onderzoekers kunnen MoE-modellen aanpassen aan specifieke taken, wat leidt tot meer gerichte en effectieve AI-oplossingen.
Uitdagingen en overwegingen
Terwijl MoE-modellen talrijke voordelen bieden, stellen ze ook unieke uitdagingen:
- Complexiteit in training en afstemming: De gedistribueerde aard van MoE-modellen kan het trainingsproces compliceren, waarbij zorgvuldige balans en afstemming van experts en het gating-netwerk vereist zijn.
- Middelenbeheer: Efficiënt beheer van computationele middelen over meerdere experts is cruciaal voor het maximaliseren van de voordelen van MoE-modellen.
Het integreren van MoE-lagen in neurale netwerken, vooral in het domein van taalmodellen, biedt een weg naar het schalen van modellen naar groottes die eerder onmogelijk waren vanwege computationele beperkingen. De conditionele berekening die mogelijk wordt gemaakt door MoE-lagen, stelt het netwerk in staat om zijn capaciteit aanzienlijk te vergroten zonder een overeenkomstige toename in computationele vraag. Naarmate we meer van onze AI-systemen eisen, zijn architecturen zoals de MoE-uitgeruste Transformer waarschijnlijk de standaard voor het afhandelen van complexe, grootschalige taken in verschillende domeinen.













