AI-basisprincipes

De opkomst van Mixture-of-Experts: Hoe sparse AI-modellen de toekomst van machine learning vormgeven

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Mixture-of-Experts (MoE)-modellen zijn de manier waarop we AI schalen aan het revolutioneren. Door alleen een subset van de componenten van een model te activeren op een bepaald moment, bieden MoE’s een noviteit in het beheer van de trade-off tussen modelgrootte en computationele efficiëntie. In tegenstelling tot traditionele dichte modellen die alle parameters voor elke invoer gebruiken, bereiken MoE’s enorm hoge parameteraantallen terwijl ze de kosten voor inferentie en training laag houden. Deze doorbraak heeft een golf van onderzoek en ontwikkeling veroorzaakt, waardoor zowel tech-reuzen als startups zwaar hebben geïnvesteerd in MoE-gebaseerde architectuur.

Hoe Mixture-of-Experts-modellen werken

In hun kern bestaan MoE-modellen uit meerdere gespecialiseerde subnetwerken die “experts” worden genoemd, die worden beheerd door een gating-mechanisme dat beslist welke experts elke invoer moeten verwerken. Bijvoorbeeld, een zin die in een taalmodel wordt ingevoerd, kan alleen twee van de acht experts activeren, waardoor de computationele workload aanzienlijk wordt vermindert.

Dit concept werd in de mainstream gebracht met Google’s Switch Transformer en GLaM-modellen (GOOGL ), waar experts traditionele feed-forward lagen in Transformers vervingen. Switch Transformer routeert tokens naar één expert per laag, terwijl GLaM top-2 routing gebruikt voor verbeterde prestaties. Deze ontwerpen hebben aangetoond dat MoE’s dense modellen zoals GPT-3 kunnen evenaren of overtreffen terwijl ze aanzienlijk minder energie en compute gebruiken.

De sleutelinnovatie ligt in conditionele berekening. In plaats van het hele model te activeren, activeren MoE’s alleen de meest relevante delen, wat betekent dat een model met honderden miljarden of zelfs triljoenen parameters kan draaien met de efficiëntie van een model dat vele ordes van grootte kleiner is. Dit stelt onderzoekers in staat om de capaciteit te schalen zonder lineaire toename in computationele kosten, een prestatie die onhaalbaar is met traditionele schaalmethoden.

Praktische toepassingen van MoE

MoE-modellen hebben al hun stempel gedrukt op verschillende domeinen. Google’s GLaM en Switch Transformer hebben state-of-the-art resultaten behaald in taalmodellering met lagere trainings- en inferentiekosten. Microsoft’s (MSFT ) Z-Code MoE is operationeel in hun Translator-tool, die meer dan 100 talen verwerkt met betere nauwkeurigheid en efficiëntie dan eerdere modellen. Dit zijn geen onderzoeksprojecten – ze zijn live diensten.

In computer visie heeft Google’s V-MoE-architectuur de classificatie-accuuratie op benchmarks zoals ImageNet verbeterd, en het LIMoE-model heeft sterke prestaties getoond in multimodale taken die zowel afbeeldingen als tekst omvatten. De mogelijkheid van experts om te specialiseren – sommige verwerken tekst, andere afbeeldingen – voegt een nieuwe laag van capaciteit toe aan AI-systemen.

Recommender-systemen en multi-task learning-platforms hebben ook profijt gehad van MoE’s. Bijvoorbeeld, YouTube’s aanbevelingsengine heeft een MoE-achtige architectuur gebruikt om doelen zoals kijktijd en klik-door-snelheid efficiënter te verwerken. Door verschillende experts toe te wijzen aan verschillende taken of gebruikersgedrag, helpen MoE’s bij het bouwen van robuustere personalisatie-engines.

Voordelen en uitdagingen

Het belangrijkste voordeel van MoE’s is efficiëntie. Ze stellen grote modellen in staat om getraind en geïmplementeerd te worden met aanzienlijk minder compute. Bijvoorbeeld, Mistral AI’s Mixtral 8×7B-model heeft 47B totale parameters, maar activeert alleen 12,9B per token, waardoor het de kostenefficiëntie van een 13B-model heeft terwijl het concurreert met modellen zoals GPT-3.5 in kwaliteit.

MoE’s bevorderen ook specialisatie. Omdat verschillende experts verschillende patronen kunnen leren, wordt het overall model beter in het verwerken van diverse invoer. Dit is vooral nuttig in multilingual, multi-domain of multimodale taken waarin een one-size-fits-all dense model onderpresteert.

MoE’s komen echter met engineering-uitdagingen. Het trainen ervan vereist zorgvuldige balans om ervoor te zorgen dat alle experts effectief worden gebruikt. Geheugenoverhead is een andere zorg – hoewel alleen een fractie van de parameters per inferentie actief is, moeten alle parameters in het geheugen worden geladen. Efficiënte distributie van computation over GPU’s of TPU’s is niet triviaal en heeft geleid tot de ontwikkeling van gespecialiseerde frameworks zoals Microsoft’s DeepSpeed en Google’s GShard.

Ondanks deze obstakels zijn de prestatie- en kostenvoordelen substantieel genoeg dat MoE’s nu worden beschouwd als een kritisch onderdeel van grote-schaal AI-ontwerp. Naarmate meer tools en infrastructuur volwassen worden, worden deze uitdagingen geleidelijk overwonnen.

Hoe MoE zich verhoudt tot andere schaalmethoden

Traditionele dichte schaling verhoogt de modelgrootte en compute evenredig. MoE’s doorbreken deze lineariteit door de totale parameters te verhogen zonder de compute per invoer te verhogen. Dit stelt modellen met triljoenen parameters in staat om getraind te worden op dezelfde hardware die eerder beperkt was tot tientallen miljarden.

In vergelijking met model-ensembling, dat ook specialisatie introduceert maar meerdere volledige forward passes vereist, zijn MoE’s veel efficiënter. In plaats van meerdere modellen parallel uit te voeren, voeren MoE’s slechts één model uit – maar met het voordeel van meerdere expert-pad’s.

MoE’s complementeren ook strategieën zoals het schalen van trainingsgegevens (bijv. de Chinchilla-methode). Terwijl Chinchilla benadrukt om meer gegevens te gebruiken met kleinere modellen, breiden MoE’s de modelcapaciteit uit terwijl de compute stabiel blijft, waardoor ze ideaal zijn voor gevallen waarin compute de bottleneck is.

Ten slotte, terwijl technieken zoals pruning en quantization modellen na training verkleinen, verhogen MoE’s de modelcapaciteit tijdens training. Ze zijn geen vervanging voor compressie, maar een orthogonaal instrument voor efficiënte groei.

De bedrijven die de MoE-revolutie leiden

Tech-reuzen

Google pionierde veel van de huidige MoE-onderzoek. Hun Switch Transformer en GLaM-modellen schaalden tot 1,6T en 1,2T parameters respectievelijk. GLaM evenaarde de prestaties van GPT-3 terwijl het slechts een derde van de energie gebruikte. Google heeft MoE’s ook toegepast op visie (V-MoE) en multimodale taken (LIMoE), in overeenstemming met hun bredere Pathways-visie voor universele AI-modellen.

Microsoft heeft MoE geïntegreerd in productie via hun Z-Code-model in Microsoft Translator. Het heeft ook DeepSpeed-MoE ontwikkeld, waardoor snelle training en lage-latentie-inferentie voor triljoen-parametermodellen mogelijk wordt. Hun bijdragen omvatten routing-algoritmen en de Tutel-bibliotheek voor efficiënte MoE-berekening.

Meta heeft MoE’s onderzocht in grote-schaal taalmodellen en aanbevelingssystemen. Hun 1,1T MoE-model heeft aangetoond dat het kan concurreren met dichte modellen in kwaliteit terwijl het 4 keer minder compute gebruikt. Hoewel LLaMA-modellen dicht zijn, informeert Meta’s onderzoek naar MoE de bredere gemeenschap.

Amazon (AMZN ) ondersteunt MoE’s via hun SageMaker-platform en interne inspanningen. Het heeft de training van Mistral’s Mixtral-model gefaciliteerd en zou MoE’s gebruiken in diensten zoals Alexa AI. AWS-documentatie promoot actief MoE’s voor grote-schaal modeltraining.

Huawei en BAAI in China hebben ook recordbrekende MoE-modellen ontwikkeld, zoals PanGu-Σ (1.085T params). Dit toont het potentieel van MoE’s in taal- en multimodale taken aan en benadrukt hun wereldwijde aantrekkingskracht.

Startups en uitdagers

Mistral AI is het boegbeeld van MoE-innovatie in open source. Hun Mixtral 8×7B- en 8×22B-modellen hebben aangetoond dat MoE’s dense modellen zoals LLaMA-2 70B kunnen overtreffen terwijl ze slechts een fractie van de kosten hebben. Met meer dan €600M aan financiering zet Mistral grote inzet op sparse architectuur.

xAI, opgericht door Elon Musk, onderzoekt naar verluidt MoE’s in hun Grok-model. Hoewel details beperkt zijn, bieden MoE’s een manier voor startups zoals xAI om te concurreren met grotere spelers zonder massive compute nodig te hebben.

Databricks, via hun MosaicML-acquisitie, heeft DBRX uitgebracht, een open MoE-model ontworpen voor efficiëntie. Het biedt ook infrastructuur en recepten voor MoE-training, waardoor de drempel voor adoptie lager wordt.

Andere spelers zoals Hugging Face hebben MoE-ondersteuning geïntegreerd in hun bibliotheken, waardoor het voor ontwikkelaars gemakkelijker wordt om op deze modellen te bouwen. Zelfs als ze geen MoE’s zelf bouwen, zijn platforms die ze mogelijk maken cruciaal voor het ecosysteem.

Conclusie

Mixture-of-Experts-modellen zijn niet alleen een trend – ze vertegenwoordigen een fundamentele verschuiving in de manier waarop AI-systemen worden gebouwd en geschaald. Door alleen een deel van een netwerk te activeren, bieden MoE’s de kracht van grote modellen zonder hun prohibitieve kosten. Naarmate software-infrastructuur op gang komt en routing-algoritmen verbeteren, zijn MoE’s klaar om de standaardarchitectuur te worden voor multi-domain, multilingual en multimodale AI.

Of u nu onderzoeker, ingenieur of investeerder bent, MoE’s bieden een glimp van een toekomst waarin AI krachtiger, efficiënter en aanpasbaarder is dan ooit tevoren.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.