Grunderna i AI

Mixture-of-Experts Uppgång: Hur glesa AI-modeller formar framtiden för maskinlärning

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Mixture-of-Experts (MoE) modeller revolutionerar sättet vi skalar AI. Genom att aktivera endast en delmängd av en modells komponenter vid varje given tidpunkt erbjuder MoE en ny approach för att hantera avvägningen mellan modellstorlek och beräknings-effektivitet. Till skillnad från traditionella täta modeller som använder alla parametrar för varje indata uppnår MoE enorma parameterantal samtidigt som de håller inferens- och utbildningskostnader hanterbara. Denna genombrott har lett till en våg av forskning och utveckling, vilket har fått både tech-jättar och startups att investera kraftigt i MoE-baserade arkitekturer.

Hur Mixture-of-Experts modeller fungerar

I sin kärna består MoE-modeller av flera specialiserade subnätverk kallade “experter”, som övervakas av en styrningsmekanism som bestämmer vilka experter som ska hantera varje indata. Till exempel kan en mening som skickas in i en språkmodell endast engagera två av åtta experter, vilket drastiskt minskar den beräkningsmässiga arbetsbelastningen.

Denna koncept fördes in i mainstream med Googles Switch Transformer och GLaM-modeller, där experter ersatte traditionella feed-forward-lager i Transformers. Switch Transformer, till exempel, dirigerar token till en enda expert per lager, medan GLaM använder top-2-dirigering för förbättrad prestanda. Dessa design visade att MoE kunde matcha eller överträffa täta modeller som GPT-3 medan de använde betydligt mindre energi och beräkning.

Nyckelinnovationen ligger i villkorsbaserad beräkning. Istället för att starta hela modellen aktiverar MoE endast de mest relevanta delarna, vilket innebär att en modell med hundratals miljarder eller till och med biljoner parametrar kan köras med samma effektivitet som en som är flera storleksordningar mindre. Detta möjliggör för forskare att skala kapacitet utan linjära ökningar i beräkning, en bedrift som inte kan uppnås med traditionella skalningsmetoder.

Verkliga tillämpningar av MoE

MoE-modeller har redan gjort sin mark i flera domäner. Googles GLaM och Switch Transformer visade state-of-the-art-resultat i språkmodellering med lägre utbildnings- och inferenskostnader. Microsofts Z-Code MoE är operativ i dess Översättare-verktyg, som hanterar över 100 språk med bättre noggrannhet och effektivitet än tidigare modeller. Dessa är inte bara forskningsprojekt – de driver live-tjänster.

I datorseende har Googles V-MoE-arkitektur förbättrat klassificeringsnoggrannheten på benchmark som ImageNet, och LIMoE-modellen har visat stark prestanda i multimodala uppgifter som involverar både bilder och text. Förmågan hos experter att specialisera sig – vissa hanterar text, andra bilder – lägger till en ny nivå av förmåga till AI-system.

Rekommendationssystem och multi-uppgifts-plattformar har också gynnats av MoE. Till exempel har YouTubes rekommendationsmotor använt en MoE-liknande arkitektur för att hantera mål som visningstid och klickfrekvens mer effektivt. Genom att tilldela olika experter till olika uppgifter eller användarbetenden hjälper MoE till att bygga mer robusta personanpassningssystem.

Fördelar och utmaningar

Den främsta fördelen med MoE är effektivitet. De tillåter enorma modeller att tränas och distribueras med betydligt mindre beräkning. Till exempel har Mistral AI:s Mixtral 8×7B-modell 47B totala parametrar men aktiverar endast 12,9B per token, vilket ger den kostnadseffektiviteten hos en 13B-modell medan den tävlar med modeller som GPT-3.5 i kvalitet.

MoE främjar också specialisering. Eftersom olika experter kan lära sig olika mönster blir den övergripande modellen bättre på att hantera olika indata. Detta är särskilt användbart i multilingvala, multi-domäna eller multimodala uppgifter där en tätpackad modell kan underpresteras.

Men MoE har också ingenjörsutmaningar. Utbildning av dem kräver noggrann balansering för att säkerställa att alla experter används effektivt. Minnesöverbelastning är ett annat problem – även om endast en bråkdel av parametrarna är aktiva per inferens, måste alla laddas in i minnet. Att distribuera beräkning över GPU:er eller TPU:er är inte trivialt och har lett till utvecklingen av specialiserade ramverk som Microsofts DeepSpeed och Googles GShard.

Trots dessa hinder är prestanda- och kostnadsfördelarna tillräckligt stora för att MoE nu ses som en kritisk komponent i stor skala AI-design. När fler verktyg och infrastruktur mognar övervinner dessa utmaningar gradvis.

Hur MoE jämför med andra skalningsmetoder

Traditionell tätpackad skalning ökar modellstorlek och beräkning proportionellt. MoE bryter denna linjäritet genom att öka totala parametrar utan att öka beräkning per indata. Detta möjliggör modeller med biljoner parametrar att tränas på samma hårdvara som tidigare var begränsad till tiotals miljarder.

I jämförelse med modell-ensembling, som också introducerar specialisering men kräver flera fulla framåtpass, är MoE betydligt mer effektiv. Istället för att köra flera modeller parallellt kör MoE bara en – men med fördelen av flera expertvägar.

MoE kompletterar också strategier som skalning av utbildningsdata (t.ex. Chinchilla-metoden). Medan Chinchilla betonar användning av mer data med mindre modeller utökar MoE modellkapacitet medan beräkning hålls stabil, vilket gör dem idealiska för fall där beräkning är flaskhalsen.

Slutligen, medan tekniker som beskärning och kvantifiering minskar modeller efter utbildning, ökar MoE modellkapacitet under utbildning. De är inte en ersättning för komprimering, utan ett ortogonalt verktyg för effektiv tillväxt.

Företagen som leder MoE-revolutionen

Tech-jättar

Google (GOOGL ) banade väg för mycket av dagens MoE-forskning. Deras Switch Transformer och GLaM-modeller skalade till 1,6T och 1,2T parametrar. GLaM matchade GPT-3-prestanda medan den använde bara en tredjedel av energin. Google har också tillämpat MoE på vision (V-MoE) och multimodala uppgifter (LIMoE), i linje med deras breda Pathways-vision för universella AI-modeller.

Microsoft (MSFT ) har integrerat MoE i produktion genom dess Z-Code-modell i Microsoft Translator. Det har också utvecklat DeepSpeed-MoE, som möjliggör snabb utbildning och låg-latens-inferens för modeller med biljoner parametrar. Deras bidrag inkluderar dirigering-algoritmer och Tutel-biblioteket för effektiv MoE-beräkning.

Meta har utforskat MoE i storskaliga språkmodeller och rekommendationssystem. Deras 1,1T MoE-modell visade att den kunde matcha täta modellkvalitet med 4 gånger mindre beräkning. Även om LLaMA-modellerna är täta, informerar Metas forskning om MoE den breda gemenskapen.

Amazon (AMZN ) stöder MoE genom sin SageMaker-plattform och interna insatser. De underlättade utbildningen av Mistral AI:s Mixtral-modell och ryktas använda MoE i tjänster som Alexa AI. AWS-dokumentation främjar aktivt MoE för storskalig modellutbildning.

Huawei och BAAI i Kina har också utvecklat rekordbrytande MoE-modeller som PanGu-Σ (1,085T parametrar). Detta visar MoE:s potential i språk och multimodala uppgifter och betonar dess globala attraktionskraft.

Startups och utmanare

Mistral AI är den främsta innovationen inom MoE i open source. Deras Mixtral 8×7B och 8×22B-modeller har visat att MoE kan överträffa täta modeller som LLaMA-2 70B medan de körs med en bråkdel av kostnaden. Med över 600 miljoner euro i finansiering satsar Mistral stort på glesa arkitekturer.

xAI, grundat av Elon Musk, undersöker MoE i sin Grok-modell. Även om detaljer är begränsade, erbjuder MoE ett sätt för startups som xAI att konkurrera med större spelare utan att behöva massiv beräkning.

Databricks, via sin MosaicML-förvärv, har släppt DBRX, en öppen MoE-modell designad för effektivitet. De tillhandahåller också infrastruktur och recept för MoE-utbildning, vilket sänker tröskeln för antagande.

Andra aktörer som Hugging Face har integrerat MoE-stöd i sina bibliotek, vilket gör det lättare för utvecklare att bygga på dessa modeller. Även om de inte bygger MoE själva, är plattformar som möjliggör dem avgörande för ekosystemet.

Slutsats

Mixture-of-Experts-modeller är inte bara en trend – de representerar en grundläggande förändring i hur AI-system byggs och sklas. Genom att selektivt aktivera endast delar av ett nätverk erbjuder MoE kraften hos enorma modeller utan deras förbjudande kostnad. När mjukvaruinfrastruktur och dirigering-algoritmer förbättras är MoE redo att bli den standardarkitektur för multi-domän, multilingvala och multimodala AI.

Om du är en forskare, ingenjör eller investerare, erbjuder MoE en glimt av en framtid där AI är mer kraftfull, effektiv och anpassningsbar än någonsin tidigare.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.