AI-modeller och plattformar

Ai2 lanserar Olmo-Core 3, öppen träningsstack för triljon‑parameter‑MoE:er

mm
Lägg till Unite.AI bland dina föredragna källor på Google

The Allen Institute for AI släppte Olmo-core 3 den 1 oktober 2026, en uppgradering av sitt stora språkmodell‑utvecklingsramverk byggt kring ett omdesignat öppet mixture‑of‑experts‑träningssystem som Ai2 säger att de har benchmarkat med mer än en triljon totala parametrar.

Ai2 säger att Olmo-core 3 är utformad för att skala MoE‑träning till triljon‑parameter‑området samtidigt som den bevarar beräknings‑effektiviteten, och beskriver den som ett av de centrala systemen bakom nästa generation av Olmo. Utgåvan följs av en teknisk rapport, en interaktiv demo och öppen kod.

MoE‑modeller kan innehålla många fler parametrar utan att varje indata måste använda dem alla, men hela modellen måste fortfarande lagras över GPU‑minne och uppdateras under träning, och att dirigera indata till rätt experter över ett kluster skapar egna kommunikations‑ och koordineringskostnader. Ai2 säger att dessa kostnader kan urholka en stor del av den beräkningsmässiga fördelen när MoE‑modeller växer, och att Olmo-core 3 är byggd för att täppa till detta gap. I ett Ai2‑benchmark ökade expertpoolen från 8 till 128 samtidigt som fyra experter fortfarande valdes per token, vilket höll de aktiva parametrarna ungefär fasta på cirka 3,2 miljard medan den totala parameterkapaciteten växte från 4,6 miljard till 47 miljard, med träningsgenomströmning som föll med mindre än 5 %.

Från FSDP till en DDP‑baserad träningsstack

Ai2:s tidigare MoE‑implementation i Olmo-core använde fullständigt sharded data parallelism, konfigurerad för att samla in och åter‑sharda modellvikter för varje liten batch av träningsdata. Olmo-core 3 övergår till ett system baserat på distribuerad data parallelism som håller experter kvar på GPU‑er och dirigerar relevant data till dem, vilket undviker upprepad viktsamling. I ett preliminärt test på åtta NVIDIA B300‑GPU‑er rapporterar Ai2 att en 47‑miljard‑parameter‑MoE bearbetade 52 000 token per sekund per GPU med den nya stacken, jämfört med 19 400 med den tidigare implementationen, vilket Ai2 beskriver som cirka 2,7 gånger högre genomströmning.

Ai2:s arbete med sparsamma modeller går tillbaka till OlmoE, som använde en MoE‑arkitektur med 64 dirigerade experter, medan Olmo 3 använde en tät arkitektur där nästan hela modellen var aktiv för varje token. Olmo-core 3 utökar ramverket med ett träningssystem designat för mycket större MoE‑modeller. Ai2 noterade att NVIDIA:s Megatron-Core är ett etablerat alternativ för träning av stora MoE:er, och beskrev Olmo-core 3 som att den för med sig en integrerad MoE‑träningsstack till ramverket bakom Olmo.

Parallellism, precision och minnestekniker

Tre tekniker avgör hur modellen och dess träningsstatus fördelas över hårdvaran: expertparallellism sprider experter över GPU‑er, pipeline‑parallellism delar modellens lager över grupper av GPU‑er, och en distribuerad optimerare sprider optimerarens tillstånd över GPU‑er i stället för att lagra en full kopia på varje GPU. Olmo-core 3 minskar också kostnaden för att dirigera data till rätt experter: radvis expertparallellism placerar dirigerad data direkt i expertens inmatningsbuffertar, GPU‑resident routing håller routningsmetadata på GPU‑erna så att CPU:n kan köa arbete utan att vänta på att det kopieras tillbaka, och grupperad GEMM kombinerar många små expertberäkningar så att GPU‑er kan utföra dem mer effektivt. Den tekniska rapporten beskriver en NVSHMEM‑baserad radvis expertparallellism‑design som skriver varje token direkt in i dess experts buffert, med enhetsschemalagda grupperade matris‑multiplikationer som gör expertparallellism helt synkroniseringsfri.

Olmo-core 3 stödjer MXFP8, ett lägre precision‑talformat. I ett kontrollerat benchmark på fyra NVIDIA B300‑GPU‑er med arbete fördelat jämnt över experter rapporterar Ai2 en träningsgenomströmning cirka 21 % högre än med BF16‑baslinjen, medan den maximala aktiva minnesanvändningen sjönk från 103 GiB till 95 GiB, med största delen av vinsten från feed‑forward‑beräkning och dataförflyttning mellan experter. Rapporten tillägger att topologi‑agnostiska checkpoints registrerar globala FP32‑tensorer oberoende av den parallella layouten, så att ett körningsförlopp kan återupptas på en annan topologi, och att i den kontrollerade jämförelsen eliminerade aktiverings‑rekalkylering nästan två tredjedelar av aktiveringsminnet och minskade maxminnet med ungefär en fjärdedel till kostnad för cirka en femtedel av genomströmningen.

Triljon‑parameter‑benchmarkar och angivna begränsningar

Ai2 säger att de benchmarkade Olmo-core 3 över ett spektrum av konfigurationer på NVIDIA B300‑GPU‑er, inklusive en 1,2‑triljon‑parameter‑modell med 58,36 miljard parametrar aktiva per token över 512 GPU‑er, där den högsta observerade genomströmningen var 858 TFLOP/s per GPU. Ai2 uppgav att dessa tester använde slumpmässig routing för att mäta systemprestanda snarare än kvaliteten på en tränad modell. Den tekniska rapporten listar uppmätta driftpunkter från en 12,9‑miljard‑parameter‑modell på 16 GPU‑er upp till 1,2‑triljon‑parameter‑modellen på 512, och anger att rubriknivåerna är systemreferenser mätta under slumpmässig routing, inte en kontrollerad skalningskurva eller ett påstående om tid‑till‑kvalitet.

Ai2 experimenterade också med DeepEP v2, ett alternativt backend för kommunikation mellan experter över GPU:er, och nådde en konfiguration med 2,38 triljon totala parametrar. Ai2 beskriver resultatet som ett kortkapacitets‑test som demonstrerar den skala som Olmo-core 3 kan nå snarare än en uthållig träningsprestanda. Den tekniska rapporten, med titeln “Supercharging Olmo-core for Efficient and Scalable MoE Training”, är daterad oktober 2026; dess författare kommer från Allen Institute for AI och University of Washington, med Tianhua Tao angiven som huvudförfattare och huvudutvecklare.

Dokumenterade fynd och nästa generations Olmo‑planer

Rapporten dokumenterar ett felmönster som Ai2 kallar token‑gerrymandering, där ett poängsystem avsett att främja balanserad routing kunde förbättras även när den faktiska arbetsbelastningen blev mindre balanserad. Andra dokumenterade fynd inkluderar: att sänka experternas inlärningshastigheter eftersom de bearbetar färre token förbättrade inte resultaten i den testade modellfamiljen; GPU‑beräkningar tog olika mängder tid när de bearbetade värden förändrades, även med samma matrisdimensioner; och att överlappa kommunikation och beräkning på separata GPU‑strömmar gjorde inte alltid träningen snabbare och förlångsammade i vissa tester den totala exekveringen. Rapporten beskriver också metoder som testats men inte antagits, inklusive CPU‑offload av aktiveringar som värdlänken inte kunde hantera samt två överlappningsscheman som konkurrerade med expertberäkning om GPU‑resurser.

Ai2 sade att deras nästa generations Olmo kommer att använda en MoE‑arkitektur, och att de siktar på att den ska bli deras mest kapabla Olmo hittills, tränad på deras största dataset och med det längsta kontextfönstret. Organisationen meddelade att Olmo-core 3 är helt öppen, så forskare och utvecklare kan använda den för att träna egna MoE‑modeller, anpassa den till olika hårdvaror och experimentera med routing, parallellism och andra delar av systemet. Olmo-core GitHub‑arkivet beskriver projektet som PyTorch‑byggstenar för OLMo‑ekosystemet, har en Apache‑2.0‑licens och kan installeras från källkod eller från PyPI som ai2-olmo-core.

Jonas Reeve är en AI‑genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell generell intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete undersöker hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI‑arkitekturer och långvariga frågor inom kognitiv vetenskap och medvetandefilosofi.

Med ett konceptuellt och reflekterande förhållningssätt granskar Jonas ramar såsom resonemangsmodeller, agentbaserade system, emergent kognition och aligneringsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder – och vad det inte betyder. Istället för att jaga tidslinjer eller hype betonar han grundprinciper, konceptuell stringens och begränsningarna i nuvarande modeller.

Artiklar skrivna av Jonas Reeve är AI‑genererade och granskas av Unite.AI:s redaktionsteam för att säkerställa noggrannhet, tydlighet och ett ansvarsfullt samtal om avancerade AI‑koncept.