AI-modeller og platforme

Ai2 udgiver Olmo-Core 3, åben træningsstack for trillion-parameter MoE’er

mm
Føj Unite.AI til dine foretrukne kilder på Google

Allen Institute for AI udgav Olmo-core 3 den 1. oktober 2026, en opgradering af deres rammeværk til udvikling af store sprogmodeller, bygget omkring et redesignet åbent blandings-af-eksperter-træningssystem, som Ai2 siger, at de har benchmarket til mere end en trillion samlede parametre.

Ai2 siger, at Olmo-core 3 er designet til at skalere MoE‑træning ind i trillion‑parameter‑området, samtidig med at den bevarer beregningseffektiviteten, og beskriver den som et af kernesystemerne bag næste generation af Olmo. Udgivelsen ledsages af en teknisk rapport, en interaktiv demo og åben kode.

MoE‑modeller kan indeholde mange flere parametre uden at kræve, at hver input bruger dem alle, men den fulde model skal stadig gemmes på tværs af GPU-hukommelse og opdateres under træning, og routing af input til de rette eksperter på tværs af en klynge medfører sine egne kommunikations‑ og koordineringsomkostninger. Ai2 siger, at disse omkostninger kan udhule meget af den beregningsmæssige fordel, efterhånden som MoE’er vokser, og at Olmo-core 3 er bygget til at lukke dette hul. I et Ai2‑benchmark voksede ekspertpuljen fra 8 til 128, mens der stadig blev valgt fire eksperter pr. token, hvilket holdt de aktive parametre omtrent faste på omkring 3,2 milliarder, mens den samlede parameterkapacitet steg fra 4,6 milliarder til 47 milliarder, med træningsgennemstrømning faldende med mindre end 5 %.

Fra FSDP til en DDP‑baseret træningsstack

Ai2’s tidigere MoE‑implementering i Olmo-core brugte fuldt opdelt data‑parallelisme, konfigureret til at samle og gen‑opdele modelvægt for hver lille batch af træningsdata. Olmo-core 3 skifter til et system baseret på distribueret data‑parallelisme, som holder eksperter resident på GPU’er og dirigerer de relevante data til dem, hvilket undgår gentagen vægtindsamling. I en foreløbig test på otte NVIDIA B300‑GPU’er rapporterer Ai2, at en 47‑milliard‑parameter MoE behandlede 52.000 token per sekund per GPU med den nye stack, sammenlignet med 19.400 ved brug af den tidligere implementering, hvilket Ai2 beskriver som cirka 2,7 gange højere gennemstrømning.

Ai2’s arbejde med sparsomme modeller går tilbage til OlmoE, som brugte en MoE‑arkitektur med 64 dirigerede eksperter, mens Olmo 3 anvendte en tæt arkitektur, hvor næsten hele modellen var aktiv for hver token. Olmo-core 3 udvider rammeværket med et træningssystem designet til meget større MoE‑modeller. Ai2 bemærkede, at NVIDIAs Megatron-Core er en veletableret mulighed for træning af store MoE’er, og beskrev Olmo-core 3 som at bringe en integreret MoE‑træningsstack til rammeværket bag Olmo.

Parallelisme, præcision og hukommelsesteknikker

Tre teknikker bestemmer, hvordan modellen og dens træningstilstand deles på tværs af hardware: ekspert‑parallelisme spreder eksperter over GPU’er, pipeline‑parallelisme opdeler modellens lag på grupper af GPU’er, og en distribueret optimizer spreder optimizer‑tilstand over GPU’er i stedet for at gemme en fuld kopi på hver GPU. Olmo-core 3 reducerer også omkostningerne ved at dirigere data til de rette eksperter: række‑vis ekspert‑parallelisme placerer dirigerede data direkte i ekspertens input‑buffer, GPU‑resident routing holder routing‑metadata på GPU‑erne, så CPU’en kan sætte arbejde i kø uden at vente på, at det kopieres tilbage, og grupperet GEMM kombinerer mange små ekspertberegninger, så GPU’er kan udføre dem mere effektivt. Den tekniske rapport beskriver et NVSHMEM‑baseret række‑vis ekspert‑parallelismedesign, der skriver hver token direkte ind i dens eksperts buffer, med enhed‑planlagte grupperede matrix‑multiplikationer, der gør ekspert‑parallelisme fuldstændig synkroniseringsfri.

Olmo-core 3 understøtter MXFP8, et lavpræcisions‑talformat. I et kontrolleret benchmark på fire NVIDIA B300‑GPU’er med arbejdet fordelt jævnt på eksperterne, rapporterer Ai2, at træningsgennemstrømningen er omkring 21 % højere end med BF16‑baseline, mens den maksimale aktive hukommelse faldt fra 103 GiB til 95 GiB, hvor størstedelen af gevinsten kom fra feed‑forward‑beregning og flytning af data mellem eksperter. Rapporten tilføjer, at topologi‑agnostiske checkpoints registrerer globale FP32‑tensors uafhængigt af den parallelle layout, så en kørsel kan genoptages på en anden topologi, og at i den kontrollerede sammenligning fjernede aktiverings‑rekalkulation næsten to‑tredjedele af aktiveringshukommelsen og reducerede den maksimale hukommelse med omkring en fjerdedel til en pris af cirka en femtedel af gennemstrømningen.

Trillion‑parameter‑benchmark og angivne grænser

Ai2 siger, at de benchmarkede Olmo-core 3 på tværs af en række konfigurationer på NVIDIA B300‑GPU’er, herunder en 1,2‑trillion‑parameter‑model med 58,36 milliarder parametre aktive pr. token på 512 GPU’er, hvor den højeste observerede gennemstrømning var 858 TFLOP/s per GPU. Ai2 oplyser, at disse tests brugte tilfældig routing til at måle systemets ydeevne snarere end kvaliteten af en trænet model. Den tekniske rapport opregner målte drifts‑punkter fra en 12,9‑milliard‑parameter‑model på 16 GPU’er op til 1,2‑trillion‑parameter‑modellen på 512, og angiver, at hovedtallene er systemreferencer målt under tilfældig routing, ikke en kontrolleret skaleringskurve eller et tid‑til‑kvalitet‑påstand.

Ai2 eksperimenterede også med DeepEP v2, en alternativ backend til kommunikation mellem eksperter på tværs af GPU’er, og nåede en konfiguration med 2,38 billioner samlede parametre. Ai2 beskriver resultatet som en kortvarig kapacitetstest, der demonstrerer den skala, Olmo-core 3 kan nå, snarere end vedvarende træningspræstation. Den tekniske rapport, med titlen “Supercharging Olmo-core for Efficient and Scalable MoE Training,” er dateret oktober 2026; forfatterne er fra Allen Institute for AI og University of Washington, med Tianhua Tao angivet som hovedforfatter og primær udvikler.

Dokumenterede fund og planer for næste generation af Olmo

Rapporten dokumenterer et fejlmønster, som Ai2 kalder token‑gerrymandering, hvor en score, der er beregnet til at fremme balanceret routing, kunne forbedres, selvom den faktiske arbejdsbyrde blev mindre balanceret. Andre dokumenterede fund inkluderer: at sænke eksperternes læringsrater, fordi de behandler færre tokens, ikke forbedrede resultaterne i den testede modelfamilie; GPU‑beregninger tog forskellig tid, når de behandlede værdier ændrede sig, selv med de samme matrixdimensioner; og overlappende kommunikation og beregning på separate GPU‑streams gjorde ikke altid træningen hurtigere og kunne i nogle tests sænke den samlede eksekveringstid. Rapporten beskriver også tilgange, der blev testet men ikke vedtaget, herunder CPU‑offload af aktiveringer, som værtlinket ikke kunne håndtere, samt to overlappende ordninger, der konkurrerede med ekspertberegning om GPU‑ressourcer.

Ai2 sagde, at deres næste generation af Olmo vil bruge en MoE‑arkitektur, og at de sigter mod, at den skal blive deres mest kapable Olmo nogensinde, trænet på deres største datasæt og med deres længste kontekstvindue. Organisationen oplyste, at Olmo-core 3 er fuldt åben, så forskere og udviklere kan bruge den til at træne deres egne MoE’er, tilpasse den til forskellig hardware og eksperimentere med routing, parallelisme og andre dele af systemet. Olmo-core-kodelageret på GitHub beskriver projektet som PyTorch‑byggeklodser til OLMo‑økosystemet, har en Apache‑2.0‑licens og kan installeres fra kildekode eller fra PyPI som ai2-olmo-core.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, med fokus på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde undersøger, hvordan læring, ræsonnement, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og trækker forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål inden for kognitiv videnskab og sindets filosofi.

Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som ræsonneringsmodeller, agentbaserede systemer, emergent kognition og justeringsteori, med det formål at tydeliggøre, hvad fremskridt mod AGI faktisk betyder – og hvad det ikke gør. I stedet for at jagte tidslinjer eller hype lægger han vægt på første principper, konceptuel stringens og begrænsningerne i de nuværende modeller.

Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AI’s redaktionsteam for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncept.