AI-modellen en platforms

Ai2 brengt Olmo-Core 3 uit, open trainingsstack voor triljoen‑parameter MoE’s

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Het Allen Institute for AI bracht Olmo-core 3 uit op 1 oktober 2026, een upgrade van zijn raamwerk voor de ontwikkeling van grote taalmodellen dat is opgebouwd rond een opnieuw ontworpen open mixture‑of‑experts‑trainingssysteem dat Ai2 zegt dat het heeft gebenchmarkt op meer dan één triljoen totale parameters.

Ai2 zegt dat Olmo-core 3 is ontworpen om MoE‑training op te schalen naar het triljoen‑parameterbereik terwijl de computationele efficiëntie behouden blijft, en beschrijft het als een van de kernsystemen achter de volgende generatie Olmo. De uitgave wordt vergezeld door een technisch rapport, een interactieve demo en open code.

MoE‑modellen kunnen veel meer parameters bevatten zonder dat elke invoer al deze parameters moet gebruiken, maar het volledige model moet nog steeds over GPU‑geheugen worden opgeslagen en tijdens het trainen worden bijgewerkt, en het routeren van invoer naar de juiste experts over een cluster brengt eigen communicatie‑ en coördinatiekosten met zich mee. Ai2 zegt dat die kosten een groot deel van het computationele voordeel kunnen wegvagen naarmate MoE’s groeien, en dat Olmo-core 3 is gebouwd om die kloof te dichten. In één Ai2‑benchmark groeide de expert‑pool van 8 naar 128 terwijl nog steeds vier experts per token werden geselecteerd, waardoor het aantal actieve parameters ongeveer constant bleef op ongeveer 3,2 miljard, terwijl de totale parametercapaciteit steeg van 4,6 miljard naar 47 miljard, met een trainingsdoorvoersnelheid die met minder dan 5 % daalde.

Van FSDP naar een DDP‑gebaseerde trainingsstack

De eerdere MoE‑implementatie van Ai2 in Olmo-core maakte gebruik van volledig geshard data‑parallelisme, geconfigureerd om modelgewichten te verzamelen en opnieuw te sharden voor elke kleine batch trainingsdata. Olmo-core 3 schakelt over naar een systeem gebaseerd op distributed data parallelism dat experts resident houdt op GPU’s en de relevante data naar hen routeert, waardoor herhaaldelijk verzamelen van gewichten wordt vermeden. In een voorlopige test op acht NVIDIA B300‑GPU’s meldt Ai2 dat een 47‑miljard‑parameter MoE 52.000 tokens per seconde per GPU verwerkte met de nieuwe stack, vergeleken met 19.400 met de eerdere implementatie, wat Ai2 beschrijft als ongeveer 2,7 keer de doorvoer.

Het werk van Ai2 aan sparse modellen gaat terug tot OlmoE, dat een MoE‑architectuur met 64 gerouteerde experts gebruikte, terwijl Olmo 3 een dichte architectuur hanteerde waarin bijna het hele model actief was voor elke token. Olmo-core 3 breidt het raamwerk uit met een trainingssysteem dat is ontworpen voor veel grotere MoE‑modellen. Ai2 merkte op dat NVIDIA’s Megatron-Core een gevestigde optie is voor het trainen van grote MoE’s, en beschreef Olmo-core 3 als het toevoegen van een geïntegreerde MoE‑trainingsstack aan het raamwerk achter Olmo.

Parallelisme, precisie en geheugentechnieken

Drie technieken bepalen hoe het model en zijn trainingsstatus over hardware worden verdeeld: expert‑parallelisme verspreidt experts over GPU’s, pipeline‑parallelisme splitst de lagen van het model over groepen GPU’s, en een distributed optimizer verspreidt de optimizer‑status over GPU’s in plaats van op elke GPU een volledige kopie op te slaan. Olmo-core 3 verlaagt bovendien de kosten van het routeren van data naar de juiste experts: rowwise expert parallelism plaatst gerouteerde data direct in de invoer‑buffers van experts, GPU‑resident routing houdt router‑metadata op de GPU’s zodat de CPU werk kan inplannen zonder te wachten op terugkopiëren, en grouped GEMM combineert vele kleine expert‑berekeningen zodat GPU’s ze efficiënter kunnen uitvoeren. Het technisch rapport beschrijft een op NVSHMEM gebaseerd rowwise expert parallelism‑ontwerp dat elke token direct in de buffer van zijn expert schrijft, met device‑scheduled grouped matrix‑multiplicaties die expert‑parallelisme volledig synchronisatie‑vrij maken.

Olmo-core 3 ondersteunt MXFP8, een getalformaat met lagere precisie. In een gecontroleerde benchmark op vier NVIDIA B300‑GPU’s met werk gelijkmatig verdeeld over experts meldt Ai2 een trainingsdoorvoer ongeveer 21 % hoger dan met de BF16‑baseline, terwijl het piek‑actieve geheugen daalde van 103 GiB naar 95 GiB, waarbij het grootste deel van de winst voortkwam uit feed‑forward‑computatie en het verplaatsen van data tussen experts. Het rapport voegt toe dat topologie‑agnostische checkpoints globale FP32‑tensors vastleggen onafhankelijk van de parallelle indeling, zodat een run kan worden hervat op een andere topologie, en dat in de gecontroleerde vergelijking activatie‑recomputatie bijna twee derde van het activatie‑geheugen verwijderde en het piek‑geheugen met ongeveer een kwart verminderde tegen een kostenpost van ongeveer een vijfde van de doorvoer.

Triljoen‑parameter benchmarks en opgegeven limieten

Ai2 zegt dat het Olmo-core 3 heeft gebenchmerkt over een reeks configuraties op NVIDIA B300‑GPU’s, inclusief een 1,2‑triljoen‑parameter model met 58,36 miljard parameters actief per token over 512 GPU’s, waarbij de hoogste waargenomen doorvoer 858 TFLOP/s per GPU bedroeg. Ai2 stelt dat deze tests willekeurige routing gebruikten om de systeemprestaties te meten in plaats van de kwaliteit van een getraind model. Het technisch rapport somt gemeten operationele punten op van een 12,9‑miljard‑parameter model op 16 GPU’s tot het 1,2‑triljoen‑parameter model op 512, en vermeldt dat de kopcijfers systeemreferenties zijn gemeten onder willekeurige routing, niet een gecontroleerde schaalcurve of een tijd‑tot‑kwaliteit‑claim.

Ai2 experimenteerde ook met DeepEP v2, een alternatief backend voor communicatie tussen experts over GPU’s, waarbij een configuratie met in totaal 2,38 biljoen parameters werd bereikt. Ai2 beschrijft dat resultaat als een test met beperkte capaciteit die de schaal aantoont die Olmo-core 3 kan bereiken, in plaats van een langdurige trainingsprestatie. Het technische rapport, getiteld “Supercharging Olmo-core for Efficient and Scalable MoE Training,” is gedateerd oktober 2026; de auteurs komen van het Allen Institute for AI en de University of Washington, met Tianhua Tao vermeld als hoofd auteur en primaire ontwikkelaar.

Gedocumenteerde bevindingen en plannen voor de volgende generatie Olmo

Het rapport documenteert een faalpatroon dat Ai2 token gerrymandering noemt, waarbij een score die bedoeld is om gebalanceerde routing aan te moedigen, kan verbeteren terwijl de werkelijke belasting minder gebalanceerd werd. Andere gedocumenteerde bevindingen omvatten: het verlagen van de leersnelheden van experts omdat ze minder tokens verwerken, verbeterde de resultaten niet in de geteste modelfamilie; GPU-berekeningen namen verschillende tijden in beslag wanneer de verwerkte waarden veranderden, zelfs bij dezelfde matrixdimensies; en het overlappen van communicatie en berekening op afzonderlijke GPU‑streams maakte de training niet altijd sneller en vertraagde in sommige tests de end‑to‑end‑uitvoering. Het rapport beschrijft ook benaderingen die getest maar niet geïmplementeerd zijn, waaronder het CPU-offload van activaties die de host‑link niet kon dragen en twee overlap‑schema’s die concurreerden met de expert‑computatie voor GPU‑bronnen.

Ai2 zei dat zijn volgende‑generatie Olmo een MoE‑architectuur zal gebruiken, en dat het erop gericht is de meest capabele Olmo tot nu toe te worden, getraind op de grootste dataset en met het langste contextvenster. De organisatie stelde dat Olmo-core 3 volledig open is, zodat onderzoekers en ontwikkelaars het kunnen gebruiken om hun eigen MoE’s te trainen, het aan te passen aan verschillende hardware, en te experimenteren met routing, parallelisme en andere onderdelen van het systeem. De Olmo-core GitHub-repository beschrijft het project als PyTorch‑bouwblokken voor het OLMo‑ecosysteem, heeft een Apache-2.0‑licentie, en kan geïnstalleerd worden vanuit de broncode of via PyPI als ai2-olmo-core.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machinale intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en legt verbanden tussen moderne AI-architecturen en eeuwenoude vragen in de cognitieve wetenschap en de filosofie van de geest.

Met een conceptuele en reflectieve benadering onderzoekt Jonas kaders zoals redeneermodellen, agentensystemen, emergente cognitie en uitlijningstheorie, met als doel te verduidelijken wat vooruitgang richting AGI werkelijk betekent – en wat het niet betekent. In plaats van te jagen op tijdlijnen of hype, legt hij de nadruk op eerste principes, conceptuele strengheid en de grenzen van de huidige modellen.

Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door de redactie van Unite.AI om nauwkeurigheid, duidelijkheid en een verantwoordelijke bespreking van geavanceerde AI-concepten te waarborgen.