AI-modeller og plattformer

Ai2 lanserer Olmo-Core 3, åpen treningsstabel for trillion‑parameter‑MoE‑er

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Allen Institute for AI ga ut Olmo-core 3 1. oktober 2026, en oppgradering av deres rammeverk for utvikling av store språkmodeller bygget rundt et redesignet åpent blandings‑av‑eksperter‑treningssystem som Ai2 sier de har benchmarket med mer enn én trillion total parametere.

Ai2 sier at Olmo-core 3 er designet for å skalere MoE‑trening inn i trillion‑parameter‑området samtidig som den bevarer beregningseffektiviteten, og beskriver den som et av kjernesystemene bak neste generasjon av Olmo. Utgivelsen ledsages av en teknisk rapport, en interaktiv demonstrasjon og åpen kode.

MoE‑modeller kan inneholde mange flere parametere uten at hver input må bruke alle, men den komplette modellen må fortsatt lagres over GPU‑minne og oppdateres under trening, og ruting av input til riktige eksperter på tvers av en klynge skaper egne kommunikasjons‑ og koordineringskostnader. Ai2 sier at disse kostnadene kan erodere mye av beregningsfordelen etter hvert som MoE‑er vokser, og at Olmo-core 3 er bygget for å tette dette hullet. I en Ai2‑benchmark vokste ekspertpoolen fra 8 til 128 samtidig som fire eksperter per token fortsatt ble valgt, noe som holdt aktive parametere omtrent faste på rundt 3,2 milliarder mens total parameterkapasitet økte fra 4,6 milliarder til 47 milliarder, med en treningsgjennomstrømning som falt med mindre enn 5 %.

Fra FSDP til en DDP‑basert treningsstabel

Ai2s tidligere MoE‑implementering i Olmo-core brukte fullt shardet dataparllelisme, konfigurert til å samle inn og resharde modellvektene for hver liten batch med treningsdata. Olmo-core 3 går over til et system basert på distribuert dataparllelisme som holder eksperter resident på GPU‑er og ruter relevant data til dem, og unngår gjentatt vektinnsamling. I en foreløpig test på åtte NVIDIA B300‑GPU‑er rapporterer Ai2 at en 47‑milliarder‑parameter‑MoE behandlet 52 000 token per sekund per GPU med den nye stabelen, sammenlignet med 19 400 med den tidligere implementeringen, noe Ai2 beskriver som omtrent 2,7 ganger gjennomstrømning.

Ai2s arbeid med sparsomme modeller går tilbake til OlmoE, som brukte en MoE‑arkitektur med 64 rutede eksperter, mens Olmo 3 benyttet en tett arkitektur der nesten hele modellen var aktiv for hver token. Olmo-core 3 utvider rammeverket med et treningssystem designet for mye større MoE‑modeller. Ai2 bemerket at NVIDIAs Megatron-Core er et etablert alternativ for trening av store MoE‑er, og beskrev Olmo-core 3 som å bringe en integrert MoE‑treningsstabel inn i rammeverket bak Olmo.

Parallellisme, presisjon og minneteknikker

Tre teknikker bestemmer hvordan modellen og dens treningsstatus deles over maskinvare: ekspertparallellisme sprer eksperter over GPU‑er, pipeline‑parallellisme deler modellens lag over grupper av GPU‑er, og en distribuert optimizer sprer optimizer‑status over GPU‑er i stedet for å lagre en full kopi på hver GPU. Olmo-core 3 reduserer også kostnaden ved å rute data til riktige eksperter: radvis ekspertparallellisme plasserer rutet data direkte i ekspertens inndatabuffer, GPU‑resident ruting holder rutemetadata på GPU‑ene slik at CPU‑en kan køe arbeid uten å vente på at det kopieres tilbake, og gruppert GEMM kombinerer mange små ekspertberegninger slik at GPU‑er kan utføre dem mer effektivt. Den tekniske rapporten beskriver et NVSHMEM‑basert radvis ekspertparallellisme‑design som skriver hver token direkte inn i ekspertens buffer, med enhets‑planlagt gruppert matrise‑multiplikasjon som gjør ekspertparallellisme fullstendig synkroniseringsfri.

Olmo-core 3 støtter MXFP8, et lavere presisjons‑tallformat. I en kontrollert benchmark på fire NVIDIA B300‑GPU‑er med arbeid distribuert jevnt over eksperter, rapporterer Ai2 at treningsgjennomstrømningen var omtrent 21 % høyere enn med BF16‑referansen, mens maksimal aktiv minne falt fra 103 GiB til 95 GiB, med mesteparten av gevinsten fra feed‑forward‑beregning og flytting av data mellom eksperter. Rapporten legger til at topologi‑agnostiske sjekkpunkter registrerer globale FP32‑tensorer uavhengig av den parallelle oppsettet, slik at en kjøring kan gjenopptas på en annen topologi, og at i den kontrollerte sammenligningen fjernet aktiverings‑rekalkulering nesten to tredjedeler av aktiveringsminnet og reduserte toppminnet med omtrent en fjerdedel til en kostnad på omtrent en femtedel av gjennomstrømningen.

Trillion‑parameter‑benchmarker og angitte grenser

Ai2 sier at de benchmarket Olmo-core 3 over et spekter av konfigurasjoner på NVIDIA B300‑GPU‑er, inkludert en 1,2‑trillion‑parameter‑modell med 58,36 milliarder parametere aktive per token på tvers av 512 GPU‑er, hvor den høyeste observerte gjennomstrømningen var 858 TFLOP/s per GPU. Ai2 oppgir at disse testene brukte tilfeldig ruting for å måle systemytelse snarere enn kvaliteten på en trent modell. Den tekniske rapporten lister målte operasjonspunkter fra en 12,9‑milliarder‑parameter‑modell på 16 GPU‑er opp til 1,2‑trillion‑parameter‑modellen på 512, og angir at hovedtallene er systemreferanser målt under tilfeldig ruting, ikke en kontrollert skaleringskurve eller et tids‑til‑kvalitet‑krav.

Ai2 eksperimenterte også med DeepEP v2, en alternativ backend for kommunikasjon mellom eksperter på tvers av GPU-er, og nådde en konfigurasjon med 2,38 billioner totale parametere. Ai2 beskriver dette resultatet som en kortkapasitets‑test som demonstrerer skalaen Olmo-core 3 kan nå, snarere enn vedvarende treningsytelse. Den tekniske rapporten, med tittelen “Supercharging Olmo-core for Efficient and Scalable MoE Training”, er datert oktober 2026; forfatterne er fra Allen Institute for AI og University of Washington, med Tianhua Tao oppført som hovedforfatter og primær utvikler.

Dokumenterte funn og planer for neste generasjons Olmo

Rapporten dokumenterer et feilmønster som Ai2 kaller token gerrymandering, hvor en poengsum ment å fremme balansert ruting kunne forbedres selv om den faktiske arbeidsbelastningen ble mindre balansert. Andre dokumenterte funn inkluderer: å senke ekspertenes læringsrater fordi de behandler færre token, forbedret ikke resultatene i den testede modellfamilien; GPU‑beregninger tok ulik tid når de behandlede verdiene endret seg, selv med samme matrisedimensjoner; og overlappende kommunikasjon og beregning på separate GPU‑strømmer gjorde ikke alltid treningen raskere, og i noen tester senket det den samlede kjøretiden. Rapporten beskriver også tilnærminger som ble testet men ikke tatt i bruk, inkludert CPU‑avlasting av aktivasjoner som vertslinken ikke kunne håndtere, samt to overlappsskjemaer som konkurrerte med ekspertberegning om GPU‑ressurser.

Ai2 sa at deres neste generasjons Olmo vil bruke en MoE‑arkitektur, og at de sikter mot at den skal bli deres mest kapable Olmo hittil, trent på deres største datasett og med deres lengste kontekstvindu. Organisasjonen uttalte at Olmo-core 3 er fullstendig åpen, slik at forskere og utviklere kan bruke den til å trene sine egne MoE‑er, tilpasse den til forskjellig maskinvare, og eksperimentere med ruting, parallellisering og andre deler av systemet. Olmo-core GitHub-repositorium beskriver prosjektet som PyTorch‑byggeklosser for OLMo‑økosystemet, har en Apache‑2.0‑lisens, og kan installeres fra kildekode eller fra PyPI som ai2-olmo-core.

Jonas Reeve er en AI-generert analytiker hos Unite.AI, med fokus på kognitiv AI, kunstig generell intelligens (AGI) og de teoretiske grunnlagene for maskinintelligens. Arbeidet hans utforsker hvordan læring, resonnering, hukommelse og abstraksjon oppstår i både biologiske og kunstige systemer, og trekker forbindelser mellom moderne AI-arkitekturer og langvarige spørsmål innen kognitiv vitenskap og sinnets filosofi.

Med en konseptuell og reflekterende tilnærming undersøker Jonas rammeverk som resonneringsmodeller, agentbaserte systemer, emergent kognisjon og justeringsteori, med mål om å klargjøre hva fremgang mot AGI faktisk betyr – og hva det ikke betyr. I stedet for å jage tidslinjer eller hype, legger han vekt på første prinsipper, konseptuell grundighet og begrensningene i dagens modeller.

Artikler skrevet av Jonas Reeve er AI-genererte og gjennomgås av Unite.AI sitt redaksjonsteam for å sikre nøyaktighet, klarhet og ansvarlig diskusjon av avanserte AI-konsepter.