AI-mallit ja alustat
Ai2 julkaisee Olmo-Core 3:n, avoimen koulutuspinon triljoniparametrisia MoE-malleja varten

Allen Institute for AI julkaisi Olmo-core 3 1. lokakuuta 2026, päivityksen sen suurten kielimallien kehitysalustaan, joka perustuu uudistettuun avoimeen mixture-of-experts -koulutusjärjestelmään, jonka Ai2 on kertonut testanneen yli triljoonaa kokonaisparametria.
Ai2 kertoi, että Olmo-core 3 on suunniteltu skaalaamaan MoE-koulutusta triljoniparametriseen alueeseen säilyttäen laskennallisen tehokkuuden, ja kuvaili sitä yhtenä Olmon seuraavan sukupolven ydinjärjestelmistä. Julkaisuun sisältyy tekninen raportti, interaktiivinen demo ja avoin koodi.
MoE-mallit voivat sisältää paljon enemmän parametreja ilman, että jokainen syöte tarvitsee käyttää niitä kaikkia, mutta koko malli on silti tallennettava GPU-muistiin ja päivitettävä koulutuksen aikana, ja syötteiden reitittäminen oikeille asiantuntijoille klusterissa aiheuttaa omat viestintä- ja koordinointikustannuksensa. Ai2 totesi, että nämä kustannukset voivat syödä suuren osan laskennallisesta edusta MoE-mallien kasvaessa, ja että Olmo-core 3 on rakennettu sulkemaan tämä aukko. Yhdessä Ai2:n suorituskykytestissä asiantuntijapooli kasvoi kahdeksasta sataan kaksikymmentäkahdeksaan, samalla valiten neljä asiantuntijaa per token, pitäen aktiiviset parametrit suunnilleen vakiona noin 3,2 miljardissa, kun taas kokonaisparametrikapasiteetti kasvoi 4,6 miljardista 47 miljardiin, ja koulutuksen läpivirta laski alle 5 %.
FSDP:stä DDP-pohjaiseen koulutuspinnoon
Ai2:n aikaisempi MoE-toteutus Olmo-core:ssa käytti täysin shardattua dataparallelismia, joka keräsi ja uudelleenshardasi mallin painot jokaiselle pienelle koulutusdatabatchille. Olmo-core 3 siirtyy järjestelmään, joka perustuu hajautettuun dataparallelismiin ja pitää asiantuntijat GPU:ssa sekä reitittää niille relevantit tiedot, välttäen toistuvaa painojen keräämistä. Esittelevässä testissä kahdeksalla NVIDIA B300 -GPU:lla Ai2 raportoi, että 47‑miljardin parametrin MoE käsitteli 52 000 tokenia sekunnissa per GPU uudella pinolla, verrattuna 19 400 tokeniin sekunnissa aikaisemmalla toteutuksella, mikä Ai2:n mukaan on noin 2,7‑kertainen läpivirta.
Ai2:n työ harvojen mallien parissa juontaa juurensa OlmoE:hen, joka käytti MoE-arkkitehtuuria 64 reititetyllä asiantuntijalla, kun taas Olmo 3 käytti tiheää arkkitehtuuria, jossa lähes koko malli oli aktiivinen jokaiselle tokenille. Olmo-core 3 laajentaa kehystä koulutusjärjestelmällä, joka on suunniteltu paljon suuremmille MoE-malleille. Ai2 totesi, että NVIDIA:n Megatron-Core on vakiintunut vaihtoehto suurten MoE-mallien kouluttamiseen, ja kuvaili Olmo-core 3:ta tuovan integroidun MoE-koulutuspinon Olmon taustalla olevaan kehykseen.
Rinnakkaisuus, tarkkuus ja muistitekniikat
Kolme tekniikkaa määrittävät, miten malli ja sen koulutustila jaetaan laitteiston kesken: asiantuntijaparallelismi levittää asiantuntijat GPU:ille, putkistoparallelismi jakaa mallin kerrokset GPU-ryhmien kesken, ja hajautettu optimointialgoritmi levittää optimointitilan GPU:ille sen sijaan, että jokaiselle GPU:lle tallennettaisiin täysi kopio. Olmo-core 3 myös vähentää datan reitittämisen kustannuksia oikeille asiantuntijoille: rivi‑kohtainen asiantuntijaparallelismi sijoittaa reititetyn datan suoraan asiantuntijan syötepuskuriin, GPU‑asennossa oleva reititys pitää reititystiedot GPU:illa, jotta CPU voi jonottaa työtä odottamatta sen takaisinkopiointia, ja ryhmitelty GEMM yhdistää monia pieniä asiantuntijalaskelmia, jotta GPU:t voivat suorittaa ne tehokkaammin. Tekninen raportti kuvaa NVSHMEM-pohjaista rivi‑kohtaista asiantuntijaparallelismisuunnitelmaa, jossa jokainen token kirjoitetaan suoraan sen asiantuntijan puskuriin, laitteistolle ajoitetuilla ryhmitellyillä matriisikertolaskuilla, jotka tekevät asiantuntijaparallelismista täysin synkronointivapaata.
Olmo-core 3 tukee MXFP8‑muotoista, alempaa tarkkuutta omaavaa numeroformaattia. Hallitussa suorituskykytestissä neljällä NVIDIA B300 -GPU:lla, jossa työ jaettiin tasaisesti asiantuntijoiden kesken, Ai2 raportoi, että koulutuksen läpivirta oli noin 21 % korkeampi kuin BF16‑vertailutasolla, samalla kun huippuaktiivinen muisti laski 103 GiB:stä 95 GiB:iin, ja suurin osa voitosta johtui syötteen eteenpäin -laskennasta sekä datan siirtämisestä asiantuntijoiden välillä. Raportti lisää, että topologia‑agnostiset tarkistuspisteet tallentavat globaalit FP32‑tensorit riippumatta rinnakkaisesta asettelusta, jolloin suoritus voidaan jatkaa eri topologiassa, ja että hallitussa vertailussa aktivoinnin uudelleenlaskenta poisti lähes kaksi kolmasosaa aktivointimuistista ja vähensi huippumuistia noin neljänneksellä kustannuksena noin viidenneksen läpivirrasta.
Triljoniparametriset suorituskykytestit ja ilmoitetut rajoitukset
Ai2 kertoi, että se testasi Olmo-core 3:n eri kokoonpanoilla NVIDIA B300 -GPU:illa, mukaan lukien 1,2‑triljonin parametrin malli, jossa 58,36 miljardia parametria oli aktiivisia per token 512 GPU:n yli, ja jossa suurin havaittu läpivirta oli 858 TFLOP/s per GPU. Ai2 totesi, että nämä testit käyttivät satunnaista reititystä järjestelmän suorituskyvyn mittaamiseen sen sijaan, että ne arvioisivat koulutetun mallin laatua. Tekninen raportti luettelee mitatut toimintapisteet 12,9‑miljardin parametrin mallilta 16 GPU:lla aina 1,2‑triljonin parametrin malliin 512 GPU:lla, ja ilmoittaa, että otsikkoluvut ovat järjestelmäviitteitä, jotka on mitattu satunnaisessa reitityksessä, eivätkä ne ole hallittua skaalauskäyrää tai aikaan‑laatu‑väitettä.
Ai2 kokeili myös DeepEP v2:ta, vaihtoehtoista taustajärjestelmää asiantuntijoiden väliseen viestintään GPU:iden välillä, saavuttaen kokoonpanon, jossa on 2,38 biljoonaa parametria yhteensä. Ai2 kuvaa tulosta lyhytaikaiseksi kapasiteettitestiksi, joka osoittaa Olmo-core 3:n saavuttaman mittakaavan sen sijaan, että se olisi kestävä koulutussuorituskyky. Tekninen raportti, jonka otsikko on “Supercharging Olmo-core for Efficient and Scalable MoE Training”, on päivätty lokakuuhun 2026; sen tekijöinä ovat Allen Institute for AI ja University of Washington, ja Tianhua Tao on listattu pääkirjoittajaksi ja pääkehittäjäksi.
Dokumentoituja havaintoja ja seuraavan sukupolven Olmo‑suunnitelmia
Raportti dokumentoi epäonnistumismallin, jota Ai2 kutsuu token‑gerrymanderingiksi, jossa tasapainottavaa reititystä edistävä pisteytys voi parantua, vaikka todellinen työkuorma muuttuu epätasaisemmaksi. Muita dokumentoituja havaintoja ovat: asiantuntijoiden oppimisnopeuksien alentaminen, koska ne käsittelevät vähemmän tokenia, ei parantanut testattujen malliperheiden tuloksia; GPU‑laskelmat kestoivat eri aikoja, kun käsiteltävät arvot muuttuivat, vaikka matriisin dimensiot pysyivät samana; sekä viestinnän ja laskennan päällekkäisyys erillisillä GPU‑virroilla ei aina nopeuttanut koulutusta, ja joissakin testeissä se hidasti kokonaisajonaikaa. Raportti kuvaa myös testattuja, mutta käyttöönottomia lähestymistapoja, kuten aktivaatioiden CPU‑offloadin, jota isäntälinkki ei pystynyt kantamaan, sekä kahta päällekkäisyysskeemaa, jotka kilpailivat asiantuntijalaskennan GPU‑resursseista.
Ai2 kertoi, että sen seuraavan sukupolven Olmo käyttää MoE‑arkkitehtuuria, ja että tavoitteena on tehdä siitä tähän mennessä kykenevin Olmo, koulutettuna suurimmalla datamäärällään ja pisimmällä kontekstin ikkunalla. Organisaatio ilmoitti, että Olmo-core 3 on täysin avoin, jotta tutkijat ja kehittäjät voivat käyttää sitä omien MoE‑mallien kouluttamiseen, soveltaa sitä eri laitteistoihin ja kokeilla reititystä, rinnakkaisuutta ja muita järjestelmän osia. Olmo-core-koodivarasto GitHubissa kuvaa projektia PyTorch‑rakennuspalikoina OLMo‑ekosysteemille, sillä on Apache‑2.0‑lisenssi, ja se voidaan asentaa lähdekoodista tai PyPI:stä nimellä ai2-olmo-core.












