Modely a platformy AI

Ai2 uvádí Olmo-Core 3, otevřený výcvikový stack pro MoE s trilionovými parametry

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Allen Institute for AI vydal Olmo-core 3 dne 1. října 2026, vylepšení svého vývojového rámce velkých jazykových modelů postaveného na přepracovaném otevřeném systému výcviku směsových expertů, o kterém Ai2 uvádí, že byl testován s více než jedním trilionem celkových parametrů.

Ai2 uvedlo, že Olmo-core 3 je navržen tak, aby škáloval výcvik MoE do rozsahu trilionových parametrů při zachování výpočetní efektivity, a popsal jej jako jeden ze základních systémů stojících za další generací Olmo. K vydání je přiložena technická zpráva, interaktivní demo a otevřený kód.

Modely MoE mohou obsahovat mnohem více parametrů, aniž by každý vstup musel využívat všechny z nich, ale celý model je stále nutné uložit napříč pamětí GPU a během výcviku aktualizovat, a směrování vstupů ke správným expertům v rámci klastru vytváří vlastní komunikační a koordinační náklady. Ai2 uvedlo, že tyto náklady mohou erodovat velkou část výpočetní výhody při růstu MoE, a že Olmo-core 3 byl vytvořen k překlenutí této mezery. V jednom benchmarku Ai2 se zásobník expertů rozrostl z 8 na 128, přičemž stále bylo vybíráno čtyři experty na token, aktivní parametry zůstaly přibližně na 3,2 miliardy, zatímco celková kapacita parametrů vzrostla ze 4,6 miliardy na 47 miliard, přičemž propustnost výcviku klesla o méně než 5 %.

Z FSDP na tréninkový stack založený na DDP

Předchozí implementace MoE v Olmo-core od Ai2 používala plně rozdělenou datovou paralelismus, nastavenou na shromažďování a opětovné rozdělení vah modelu pro každou malou dávku tréninkových dat. Olmo-core 3 přechází na systém založený na distribuované datové paralelismu, který udržuje experty na GPU a směruje k nim relevantní data, čímž se vyhýbá opakovanému shromažďování vah. V předběžném testu na osmi GPU NVIDIA B300 Ai2 uvádí, že MoE s 47 miliardami parametrů zpracoval 52 000 tokenů za sekundu na GPU s novým stackem, oproti 19 400 při použití předchozí implementace, což Ai2 popisuje jako přibližně 2,7‑násobek propustnosti.

Práce Ai2 na řídkých modelech sahá až k OlmoE, který využíval architekturu MoE se 64 směrovanými experty, zatímco Olmo 3 použil hustou architekturu, ve které byl téměř celý model aktivní pro každý token. Olmo-core 3 rozšiřuje rámec o výcvikový systém určený pro mnohem větší modely MoE. Ai2 poznamenalo, že Megatron-Core od NVIDIA je zavedenou možností pro výcvik velkých MoE a popisuje Olmo-core 3 jako přinášející integrovaný tréninkový stack MoE do rámce stojícího za Olmo.

Paralelismus, přesnost a techniky paměti

Tři techniky určují, jak jsou model a jeho výcvikový stav rozděleny mezi hardware: paralelismus expertů rozprostírá experty napříč GPU, paralelismus pipeline rozděluje vrstvy modelu mezi skupiny GPU a distribuovaný optimalizér rozkládá stav optimalizéru mezi GPU místo ukládání úplné kopie na každé GPU. Olmo-core 3 také snižuje náklady na směrování dat ke správným expertům: řádkový paralelismus expertů umisťuje směrovaná data přímo do vstupních bufferů expertů, směrování na GPU udržuje metadata směrování na GPU, takže CPU může zařazovat úlohy, aniž by čekala na jejich zpětné kopírování, a seskupený GEMM kombinuje mnoho malých výpočtů expertů, aby GPU mohly provádět efektivněji. Technická zpráva popisuje návrh řádkového paralelismu expertů založený na NVSHMEM, který zapisuje každý token přímo do bufferu jeho experta, s zařízeními plánovanými seskupenými maticovými násobeními, které činí paralelismus expertů zcela bez synchronizace.

Olmo-core 3 podporuje MXFP8, formát čísel s nižší přesností. V kontrolovaném benchmarku na čtyřech GPU NVIDIA B300 s prací rovnoměrně rozdělenou mezi experty Ai2 uvádí, že propustnost výcviku je přibližně o 21 % vyšší než u výchozího BF16, zatímco špičková aktivní paměť klesla z 103 GiB na 95 GiB, přičemž většina zisku pochází z výpočtu dopředného toku a přesunu dat mezi experty. Zpráva doplňuje, že topologicky nezávislé kontrolní body zaznamenávají globální FP32 tensory nezávisle na paralelním uspořádání, takže běh může být obnoven na jiné topologii, a že v kontrolovaném srovnání rekalkulace aktivací odstranila téměř dvě třetiny paměti aktivací a snížila špičkovou paměť přibližně o čtvrtinu za cenu ztráty asi jedné pětiny propustnosti.

Benchmarky s trilionovými parametry a uvedená omezení

Ai2 uvedlo, že testovalo Olmo-core 3 v různých konfiguracích na GPU NVIDIA B300, včetně modelu s 1,2 trilionu parametrů a 58,36 miliardy aktivních parametrů na token napříč 512 GPU, kde nejvyšší zaznamenaná propustnost činila 858 TFLOP/s na GPU. Ai2 uvedlo, že tyto testy používaly náhodné směrování k měření výkonu systému spíše než kvalitu vytrénovaného modelu. Technická zpráva uvádí naměřené provozní body od modelu s 12,9 miliardami parametrů na 16 GPU až po model s 1,2 trilionu parametrů na 512 GPU a uvádí, že hlavní rychlosti jsou referenční hodnoty systému měřené při náhodném směrování, nikoli kontrolovaná škálovací křivka nebo tvrzení o čase k dosažení kvality.

Ai2 také experimentoval s DeepEP v2, alternativním backendem pro komunikaci mezi experty napříč GPU, přičemž dosáhl konfigurace s 2,38 bilionu celkových parametrů. Ai2 popisuje tento výsledek jako test s omezenou kapacitou, který demonstruje měřítko, kterého může Olmo-core 3 dosáhnout, spíše než jako udržitelný výkon při trénování. Technická zpráva s názvem “Supercharging Olmo-core for Efficient and Scalable MoE Training” je datována říjnem 2026; její autoři jsou z Allen Institute for AI a University of Washington, přičemž Tianhua Tao je uveden jako hlavní autor a hlavní vývojář.

Dokumentované nálezy a plány pro další generaci Olmo

Zpráva dokumentuje selhávající vzorec, který Ai2 nazývá token gerrymandering, při němž skóre zamýšlené podpořit vyvážené směrování může zlepšovat i když se skutečná zátěž stává méně vyváženou. Mezi další zdokumentované nálezy patří: snížení učebních rychlostí expertů, protože zpracovávají méně tokenů, nezlepšilo výsledky v testované rodině modelů; výpočty na GPU trvaly různě dlouho, když se měnily zpracovávané hodnoty, i při stejných rozměrech matic; a překrývání komunikace a výpočtu na samostatných GPU streamách nevedlo vždy ke zrychlení trénování a v některých testech zpomalilo celkové provedení. Zpráva také popisuje testované, ale nepřijaté přístupy, včetně odkládání aktivací na CPU, které hostitelský link nedokázal přenést, a dvou překrývacích schémat, která soupeřila s výpočtem expertů o GPU zdroje.

Ai2 uvedl, že jeho další generace Olmo bude využívat architekturu MoE a že se snaží, aby to byl dosud nejvýkonnější Olmo, trénovaný na největším datasetu a s nejdelším kontextovým oknem. Organizace uvedla, že Olmo-core 3 je zcela otevřený, takže výzkumníci a vývojáři jej mohou použít k trénování vlastních MoE, přizpůsobit jej různému hardwaru a experimentovat se směrováním, paralelismem a dalšími částmi systému. repozitář Olmo-core na GitHubu popisuje projekt jako stavební bloky PyTorch pro ekosystém OLMo, nese licenci Apache-2.0 a lze jej nainstalovat ze zdrojového kódu nebo z PyPI jako ai2-olmo-core.

Jonas Reeve je analytik vytvořený umělou inteligencí ve Unite.AI, zaměřuje se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojové inteligence. Jeho práce zkoumá, jak se učení, uvažování, paměť a abstrakce objevují jak v biologických, tak v umělých systémech, a vytváří spojení mezi moderními architekturami AI a dlouhodobými otázkami kognitivní vědy a filozofie mysli.

S konceptuálním a reflexivním přístupem Jonas zkoumá rámce jako modely uvažování, agentické systémy, emergentní kognice a teorii zarovnání, s cílem objasnit, co skutečně znamená pokrok směrem k AGI – a co ne. Místo honby za termíny nebo hype zdůrazňuje první principy, konceptuální přísnost a limity současných modelů.

Články napsané Jonasem Reeve jsou generovány AI a jsou recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, srozumitelnost a odpovědnou diskusi o pokročilých konceptech AI.