Modele și platforme AI
Ai2 lansează Olmo-Core 3, un set de instruire deschis pentru MoE-uri cu un trilion de parametri

Institutul Allen pentru AI a lansat Olmo-core 3 pe 1 octombrie 2026, o actualizare a cadrului său de dezvoltare a modelelor de limbaj mari construit în jurul unui sistem de instruire open mixture-of-experts reproiectat, pe care Ai2 susține că l-a evaluat la peste un trilion de parametri în total.
Ai2 a declarat că Olmo-core 3 este conceput pentru a scala instruirea MoE în zona de parametri de un trilion, menținând eficiența computațională, și l-a descris ca unul dintre sistemele de bază din spatele următoarei generații Olmo. Lansarea este însoțită de un raport tehnic, o demonstrație interactivă și cod deschis.
Modelele MoE pot conține mult mai mulți parametri fără a necesita ca fiecare intrare să îi folosească pe toți, dar modelul complet trebuie totuși să fie stocat în memoria GPU și actualizat în timpul instruirii, iar rutarea intrărilor către experții potriviți într-un cluster generează costuri proprii de comunicare și coordonare. Ai2 a declarat că aceste costuri pot eroda o mare parte a avantajului computațional pe măsură ce MoE-urile cresc, și că Olmo-core 3 a fost construit pentru a reduce această diferență. Într-un benchmark al Ai2, grupul de experți a crescut de la 8 la 128, menținând în continuare selectarea a patru experți per token, menținând parametrii activi aproximativ fixați la circa 3,2 miliarde, în timp ce capacitatea totală de parametri a crescut de la 4,6 miliarde la 47 miliarde, cu randamentul instruirii scăzând cu mai puțin de 5%.
De la FSDP la un set de instruire bazat pe DDP
Implementarea anterioară MoE a Ai2 în Olmo-core utiliza paralelismul de date complet fragmentat (fully sharded data parallelism), configurat să adune și să redistribuie greutățile modelului pentru fiecare lot mic de date de instruire. Olmo-core 3 trece la un sistem bazat pe paralelismul de date distribuit, care menține experții rezidenți pe GPU-uri și direcționează datele relevante către aceștia, evitând astfel adunarea repetată a greutăților. Într-un test preliminar pe opt GPU-uri NVIDIA B300, Ai2 raportează că un MoE de 47 de miliarde de parametri a procesat 52.000 de tokeni pe secundă pe GPU cu noul set, comparativ cu 19.400 utilizând implementarea anterioară, pe care Ai2 o descrie ca fiind aproximativ 2,7 ori mai mare în randament.
Lucrările Ai2 asupra modelelor sparse se întorc la OlmoE, care a folosit o arhitectură MoE cu 64 de experți rutati, în timp ce Olmo 3 a utilizat o arhitectură densă în care aproape întregul model era activ pentru fiecare token. Olmo-core 3 extinde cadrul cu un sistem de instruire conceput pentru modele MoE mult mai mari. Ai2 a remarcat că Megatron-Core de la NVIDIA este o opțiune consacrată pentru instruirea de MoE-uri mari și a descris Olmo-core 3 ca aducând un set de instruire MoE integrat în cadrul din spatele Olmo.
Paralelism, precizie și tehnici de memorie
Trei tehnici determină modul în care modelul și starea sa de instruire sunt împărțite pe hardware: paralelismul de experți distribuie experții pe GPU-uri, paralelismul de conductă împarte straturile modelului pe grupuri de GPU-uri, iar un optimizer distribuit distribuie starea optimizerului pe GPU-uri în loc să stocheze o copie completă pe fiecare GPU. Olmo-core 3 reduce, de asemenea, costul rutării datelor către experții potriviți: paralelismul de experți pe rând (rowwise) plasează datele rutate direct în buffer-ele de intrare ale experților, rutarea rezidentă pe GPU menține metadatele de rutare pe GPU-uri astfel încât CPU-ul să poată pune în coadă sarcini fără a aștepta copierea înapoi, iar GEMM grupat combină numeroase calcule mici ale experților pentru ca GPU-urile să le execute mai eficient. Raportul tehnic descrie un design de paralelism de experți pe rând bazat pe NVSHMEM care scrie fiecare token direct în buffer-ul expertului său, cu înmulțiri de matrice grupate programate pe dispozitiv care fac paralelismul de experți complet fără sincronizare.
Olmo-core 3 suportă MXFP8, un format numeric cu precizie redusă. Într-un benchmark controlat pe patru GPU-uri NVIDIA B300 cu sarcina distribuită uniform între experți, Ai2 raportează că randamentul instruirii este cu aproximativ 21 % mai mare decât la referința BF16, în timp ce memoria activă maximă a scăzut de la 103 GiB la 95 GiB, majoritatea câștigului provenind din calculul feed-forward și mutarea datelor între experți. Raportul adaugă că punctele de control agnostice față de topologie înregistrează tensori globali FP32 independent de aranjamentul paralel, astfel încât o execuție poate fi reluată pe o topologie diferită, și că în comparația controlată, recalcul activării a eliminat aproape două treimi din memoria de activare și a redus memoria maximă cu aproximativ un sfert, la costul unei scăderi de circa o cincime din randament.
Benchmark-uri cu un trilion de parametri și limite declarate
Ai2 a declarat că a evaluat Olmo-core 3 pe o gamă de configurații pe GPU-uri NVIDIA B300, inclusiv un model de 1,2 trilion de parametri cu 58,36 miliarde de parametri activi per token pe 512 GPU-uri, unde cel mai mare randament observat a fost de 858 TFLOP/s per GPU. Ai2 a precizat că aceste teste au folosit rutare aleatoare pentru a măsura performanța sistemului, nu calitatea unui model antrenat. Raportul tehnic enumeră puncte de operare măsurate de la un model de 12,9 miliarde de parametri pe 16 GPU-uri până la modelul de 1,2 trilion de parametri pe 512, și afirmă că ratele de titlu sunt referințe de sistem măsurate sub rutare aleatoare, nu o curbă de scalare controlată sau o afirmație privind timpul până la calitate.
Ai2 a experimentat, de asemenea, cu DeepEP v2, un backend alternativ pentru comunicarea între experți pe mai multe GPU-uri, ajungând la o configurație cu 2,38 trilioane de parametri în total. Ai2 descrie acest rezultat ca un test de capacitate redusă care demonstrează scala pe care Olmo-core 3 o poate atinge, mai degrabă decât performanța de antrenament susținută. Raportul tehnic, intitulat „Supercharging Olmo-core for Efficient and Scalable MoE Training”, este datat octombrie 2026; autorii săi provin de la Allen Institute for AI și University of Washington, cu Tianhua Tao menționat ca autor principal și dezvoltator principal.
Descoperiri Documentate și Planuri pentru Olmo de Generație Viitoare
Raportul documentează un tipar de eșec pe care Ai2 îl numește „token gerrymandering”, în care un scor destinat să încurajeze rutarea echilibrată ar putea să se îmbunătățească chiar dacă sarcina reală devine mai puțin echilibrată. Alte constatări documentate includ: reducerea ratelor de învățare ale experților, deoarece aceștia procesează mai puțini tokeni, nu a îmbunătățit rezultatele în familia de modele testată; calculele pe GPU au durat perioade diferite când valorile procesate s-au schimbat, chiar și cu aceleași dimensiuni ale matricelor; și suprapunerea comunicației și a calculului pe fluxuri GPU separate nu a făcut întotdeauna antrenamentul mai rapid și, în unele teste, a încetinit execuția de la cap la cap. Raportul descrie, de asemenea, abordări testate, dar neadoptate, inclusiv descărcarea pe CPU a activărilor pe care legătura gazdă nu le putea transporta și două scheme de suprapunere care concurau cu calculul experților pentru resursele GPU.
Ai2 a declarat că următoarea generație Olmo va folosi o arhitectură MoE și că își propune să fie cel mai capabil Olmo de până acum, antrenat pe cel mai mare set de date și cu cea mai lungă fereastră de context. Organizația a precizat că Olmo-core 3 este complet deschis, astfel încât cercetătorii și dezvoltatorii să îl poată folosi pentru a-și antrena propriile MoE-uri, să îl adapteze la diferite hardware-uri și să experimenteze cu rutarea, paralelismul și alte părți ale sistemului. Depozitul Olmo-core GitHub descrie proiectul ca blocuri de construcție PyTorch pentru ecosistemul OLMo, are licență Apache-2.0 și poate fi instalat din sursă sau din PyPI ca ai2-olmo-core.












