Modelli e piattaforme di IA

Ai2 rilascia Olmo-Core 3, stack di addestramento aperto per MoE da trilioni di parametri

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

L’Allen Institute for AI ha rilasciato Olmo-core 3 il 1 ottobre 2026, un aggiornamento al suo framework di sviluppo di grandi modelli linguistici basato su un nuovo sistema di addestramento open mixture-of-experts che Ai2 ha dichiarato abbia superato il trilione di parametri totali nei benchmark.

Ai2 ha affermato che Olmo-core 3 è progettato per scalare l’addestramento MoE nella fascia dei trilioni di parametri mantenendo l’efficienza computazionale, e lo ha descritto come uno dei sistemi fondamentali alla base della prossima generazione di Olmo. Il rilascio è accompagnato da un rapporto tecnico, una demo interattiva e codice aperto.

I modelli MoE possono contenere molti più parametri senza richiedere che ogni input li utilizzi tutti, ma il modello completo deve comunque essere memorizzato nella memoria GPU e aggiornato durante l’addestramento, e l’instradamento degli input verso gli esperti corretti in un cluster genera costi di comunicazione e coordinamento propri. Ai2 ha affermato che tali costi possono erodere gran parte del vantaggio computazionale man mano che i MoE crescono, e che Olmo-core 3 è stato progettato per colmare tale divario. In un benchmark di Ai2, il pool di esperti è passato da 8 a 128 mantenendo la selezione di quattro esperti per token, mantenendo i parametri attivi circa fissi a circa 3,2 miliardi mentre la capacità totale dei parametri è aumentata da 4,6 miliardi a 47 miliardi, con il throughput di addestramento che è diminuito di meno del 5%.

Da FSDP a uno stack di addestramento basato su DDP

L’implementazione MoE precedente di Ai2 in Olmo-core utilizzava il fully sharded data parallelism, configurato per raccogliere e rishardare i pesi del modello per ogni piccolo batch di dati di addestramento. Olmo-core 3 passa a un sistema basato sul distributed data parallelism che mantiene gli esperti residenti sulle GPU e instrada i dati rilevanti verso di essi, evitando la ripetuta raccolta dei pesi. In un test preliminare su otto GPU NVIDIA B300, Ai2 riferisce che un MoE da 47 miliardi di parametri ha elaborato 52.000 token al secondo per GPU con il nuovo stack, rispetto a 19.400 con l’implementazione precedente, che Ai2 descrive come circa 2,7 volte il throughput.

Il lavoro di Ai2 sui modelli sparsi risale a OlmoE, che utilizzava un’architettura MoE con 64 esperti instradati, mentre Olmo 3 impiegava un’architettura densa in cui quasi tutto il modello era attivo per ogni token. Olmo-core 3 amplia il framework con un sistema di addestramento progettato per MoE molto più grandi. Ai2 ha osservato che Megatron-Core di NVIDIA è un’opzione consolidata per l’addestramento di grandi MoE, e ha descritto Olmo-core 3 come l’introduzione di uno stack di addestramento MoE integrato nel framework alla base di Olmo.

Parallelismo, precisione e tecniche di memoria

Tre tecniche determinano come il modello e il suo stato di addestramento vengono suddivisi sull’hardware: il parallelismo degli esperti distribuisce gli esperti sulle GPU, il parallelismo a pipeline divide gli strati del modello tra gruppi di GPU, e un ottimizzatore distribuito distribuisce lo stato dell’ottimizzatore tra le GPU invece di memorizzare una copia completa su ogni GPU. Olmo-core 3 riduce anche il costo di instradare i dati verso gli esperti corretti: il parallelismo degli esperti riga per riga colloca i dati instradati direttamente nei buffer di input degli esperti, l’instradamento residente su GPU mantiene i metadati di instradamento sulle GPU così che la CPU possa accodare lavoro senza attendere che venga copiato indietro, e il GEMM raggruppato combina molte piccole computazioni degli esperti affinché le GPU possano eseguirle più efficientemente. Il rapporto tecnico descrive un design di parallelismo degli esperti riga per riga basato su NVSHMEM che scrive ogni token direttamente nel buffer del suo esperto, con moltiplicazioni di matrici raggruppate programmate sul dispositivo che rendono il parallelismo degli esperti completamente privo di sincronizzazione.

Olmo-core 3 supporta MXFP8, un formato numerico a precisione ridotta. In un benchmark controllato su quattro GPU NVIDIA B300 con lavoro distribuito uniformemente tra gli esperti, Ai2 segnala un throughput di addestramento circa del 21% superiore rispetto alla baseline BF16, mentre la memoria attiva di picco è scesa da 103 GiB a 95 GiB, con la maggior parte del guadagno derivante dal calcolo feed-forward e dal trasferimento dei dati tra gli esperti. Il rapporto aggiunge che i checkpoint indipendenti dalla topologia registrano tensori FP32 globali indipendentemente dal layout parallelo, così un’esecuzione può riprendere su una topologia diversa, e che nella sua comparazione controllata la ricomputazione delle attivazioni ha eliminato quasi due terzi della memoria delle attivazioni e ridotto la memoria di picco di circa un quarto al costo di circa un quinto del throughput.

Benchmark da trilioni di parametri e limiti dichiarati

Ai2 ha dichiarato di aver benchmarkato Olmo-core 3 su una gamma di configurazioni con GPU NVIDIA B300, includendo un modello da 1,2 trilioni di parametri con 58,36 miliardi di parametri attivi per token su 512 GPU, dove il throughput più alto osservato è stato di 858 TFLOP/s per GPU. Ai2 ha affermato che questi test hanno utilizzato l’instradamento casuale per misurare le prestazioni del sistema piuttosto che la qualità di un modello addestrato. Il rapporto tecnico elenca i punti operativi misurati da un modello da 12,9 miliardi di parametri su 16 GPU fino al modello da 1,2 trilioni di parametri su 512, e afferma che le metriche principali sono riferimenti di sistema misurati con instradamento casuale, non una curva di scalabilità controllata o una affermazione sul tempo per raggiungere la qualità.

Ai2 ha anche sperimentato DeepEP v2, un backend alternativo per la comunicazione tra esperti su più GPU, raggiungendo una configurazione con 2,38 trilioni di parametri totali. Ai2 descrive questo risultato come un test a capacità limitata che dimostra la scala che Olmo-core 3 può raggiungere, piuttosto che una prestazione di addestramento sostenuta. Il rapporto tecnico, intitolato “Supercharging Olmo-core for Efficient and Scalable MoE Training”, è datato ottobre 2026; i suoi autori provengono dall’Allen Institute for AI e dall’University of Washington, con Tianhua Tao indicato come autore principale e sviluppatore principale.

Risultati Documentati e Piani per la Prossima Generazione di Olmo

Il rapporto documenta un modello di errore che Ai2 chiama “token gerrymandering”, in cui un punteggio destinato a favorire un routing equilibrato può migliorare anche se il carico di lavoro reale diventa meno bilanciato. Altri risultati documentati includono: la riduzione dei tassi di apprendimento degli esperti, poiché elaborano meno token, non ha migliorato i risultati nella famiglia di modelli testata; i calcoli su GPU hanno richiesto tempi diversi quando i valori elaborati cambiavano, anche mantenendo le stesse dimensioni della matrice; e la sovrapposizione di comunicazione e calcolo su flussi GPU separati non ha sempre accelerato l’addestramento, rallentando in alcuni test l’esecuzione end‑to‑end. Il rapporto descrive inoltre approcci testati ma non adottati, tra cui lo scarico su CPU delle attivazioni che il collegamento host non poteva gestire e due schemi di sovrapposizione che competivano con il calcolo degli esperti per le risorse GPU.

Ai2 ha dichiarato che la sua Olmo di prossima generazione utilizzerà un’architettura MoE e che punta a renderla la sua Olmo più capace finora, addestrata sul suo più grande set di dati e con la finestra di contesto più ampia. L’organizzazione ha affermato che Olmo-core 3 è completamente aperto, così che ricercatori e sviluppatori possano usarlo per addestrare i propri MoE, adattarlo a hardware diverso e sperimentare con il routing, il parallelismo e altre parti del sistema. Il repository GitHub Olmo-core descrive il progetto come blocchi di costruzione PyTorch per l’ecosistema OLMo, è rilasciato sotto licenza Apache‑2.0 e può essere installato dal codice sorgente o da PyPI come ai2-olmo-core.

Jonas Reeve è un analista generato dall'IA presso Unite.AI, focalizzato su AI cognitiva, intelligenza artificiale generale (AGI) e le fondamenta teoriche dell'intelligenza delle macchine. Il suo lavoro esplora come apprendimento, ragionamento, memoria e astrazione emergano sia nei sistemi biologici sia in quelli artificiali, tracciando collegamenti tra le moderne architetture AI e le domande di lunga data nella scienza cognitiva e nella filosofia della mente.

Con un approccio concettuale e riflessivo, Jonas esamina quadri teorici come i modelli di ragionamento, i sistemi agentici, la cognizione emergente e la teoria dell'allineamento, mirando a chiarire cosa significhi realmente il progresso verso l'AGI — e cosa non significhi. Piuttosto che inseguire scadenze o hype, egli enfatizza i principi primi, il rigore concettuale e i limiti dei modelli attuali.

Gli articoli scritti da Jonas Reeve sono generati dall'IA e revisionati dal team editoriale di Unite.AI per garantire accuratezza, chiarezza e una discussione responsabile dei concetti avanzati di IA.