Modelli e piattaforme di IA

Reflection AI presenta Beam, un modello open-weight da 501 miliardi di parametri

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Reflection AI ha introdotto Beam il 5 ottobre 2026, il suo primo modello open-weight: un sistema sparso Mixture-of-Experts con 501 miliardi di parametri totali e 23 miliardi attivi, progettato per compiti di programmazione, ragionamento e carichi di lavoro agentici.

Beam sta attraversando le ultime fasi di red‑team e valutazioni, e una versione preliminare è offerta a un gruppo selezionato di utenti tramite una lista d’attesa. Reflection ha descritto Beam come il primo modello di una serie e ha affermato che sta già addestrando il successivo.

Dichiarazioni di capacità ed efficienza

Reflection ha dichiarato di aver addestrato Beam con un’attenzione particolare alle prestazioni di programmazione e agentiche. L’azienda ha descritto il modello come competitivo con modelli open più grandi come GLM 5.2 e quasi pari a Qwen 3.8‑Max nei compiti di programmazione e agentici, pur riconoscendo che Kimi K3 rimane superiore in termini di capacità grezza; ha caratterizzato il vantaggio di Beam come efficienza al momento dell’inferenza e ha affermato che il modello spinge in avanti quella che definisce la frontiera occidentale dei modelli open-weight.

I punteggi riportati da Reflection nella sua suite di valutazione includono 80,1 su Terminal Bench v2.1, 80,9 su SWEBench Verified, 77,2 su SWE Bench Pro v2-Hard, 97,8 su AIME 2026, 36,2 su Humanity’s Last Exam senza strumenti, e 90,5 su GPQA Diamond.

In termini di efficienza, l’azienda ha riportato che Beam ottiene punteggi comparabili a GLM‑5.2 sui benchmark di ragionamento avanzato utilizzando da tre a quattro volte meno calcolo di inferenza, con guadagni maggiori rispetto a modelli con più di due trilioni di parametri, come Qwen 3.8‑Max. Secondo il post, le stime si basano sui dati di Artificial Analysis e DataCurve e approssimano il calcolo di generazione come il doppio del numero di parametri attivi moltiplicato per la media dei token generati per tentativo; poiché le cifre escludono il pre‑riempimento del prompt, le operazioni di attenzione e l’overhead di servizio, Reflection le ha descritte come un confronto di calcolo approssimativo piuttosto che un costo di inferenza misurato.

Reflection ha affermato di aver addestrato Beam anche con una penalità di lunghezza controllabile che premia le soluzioni riuscite scoraggiando i token superflui, e che un parametro di sforzo di ragionamento rivolto all’utente consente di bilanciare l’uso dei token rispetto alle prestazioni, con impostazioni più basse che favoriscono risposte più brevi e impostazioni più alte che permettono ragionamenti più lunghi su compiti impegnativi.

L’annuncio riporta che le capacità si sono generalizzate oltre il mix di addestramento: durante l’apprendimento per rinforzo su ragionamento, ingegneria del software e compiti terminali, le prestazioni di navigazione sono migliorate nonostante l’assenza di compiti di navigazione, e con l’accesso al web il modello ha imparato autonomamente a interrogare altri grandi modelli linguistici e a utilizzare API OCR per leggere documenti. Le dimostrazioni includono una mappa della metropolitana di New York City aggiornata in tempo reale, costruita con dati pubblici della MTA, un gioco 3D di un astronauta scritto in p5.js e un puzzle terra‑acqua in cui Beam ha classificato punti su una griglia globale di 16.200 punti con una copertura del 95,5 percento, risultato collocato dal post tra Opus 5 al 92,5 percento e Fable 5 al 97,8 percento. In una quarta dimostrazione, Beam ha prodotto un notebook per il fine‑tuning del più piccolo modello Gemma‑4 su un compito Text2SQL, che Reflection ha affermato abbia aumentato l’accuratezza del test di tenuta di Gemma del 66,5 percento.

Pipeline di addestramento

Pre‑addestramento e curazione dei dati

Reflection ha dichiarato di aver pre-addestrato Beam su 23,8 trilioni di token provenienti da web, fonti pubbliche e dataset proprietari con licenza, completando l’intero processo in meno di quattro settimane su 6.144 NVIDIA GB300 NVL72 GPU. L’azienda ha riportato nove ripristini semi-automatici, attribuiti a picchi di norma del gradiente o a sospetta corruzione silenziosa dei dati, e ha affermato che il goodput, definito come la percentuale del tempo reale impiegato nelle fasi di addestramento mantenute nel modello finale, ha raggiunto il 92,5 percento.

La pipeline dei dati ha eliminato circa il 95 percento dei token internet grezzi mediante parsing, deduplicazione e curazione, mentre Reflection ha affermato che le tecniche di filtraggio convenzionali avrebbero perso circa 1,8 trilioni di token di alta qualità che ha conservato, inclusi l’87 percento dei suoi token web‑code curati. Una pipeline separata ha elaborato artefatti PDF utilizzando un modello OCR visione‑linguaggio con classificatori di qualità interni su migliaia di GPU, e una fase di mid‑training ha esteso la lunghezza contestuale efficace di Beam a un milione di token.

Il post descrive un’architettura che combina attenzione locale e globale intercalata, esperti instradati a grana fine e bilanciamento del carico senza perdita ausiliaria con decadimento coseno degli aggiornamenti del bias degli esperti, insieme a scaling residuo basato sulla profondità, SandwichNorm, gating dell’attenzione elemento‑per‑elemento e accumulo residuo FP32. Reflection ha riportato un utilizzo quasi uniforme degli esperti, con il carico dell’esperto più occupato che mediava 1,04 volte la media al termine del pre‑addestramento, e norme di flusso residuo limitate su tutti i 52 strati.

Apprendimento per rinforzo ad alta capacità di calcolo

La campagna di apprendimento per rinforzo ha generato oltre 100 milioni di rollout su 10.500 GPU NVIDIA GB300 in quattro settimane, con una lunghezza massima del contesto di 256.000 token e circa 1,3 miliardi di sandbox utilizzate per l’addestramento e la valutazione. Reflection ha dichiarato di aver reperito quasi un milione di ambienti di programmazione, agentici e STEM, principalmente tramite pipeline di dati sintetici, e ha descritto lo sforzo come quello che ritiene sia una delle più grandi esecuzioni di RL condotte da un laboratorio open fino ad oggi.

L’azienda ha riferito di aver mantenuto una media di 110.000 rollout concorrenti e fino a 170.000 sandbox concorrenti, con oltre un miliardo di richieste di creazione di sandbox elaborate su più di 20 cluster, due cloud e quattro regioni. I nuovi pesi hanno raggiunto la flotta di inferenza in una mediana di circa 12 secondi, 71 incidenti di inferenza sono stati gestiti senza terminare il lavoro di addestramento, e il packing dinamico ha mantenuto i batch di addestramento al 99,99 percento di capacità in media. Reflection ha dichiarato che il sistema asincrono è rimasto stabile anche quando ha appreso da campioni fino a 107 versioni di peso, circa un giorno, dietro la politica attuale.

Sicurezza e Allineamento

Per l’allineamento, Reflection ha addestrato un secondo modello dallo stesso checkpoint preaddestrato utilizzando una pipeline separata di fine-tuning supervisionato e RL mirata ai principi comportamentali, per poi fonderlo con l’insegnante RL su larga scala tramite distillazione on-policy multi-insegnante. I principi sono organizzati in tre livelli: regole che il modello non deve violare, qualità che dovrebbe soddisfare costantemente e uno stile di interazione predefinito.

La dataset di sicurezza è stata costruita in modo avversario e iterativo, con gli attacchi riusciti di ogni round reintegrati nel round successivo di addestramento, e la RL di sicurezza ha coperto scenari a turno singolo, multi-turno, jailbreak e agentici in cui un avversario simulato mette pressione su un modello che utilizza strumenti. Reflection ha affermato di poter prevedere i guadagni RL meglio di un semplice limite Best-of-N, riportando una correlazione di 0,79 contro 0,46 per il limite. L’azienda ha dichiarato che pubblicherà i risultati della valutazione di sicurezza nel rapporto tecnico di Beam e renderà open source le valutazioni interne di sicurezza da essa sviluppate.

Disponibilità e Partnership

Nel suo pagina di presentazione, Reflection descrive gli impegni a rilasciare i pesi del modello, pubblicare la sua ricerca e rendere open source il software, inclusi gli strumenti e gli ambienti di reinforcement learning. La pagina afferma che Reflection è convalidata su Dell AI Factory con NVIDIA, che è membro certificato del consorzio del Genesis Mission del Dipartimento dell’Energia, al servizio dei 17 Laboratori Nazionali statunitensi con i suoi modelli open-weight, e che sta costruendo un cloud AI sovrano da 250 megawatt in Corea del Sud con Shinsegae, supportato dai governi degli Stati Uniti e della Corea.

Reflection ha dichiarato che rilascerà i pesi di Beam sotto licenza Apache 2.0 entro ottobre 2026, accompagnati da un rapporto tecnico, una scheda modello, documentazione e l’intero stack per eseguire, valutare e perfezionare il modello, con partner di distribuzione e integrazioni con librerie open source e harness pianificati per il lancio.

Jonas Reeve è un analista generato dall'IA presso Unite.AI, focalizzato su AI cognitiva, intelligenza artificiale generale (AGI) e le fondamenta teoriche dell'intelligenza delle macchine. Il suo lavoro esplora come apprendimento, ragionamento, memoria e astrazione emergano sia nei sistemi biologici sia in quelli artificiali, tracciando collegamenti tra le moderne architetture AI e le domande di lunga data nella scienza cognitiva e nella filosofia della mente.

Con un approccio concettuale e riflessivo, Jonas esamina quadri teorici come i modelli di ragionamento, i sistemi agentici, la cognizione emergente e la teoria dell'allineamento, mirando a chiarire cosa significhi realmente il progresso verso l'AGI — e cosa non significhi. Piuttosto che inseguire scadenze o hype, egli enfatizza i principi primi, il rigore concettuale e i limiti dei modelli attuali.

Gli articoli scritti da Jonas Reeve sono generati dall'IA e revisionati dal team editoriale di Unite.AI per garantire accuratezza, chiarezza e una discussione responsabile dei concetti avanzati di IA.