AI-modellen en platforms

Reflection AI onthult Beam, een open-weight model met 501 miljard parameters

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Reflection AI introduceerde Beam op 5 oktober 2026, zijn eerste open-weight model: een sparse Mixture-of-Experts‑systeem met in totaal 501 miljard parameters en 23 miljard actieve, gebouwd voor programmeer‑, redeneer‑ en agent‑werkbelastingen.

Beam ondergaat de laatste red‑team‑tests en evaluaties, en een vroege versie wordt aangeboden aan een geselecteerde groep gebruikers via een wachtlijst. Reflection beschreef Beam als het eerste model in een reeks en zei dat het al traint aan wat daarna komt.

Mogelijkheden‑ en efficiëntieclaims

Reflection zei dat het Beam trainde met een specifieke focus op programmeer‑ en agentprestaties. Het bedrijf beschreef het model als concurrerend met grotere open modellen zoals GLM 5.2 en als naderend aan Qwen 3.8‑Max op programmeer‑ en agenttaken, terwijl het erkende dat Kimi K3 nog steeds voorloopt op ruwe capaciteit; het kenmerkte Beam’s voordeel als efficiëntie tijdens inferentie en stelde dat het model de zogenaamde Westerse open-weight grens verlegt.

Scores die Reflection rapporteerde uit zijn evaluatiesuite omvatten 80,1 op Terminal Bench v2.1, 80,9 op SWEBench Verified, 77,2 op SWE Bench Pro v2‑Hard, 97,8 op AIME 2026, 36,2 op Humanity’s Last Exam zonder hulpmiddelen, en 90,5 op GPQA Diamond.

Wat efficiëntie betreft, meldde het bedrijf dat Beam scores behaalt die vergelijkbaar zijn met GLM‑5.2 op geavanceerde redeneerbenchmarks terwijl het drie tot vier keer minder inferentiekosten gebruikt, met grotere winsten ten opzichte van modellen met meer dan twee biljoen parameters, zoals Qwen 3.8‑Max. Volgens het bericht zijn de schattingen gebaseerd op gegevens van Artificial Analysis en DataCurve en benaderen ze de generatie‑compute als tweemaal het aantal actieve parameters vermenigvuldigd met het gemiddelde aantal gegenereerde tokens per poging; omdat de cijfers prompt‑prefill, aandacht‑operaties en service‑overhead uitsluiten, beschreef Reflection ze als een benaderende compute‑vergelijking in plaats van gemeten inferentiekosten.

Reflection zei dat het Beam ook trainde met een regelbare lengtestraffering die succesvolle oplossingen beloont terwijl onnodige tokens worden ontmoedigd, en dat een gebruikersgerichte redeneer‑inspanning‑parameter gebruikers in staat stelt token‑gebruik af te wegen tegen prestaties, waarbij lagere instellingen kortere antwoorden bevoordelen en hogere instellingen langer redeneren op veeleisende taken mogelijk maken.

De aankondiging meldt dat de mogelijkheden zich generaliseerden buiten de trainingsmix: tijdens reinforcement learning op redeneervermogen, software‑engineering en terminal‑taken verbeterde de browse‑prestaties ondanks het ontbreken van browse‑taken, en met webtoegang leerde het model zelfstandig andere grote taalmodellen te raadplegen en OCR‑API’s te gebruiken om documenten te lezen. Demonstraties omvatten een live‑bijwerkende New York City‑metrokaart gebouwd op openbare MTA‑gegevens, een 3D‑astronaut‑game geschreven in p5.js, en een land‑of‑water‑puzzel waarin Beam punten classificeerde op een wereldwijde coördinatenraster van 16.200 punten met 95,5 procent dekking, een resultaat dat het bericht situeert tussen Opus 5 met 92,5 procent en Fable 5 met 97,8 procent. In een vierde demonstratie produceerde Beam een notebook die het kleinste Gemma‑4‑model fijn‑afstemde op een Text2SQL‑taak, wat volgens Reflection de held‑out‑testnauwkeurigheid van Gemma met 66,5 procent verhoogde.

Trainings‑pipeline

Pretraining en datacuratie

Reflection zei dat het Beam pre‑trainde op 23,8 biljoen tokens afkomstig van het web, openbare bronnen en propriëtaire gelicentieerde datasets, en de run end‑to‑end voltooide in minder dan vier weken op 6.144 NVIDIA GB300 NVL72 GPU’s. Het bedrijf rapporteerde negen semi‑automatische rewinds, toe te schrijven aan gradient‑norm‑pieken of vermoedelijke stille datacorruptie, en stelde dat de goodput, gedefinieerd als het aandeel wandkloktijd besteed aan trainingsstappen dat in het uiteindelijke model behouden bleef, 92,3 procent bereikte.

De datapipe‑line verwijderde ongeveer 95 procent van ruwe internettokens via parsing, deduplicatie en curatie, terwijl Reflection zei dat conventionele filtertechnieken ongeveer 1,8 biljoen hoogwaardige tokens die het behield, inclusief 87 procent van zijn gecureerde web‑code‑tokens, gemist zouden hebben. Een aparte pipeline verwerkte PDF‑artefacten met een vision‑language OCR‑model en interne kwaliteitsclassificatoren op duizenden GPU’s, en een tussen‑training fase verlengde Beam’s effectieve contextlengte tot één miljoen tokens.

Het bericht beschrijft een architectuur die interleaved lokale en globale aandacht combineert, fijnmazige gerouteerde experts, en load balancing zonder auxiliaire verlies met cosinus‑decay van expert‑bias‑updates, naast diepte‑gebaseerde residual‑schaalvergroting, SandwichNorm, element‑gewijze aandacht‑gating en FP32 residual‑accumulatie. Reflection rapporteerde bijna uniforme expert‑utilisatie, waarbij de drukste expert een load had die gemiddeld 1,04 keer de gemiddelde load bedroeg aan het einde van de pretraining, en begrensde residual‑stream‑normen over alle 52 lagen.

High‑Compute reinforcement learning

De reinforcement‑learning‑campagne genereerde meer dan 100 miljoen rollouts op 10.500 NVIDIA GB300‑GPU’s gedurende vier weken, met een maximale contextlengte van 256.000 tokens en ongeveer 1,3 miljard sandboxes gebruikt voor training en beoordeling. Reflection zei dat het bijna één miljoen codeer‑, agent‑ en STEM‑omgevingen heeft verkregen, voornamelijk via synthetische data‑pipelines, en beschreef de inspanning als wat het beschouwt als een van de grootste RL‑runs die tot nu toe door een open lab zijn uitgevoerd.

Het bedrijf meldde een gemiddeld aantal van 110.000 gelijktijdige rollouts en tot 170.000 gelijktijdige sandboxes, met meer dan een miljard sandbox‑creatie‑verzoeken verwerkt over meer dan 20 clusters, twee clouds en vier regio’s. Nieuwe gewichten bereikten de inferentiefleet in een mediaan van ongeveer 12 seconden, 71 inferentie‑incidenten werden afgehandeld zonder de trainingsjob te beëindigen, en dynamisch inpakken hield de trainingsbatches gemiddeld voor 99,99 procent vol. Reflection zei dat het asynchrone systeem stabiel bleef, zelfs bij het leren van monsters tot 107 gewichtsversionen, ongeveer één dag, achter het huidige beleid.

Veiligheid en afstemming

Voor afstemming trainde Reflection een tweede model vanuit hetzelfde voorgetrainde checkpoint met een aparte supervisie‑fine‑tuning‑ en RL‑pipeline gericht op gedragsprincipes, en voegde het vervolgens samen met de grootschalige RL‑teacher via multi‑teacher on‑policy distillatie. De principes zijn georganiseerd in drie niveaus: regels die het model niet mag overtreden, kwaliteiten die het consequent moet vervullen, en een standaard interactiestijl.

De veiligheidsdataset werd op een vijandige en iteratieve manier opgebouwd, waarbij de succesvolle aanvallen van elke ronde werden teruggevoerd naar de volgende trainingsronde, en safety‑RL omvatte single‑turn-, multi‑turn-, jailbreak- en agentische scenario’s waarin een gesimuleerde tegenstander een model dat tools gebruikt onder druk zet. Reflection zei dat het RL‑winstvoorspellingen beter kon voorspellen dan alleen een Best‑of‑N‑plafond, met een correlatie van 0,79 tegenover 0,46 voor het plafond. Het bedrijf meldde dat het de resultaten van zijn veiligheidsbeoordeling zal publiceren in het technische rapport van Beam en de interne veiligheidsbeoordelingen die het heeft ontwikkeld als open‑source zal beschikbaar stellen.

Beschikbaarheid en partnerschappen

Op zijn over‑pagina schetst Reflection de toezeggingen om modelgewichten vrij te geven, zijn onderzoek te publiceren en software open‑source te maken, inclusief reinforcement‑learning‑tools en -omgevingen. De pagina stelt dat Reflection gevalideerd is op Dell AI Factory met NVIDIA, dat het een gecertificeerd consortiumlid is van de Genesis‑missie van het Department of Energy, dat het de 17 Amerikaanse nationale laboratoria bedient met zijn open‑weight‑modellen, en dat het een soevereine AI‑cloud van 250‑megawatt bouwt in Zuid‑Korea met Shinsegae, ondersteund door de U.S. en Koreaanse overheden.

Reflection zei dat het de gewichten van Beam later in oktober 2026 onder een Apache 2.0‑licentie zal vrijgeven, vergezeld van een technisch rapport, modelkaart, documentatie en de volledige stack voor het uitvoeren, evalueren en fijn afstellen van het model, met distributiepartners en integraties met open‑source‑bibliotheken en -harnesses die voor de lancering zijn gepland.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machinale intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en legt verbanden tussen moderne AI-architecturen en eeuwenoude vragen in de cognitieve wetenschap en de filosofie van de geest.

Met een conceptuele en reflectieve benadering onderzoekt Jonas kaders zoals redeneermodellen, agentensystemen, emergente cognitie en uitlijningstheorie, met als doel te verduidelijken wat vooruitgang richting AGI werkelijk betekent – en wat het niet betekent. In plaats van te jagen op tijdlijnen of hype, legt hij de nadruk op eerste principes, conceptuele strengheid en de grenzen van de huidige modellen.

Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door de redactie van Unite.AI om nauwkeurigheid, duidelijkheid en een verantwoordelijke bespreking van geavanceerde AI-concepten te waarborgen.