AI-modeller och plattformar
Reflection AI presenterar Beam, en 501‑miljardparameter öppenviktmodell

Reflection AI introducerade Beam den 5 oktober 2026, sin första öppenviktmodell: ett gles Mixture-of-Experts‑system med totalt 501 miljarder parametrar och 23 miljarder aktiva, byggt för kodning, resonemang och agentuppgifter.
Beam genomgår sista red‑team‑testning och utvärderingar, och en tidig version erbjuds till en utvald grupp användare via en väntelista. Reflection beskrev Beam som den första modellen i en serie och sade att den redan tränar nästa steg.
Påståenden om kapacitet och effektivitet
Reflection sade att de tränade Beam med särskilt fokus på kodning och agentprestanda. Företaget beskrev modellen som konkurrenskraftig med större öppna modeller såsom GLM 5.2 och som närmande sig Qwen 3.8‑Max på kodnings‑ och agentuppgifter, samtidigt som de erkände att Kimi K3 fortfarande ligger före i rå kapacitet; de karakteriserade Beams fördel som effektivitet vid inferenstid och sade att modellen driver fram det de kallar den västerländska öppenviktfronten.
Resultat som Reflection rapporterade från sin utvärderingssvit inkluderar 80,1 på Terminal Bench v2.1, 80,9 på SWEBench Verified, 77,2 på SWE Bench Pro v2‑Hard, 97,8 på AIME 2026, 36,2 på Humanity’s Last Exam utan verktyg, och 90,5 på GPQA Diamond.
När det gäller effektivitet rapporterade företaget att Beam uppnår resultat jämförbara med GLM‑5.2 på avancerade resonemangsbenchmarks samtidigt som det använder tre till fyra gånger mindre inferensberäkning, med ännu större vinster mot modeller med mer än två biljoner parametrar, såsom Qwen 3.8‑Max. Enligt inlägget baseras uppskattningarna på data från Artificial Analysis och DataCurve och approximera genereringsberäkning som dubbelt så många aktiva parametrar multiplicerat med genomsnittligt antal genererade token per försök; eftersom siffrorna exkluderar prompt‑förfylla, uppmärksamhetsoperationer och serveringsöverhead, beskrev Reflection dem som en ungefärlig beräkningsjämförelse snarare än ett uppmätt inferenskostnad.
Reflection sade också att de tränade Beam med ett kontrollerbart längdstraff som belönar lyckade lösningar samtidigt som det avskräcker onödiga token, och att en användar‑orienterad resonemangs‑insatsparameter låter användare byta token‑användning mot prestanda, där lägre inställningar gynnar kortare svar och högre inställningar möjliggör längre resonemang på krävande uppgifter.
Tillkännagivandet rapporterar att kapaciteterna generaliserades bortom träningsblandningen: under förstärkningsinlärning på resonemang, mjukvaruutveckling och terminaluppgifter förbättrades surfprestanda trots avsaknad av surfuppgifter, och med webbåtkomst lärde sig modellen på egen hand att fråga andra stora språkmodeller och att använda OCR‑API:er för att läsa dokument. Demonstrationerna inkluderar en live‑uppdaterande tunnelbanekarta för New York City byggd på offentliga MTA‑data, ett 3D‑astronautspel skrivet i p5.js, och ett land‑eller‑vatten‑pussel där Beam klassificerade punkter på ett globalt koordinatnät med 16 200 punkter med 95,5 procent täckning, ett resultat som inlägget placerar mellan Opus 5 med 92,5 procent och Fable 5 med 97,8 procent. I en fjärde demonstration skapade Beam en notebook som finjusterade den minsta Gemma‑4‑modellen på en Text2SQL‑uppgift, vilket Reflection sade ökade Gemmas testnoggrannhet på hållbar data med 66,5 procent.
Träningspipeline
Förträning och datakuration
Reflection sade att de förtränade Beam på 23,8 biljoner token hämtade från webben, offentliga källor och proprietära licensierade dataset, och slutförde körningen från början till slut på under fyra veckor på 6 144 NVIDIA GB300 NVL72-GPU:er. Företaget rapporterade nio semi‑automatiska återspolningar, tillskrivna gradient‑normspikar eller misstänkt tyst datakorruption, och sade att goodput, definierat som andelen klocktid som spenderas på träningssteg som behålls i den slutgiltiga modellen, nådde 92,3 procent.
Datapipelinen eliminerade cirka 95 procent av råa internet‑token genom parsning, deduplicering och kurering, medan Reflection sade att konventionella filtreringstekniker skulle ha missat ungefär 1,8 biljoner högkvalitativa token som de behöll, inklusive 87 procent av deras kurerade webb‑kod‑token. En separat pipeline bearbetade PDF‑artefakter med en vision‑språk‑OCR‑modell och interna kvalitetsklassificerare på tusentals GPU:er, och ett mellansteg i träningen förlängde Beams effektiva kontextlängd till en miljon token.
Inlägget beskriver en arkitektur som kombinerar interleaved lokal och global uppmärksamhet, finfördelade routade experter och lastbalansering utan hjälpförlust med cosinus‑avklingning av expert‑bias‑uppdateringar, tillsammans med djupbaserad residualskala, SandwichNorm, elementvis uppmärksamhetsgate och FP32‑residualackumulering. Reflection rapporterade nästan jämn expertutnyttjning, där den mest belastade expertens last i genomsnitt var 1,04 gånger medelvärdet vid slutet av förträningen, samt begränsade residual‑ström‑normer i alla 52 lager.
Hög‑beräkningsförstärkningsinlärning
Förstärkningsinlärningskampanjen genererade mer än 100 miljoner rollouts på 10 500 NVIDIA GB300‑GPU:er under fyra veckor, med en maximal kontextlängd på 256 000 token och ungefär 1,3 miljarder sandlådor som användes för träning och bedömning. Reflection sade att de hämtade nästan en miljon kodnings‑, agent‑ och STEM‑miljöer, främst genom syntetiska data-pipelines, och beskrev insatsen som vad de tror är en av de största RL‑körningarna som någonsin utförts av ett öppet laboratorium.
Företaget rapporterade att de upprätthöll i genomsnitt 110 000 samtidiga utrullningar och upp till 170 000 samtidiga sandlådor, med mer än en miljard förfrågningar om sandlåde‑skapande som bearbetades över mer än 20 kluster, två moln och fyra regioner. Nya vikter nådde inferensflottan med en median på ungefär 12 sekunder, 71 inferensincidenter hanterades utan att avbryta träningsjobbet, och dynamisk packning höll träningsbatcherna i genomsnitt 99,99 % fyllda. Reflection sade att det asynkrona systemet förblev stabilt även när det lärde sig från prover upp till 107 viktversioner, ungefär en dag, bakom den nuvarande policyn.
Säkerhet och anpassning
För anpassning tränade Reflection en andra modell från samma förtränade checkpoint med en separat övervakad finjustering och RL‑pipeline inriktad på beteendeprinciper, och sammanslog den sedan med den storskaliga RL‑läraren genom multi‑lärare on‑policy‑destillation. Principerna är organiserade i tre nivåer: regler som modellen inte får bryta, egenskaper den bör uppfylla konsekvent, och en standardinteraktionsstil.
Säkerhetsdatamängden byggdes upp på ett adversariellt och iterativt sätt, där varje rundas lyckade attacker införlivades i nästa träningsrunda, och säkerhets‑RL omfattade enstaka tur, flertur, jailbreak‑ och agentiska scenarier där en simulerad motståndare pressar en verktygsanvändande modell. Reflection sade att de kunde förutsäga RL‑vinster bättre än enbart ett Best‑of‑N‑tak, med en korrelation på 0,79 jämfört med 0,46 för taket. Företaget meddelade att de kommer att publicera sina säkerhetsutvärderingsresultat i Beams tekniska rapport och att de kommer att öppna källkoden för de interna säkerhetsutvärderingar de utvecklat.
Tillgänglighet och partnerskap
På sin om‑sidan beskriver Reflection åtaganden att släppa modellvikter, publicera sin forskning och öppna källkoden för mjukvara, inklusive verktyg och miljöer för förstärkningsinlärning. Sidan anger att Reflection är validerad på Dell AI Factory med NVIDIA, att de är en certifierad konsortiemedlem i Department of Energy:s Genesis‑mission, som betjänar de 17 amerikanska nationella laboratorierna med sina öppna viktsmodeller, och att de bygger ett 250‑megawatt suveränt AI‑moln i Sydkorea tillsammans med Shinsegae, med stöd från USA:s och Sydkoreas regeringar.
Reflection sade att de kommer att släppa Beams vikter under en Apache 2.0‑licens senare i oktober 2026, tillsammans med en teknisk rapport, modellkort, dokumentation och hela stacken för att köra, utvärdera och finjustera modellen, med distributionspartners och integrationer med öppen‑källkods‑bibliotek och verktyg planerade för lansering.












