AI-modeller og platforme
Reflection AI præsenterer Beam, en 501‑milliardparameter Open‑Weight‑model

Reflection AI introducerede Beam den 5. oktober 2026, sin første open-weight-model: et sparsomt Mixture-of-Experts-system med i alt 501 milliarder parametre og 23 milliarder aktive, bygget til kodning, ræsonnement og agentbaserede arbejdsbelastninger.
Beam gennemgår nu endelig red‑team‑test og evalueringer, og en tidlig version tilbydes en udvalgt gruppe brugere via en venteliste. Reflection beskrev Beam som den første model i en serie og sagde, at den allerede træner det, der kommer derefter.
Kapabilitet og effektivitetspåstande
Reflection oplyste, at de trænede Beam med særlig fokus på kodning og agentbaseret ydeevne. Virksomheden beskrev modellen som konkurrencedygtig med større åbne modeller såsom GLM 5.2 og som nærgående Qwen 3.8‑Max på kodnings‑ og agentopgaver, mens de anerkendte, at Kimi K3 stadig ligger foran på rå kapabilitet; de karakteriserede Beams fordel som effektivitet i inferencetid og sagde, at modellen fremmer det, de kalder den vestlige open‑weight‑front.
Resultater, som Reflection rapporterede fra sin evalueringssuite, omfatter 80.1 på Terminal Bench v2.1, 80.9 på SWEBench Verified, 77.2 på SWE Bench Pro v2-Hard, 97.8 på AIME 2026, 36.2 på Humanity’s Last Exam uden værktøjer og 90.5 på GPQA Diamond.
Med hensyn til effektivitet rapporterede virksomheden, at Beam opnår resultater, der er sammenlignelige med GLM‑5.2 på avancerede ræsonnement‑benchmarks, mens den bruger tre til fire gange mindre inferenceregnere, med større gevinster mod modeller med mere end to billioner parametre, såsom Qwen 3.8‑Max. Ifølge indlægget baserer estimaterne sig på Artificial Analysis og DataCurve-data og anslår genereringsberegning som to gange antallet af aktive parametre multipliceret med gennemsnitligt genererede token pr. forsøg; da tallene udelader prompt‑prefill, opmærksomhedsoperationer og serveringsoverhead, beskrev Reflection dem som en omtrentlig beregningssammenligning snarere end en målt inferencomkostning.
Reflection oplyste, at de også trænede Beam med en kontrollerbar længdestraffe, der belønner succesfulde løsninger, mens den afskrækker unødvendige token, og at en brugerrettet ræsonnement‑indsats‑parameter giver brugerne mulighed for at afveje token‑forbrug mod ydeevne, hvor lavere indstillinger favoriserer kortere svar, og højere indstillinger tillader længere ræsonnement på krævende opgaver.
Meddelelsen rapporterer, at kapabiliteterne generaliserede ud over træningsblandingen: under forstærkningslæring på ræsonnement, softwareudvikling og terminalopgaver forbedredes browserpræstationen på trods af fraværet af browseropgaver, og med webadgang lærte modellen på egen hånd at forespørge andre store sprogmodeller og at bruge OCR‑API’er til at læse dokumenter. Demonstrationerne omfatter et live‑opdaterende New York City‑metro kort bygget på offentlige MTA‑data, et 3D‑astronautspil skrevet i p5.js og et land‑eller‑vand‑puslespil, hvor Beam klassificerede punkter på et globalt koordinatgitter med 16.200 punkter med 95,5 % dækning, et resultat som indlægget placerer mellem Opus 5 med 92,5 % og Fable 5 med 97,8 %. I en fjerde demonstration producerede Beam en notebook, der finjusterede den mindste Gemma‑4‑model på en Text2SQL‑opgave, hvilket Reflection oplyste øgede Gemmas hold‑out‑testnøjagtighed med 66,5 %.
Træningspipeline
Fortræning og datakuration
Reflection oplyste, at de fortrænede Beam på 23,8 trillioner token hentet fra internettet, offentlige kilder og proprietære licenserede datasæt, og gennemførte kørslen fra start til slut på under fire uger på 6.144 NVIDIA GB300 NVL72 GPU’er. Virksomheden rapporterede ni semi‑automatiske tilbagerulninger, tilskrevet gradient‑norm‑spidser eller mistænkt tavs datakorruption, og sagde, at goodput, defineret som andelen af væg‑klokkeslættet brugt på træningsskridt, der bevares i den endelige model, nåede 92,3 %.
Datapipelinen eliminerede omkring 95 % af rå internettoken gennem parsing, deduplikering og kuratering, mens Reflection sagde, at konventionelle filtreringsteknikker ville have overset cirka 1,8 trillioner højkvalitets‑token, som den beholdt, inklusive 87 % af sine kuraterede web‑code‑token. En separat pipeline behandlede PDF‑artefakter ved hjælp af en vision‑sprog‑OCR‑model med interne kvalitetsklassifikatorer på tværs af tusinder af GPU’er, og et midttræningsstadie udvidede Beams effektive kontekstlængde til en million token.
Indlægget beskriver en arkitektur, der kombinerer indlejret lokal og global opmærksomhed, fin‑granulerede routed‑eksperter og belastningsbalancering uden hjælpetab med cosinus‑nedbrydning af ekspert‑bias‑opdateringer, sammen med dybde‑baseret residual‑skalering, SandwichNorm, element‑vis opmærksomhedsstyring og FP32‑residual‑akkumulering. Reflection rapporterede næsten ensartet ekspertudnyttelse, hvor den travleste eksperts belastning i gennemsnit var 1,04 gange gennemsnittet ved afslutningen af fortræning, samt begrænsede residual‑strøm‑normer på tværs af alle 52 lag.
Høj‑beregnings‑forstærkningslæring
Forstærkningslæringskampagnen genererede mere end 100 millioner rollouts på 10.500 NVIDIA GB300 GPU’er over fire uger, med en maksimal kontekstlængde på 256.000 token og cirka 1,3 milliarder sandkasser brugt til træning og bedømmelse. Reflection oplyste, at de indsamlede næsten én million kodnings‑, agent‑ og STEM‑miljøer, primært gennem syntetiske data-pipelines, og beskrev indsatsen som det, de mener er en af de største RL‑kørsler udført af et åbent laboratorium til dato.
Firmaet rapporterede, at de opretholdt i gennemsnit 110.000 samtidige udrulninger og op til 170.000 samtidige sandkasser, med mere end en milliard anmodninger om oprettelse af sandkasser behandlet på tværs af mere end 20 klynger, to skyer og fire regioner. Nye vægte nåede inferensflåden med en median på cirka 12 sekunder, 71 inferens‑hændelser blev håndteret uden at afbryde træningsjobbet, og dynamisk pakning holdt træningsbatcherne i gennemsnit 99,99 % fyldte. Reflection sagde, at det asynkrone system forblev stabilt, selv når der blev lært fra prøver med op til 107 vægt‑versioner, cirka en dag, bag den nuværende politik.
Sikkerhed og justering
For justering trænte Reflection en anden model fra den samme forudtrænede checkpoint ved hjælp af en separat supervisioneret finjustering og RL‑pipeline målrettet adfærdsmæssige principper, hvorefter den blev flettet sammen med den store‑skala RL‑lærer gennem multi‑lærer on‑policy destillation. Principperne er organiseret i tre niveauer: regler, som modellen ikke må overtræde, egenskaber, den skal opfylde konsekvent, og en standardinteraktionsstil.
Sikkerheds‑datasættet blev bygget på en modstanderisk og iterativ måde, hvor hver runde’s succesfulde angreb blev indarbejdet i den næste træningsrunde, og sikkerheds‑RL dækkede enkelt‑trins, multi‑trins, jailbreak‑ og agent‑scenarier, hvor en simuleret modstander presser en værktøjs‑brugende model. Reflection sagde, at de kunne forudsige RL‑gevinster bedre end kun et Best‑of‑N loft, og rapporterede en korrelation på 0,79 i forhold til 0,46 for loftet. Firmaet sagde, at de vil offentliggøre deres sikkerhedsevalueringsresultater i Beams tekniske rapport og vil open‑source de interne sikkerhedsevalueringer, de har udviklet.
Tilgængelighed og partnerskaber
På dens om‑side skitserer Reflection forpligtelser til at frigive modelvægte, offentliggøre sin forskning og open‑source software, herunder forstærknings‑læringsværktøjer og -miljøer. Siden angiver, at Reflection er valideret på Dell AI Factory med NVIDIA, at den er et certificeret konsortiummedlem af Department of Energy’s Genesis‑mission, der betjener de 17 amerikanske nationale laboratorier med sine open‑weight‑modeller, og at den bygger en 250‑megawatt suveræn AI‑sky i Sydkorea sammen med Shinsegae, støttet af de amerikanske og koreanske regeringer.
Reflection sagde, at de vil frigive Beams vægte under en Apache 2.0‑licens senere i oktober 2026, ledsaget af en teknisk rapport, modelkort, dokumentation og den fulde stack til at køre, evaluere og finjustere modellen, med distributionspartnere og integrationer med open‑source‑biblioteker og -værktøjer planlagt til lancering.












