AI-modeller og plattformer
Reflection AI lanserer Beam, en 501‑milliard‑parameter åpen‑vektmodell

Reflection AI presenterte Beam 5. oktober 2026, sin første åpen‑vektmodell: et sparsomt Mixture‑of‑Experts‑system med 501 milliarder totale parametere og 23 milliarder aktive, bygget for koding, resonnering og agentbaserte arbeidsbelastninger.
Beam gjennomgår nå siste red‑team‑testing og evalueringer, og en tidlig versjon tilbys til en utvalgt gruppe brukere via en venteliste. Reflection beskrev Beam som den første modellen i en serie og sa at den allerede trener på det som kommer neste.
Kapasitets‑ og effektivitetspåstander
Reflection sa at de trente Beam med spesielt fokus på koding og agentbasert ytelse. Selskapet beskrev modellen som konkurransedyktig med større åpne modeller som GLM 5.2 og som nærgående Qwen 3.8‑Max på kode‑ og agentoppgaver, samtidig som de innrømmer at Kimi K3 fortsatt ligger foran på rå kapasitet; de karakteriserte Beam sin fordel som effektivitet ved inferens‑tidspunkt og sa at modellen viderefører det de kaller den vestlige åpen‑vektfronten.
Resultatene Reflection rapporterte fra sin evalueringspakke inkluderer 80,1 på Terminal Bench v2.1, 80,9 på SWEBench Verified, 77,2 på SWE Bench Pro v2‑Hard, 97,8 på AIME 2026, 36,2 på Humanity’s Last Exam uten verktøy, og 90,5 på GPQA Diamond.
Når det gjelder effektivitet, rapporterte selskapet at Beam oppnår resultater som er sammenlignbare med GLM‑5.2 på avanserte resonnerings‑benchmarker mens det bruker tre til fire ganger mindre inferens‑beregning, med enda større gevinster mot modeller med mer enn to billioner parametere, som Qwen 3.8‑Max. Ifølge innlegget er estimatene basert på data fra Artificial Analysis og DataCurve og anslår generasjons‑beregning som to ganger antall aktive parametere multiplisert med gjennomsnittlig antall genererte token per forsøk; siden tallene ekskluderer prompt‑prefill, oppmerksomhetsoperasjoner og server‑overhead, beskrev Reflection dem som en omtrentlig beregnings‑sammenligning snarere enn en målt inferenskostnad.
Reflection sa også at de trente Beam med en kontrollerbar lengdestraff som belønner vellykkede løsninger samtidig som den avskyr unødvendige token, og at en bruker‑vendt resonnerings‑innsats‑parameter lar brukere bytte token‑bruk mot ytelse, med lavere innstillinger som favoriserer kortere svar og høyere innstillinger som tillater lengre resonnering på krevende oppgaver.
Kunngjøringen rapporterer at evnene generaliserte seg utover treningsblandingen: under forsterkningslæring på resonnering, programvareutvikling og terminaloppgaver, forbedret nettlesingsytelsen til tross for fraværet av nettlesingsoppgaver, og med nettilgang lærte modellen på egen hånd å spørre andre store språkmodeller og å bruke OCR‑APIer for å lese dokumenter. Demonstrasjoner inkluderer et live‑oppdaterende t-bane‑kart for New York City bygget på offentlige MTA‑data, et 3D‑astronautspill skrevet i p5.js, og et land‑eller‑vann‑puslespill der Beam klassifiserte punkter på et globalt koordinatgitter med 16 200 punkter med 95,5 % dekning, et resultat innlegget plasserer mellom Opus 5 på 92,5 % og Fable 5 på 97,8 %. I en fjerde demonstrasjon produserte Beam en notatbok som finjusterte den minste Gemma‑4‑modellen på en Text2SQL‑oppgave, noe Reflection sa økte Gemmas test‑nøyaktighet på hold‑out‑settet med 66,5 %.
Trenings‑pipeline
For‑trening og datakuring
Reflection sa at de for‑trente Beam på 23,8 trillioner token hentet fra nettet, offentlige kilder og proprietære lisensierte datasett, og fullførte kjøringen fra start til slutt på under fire uker på 6 144 NVIDIA GB300 NVL72 GPU‑er. Selskapet rapporterte ni semi‑automatiske tilbake‑spolinger, tilskrevet gradient‑norm‑spisser eller mistenkt stille datakorrupsjon, og sa at goodput, definert som andelen av vegg‑klokkeslett brukt på treningssteg som beholdes i den endelige modellen, nådde 92,3 %.
Datapipelinen fjernet omtrent 95 % av rå internett‑token gjennom parsing, deduplikasjon og kurering, mens Reflection sa at konvensjonelle filtreringsteknikker ville ha gått glipp av omtrent 1,8 trillioner høykvalitets‑token den beholdt, inkludert 87 % av sine kuraterte web‑kode‑token. En separat pipeline behandlet PDF‑artefakter ved hjelp av en visjon‑språk OCR‑modell med interne kvalitetsklassifikatorer på tvers av tusenvis av GPU‑er, og et midt‑treningsstadium utvidet Beam sin effektive kontekstlengde til én million token.
Innlegget beskriver en arkitektur som kombinerer vevd lokal og global oppmerksomhet, fin‑granulære rutede eksperter, og lastbalansering uten hjelpe‑tap med kosinus‑nedgang av ekspert‑bias‑oppdateringer, sammen med dybde‑basert residual‑skalering, SandwichNorm, element‑vis oppmerksomhets‑gating og FP32‑residual‑akkumulering. Reflection rapporterte nesten jevn ekspert‑utnyttelse, med den travleste ekspertens belastning som i gjennomsnitt var 1,04 ganger gjennomsnittet ved slutten av for‑treningen, og avgrensede residual‑strøm‑normer på tvers av alle 52 lag.
Høykapasitets‑forsterknings‑læring
Forsterknings‑læringskampanjen genererte mer enn 100 millioner rollouts på 10 500 NVIDIA GB300 GPU‑er over fire uker, med en maksimal kontekstlengde på 256 000 token og omtrent 1,3 billioner sandkasser brukt til trening og vurdering. Reflection sa at de hentet nesten én million kode‑, agent‑ og STEM‑miljøer, hovedsakelig gjennom syntetiske data-pipelines, og beskrev innsatsen som det de mener er en av de største RL‑kjøringene utført av et åpent laboratorium til dags dato.
Selskapet rapporterte at de opprettholdt i gjennomsnitt 110 000 samtidige utrullinger og opptil 170 000 samtidige sandkasser, med mer enn én milliard forespørsler om sandkasseopprettelse behandlet på over 20 klynger, to skyer og fire regioner. Nye vekter nådde inferensflåten med en median på omtrent 12 sekunder, 71 inferens‑hendelser ble håndtert uten å avbryte treningsjobben, og dynamisk pakking holdt treningsbatcher i gjennomsnitt 99,99 % fylt. Reflection sa at det asynkrone systemet forble stabilt selv når det lærte fra prøver med opptil 107 vektversjoner, omtrent én dag, bak gjeldende policy.
Sikkerhet og justering
For justering trente Reflection en andre modell fra samme forhåndstrente sjekkpunkt ved hjelp av en separat overvåket finjustering‑ og RL‑pipeline rettet mot atferdsprinsipper, og deretter flettet den sammen med den stor‑skala RL‑læreren gjennom multi‑lærer on‑policy‑destillasjon. Prinsippene er organisert i tre nivåer: regler modellen ikke må bryte, egenskaper den skal oppfylle konsekvent, og en standard interaksjonsstil.
Sikkerhetsdatasettet ble bygget på en motstandsbasert og iterativ måte, der hver runde sine vellykkede angrep ble foldet inn i neste treningsrunde, og sikkerhets‑RL dekket enkelt‑turn, multi‑turn, jailbreak‑ og agent‑scenarier der en simulert motstander presser en verktøy‑brukende modell. Reflection sa at de kunne forutsi RL‑gevinster bedre enn kun et Best‑of‑N‑tak, og rapporterte en korrelasjon på 0,79 mot 0,46 for taket. Selskapet sa at de vil publisere sine sikkerhetsvurderingsresultater i Beam sin tekniske rapport og vil gjøre de interne sikkerhetsvurderingene de utviklet tilgjengelige som åpen kildekode.
Tilgjengelighet og partnerskap
På sin om‑siden beskriver Reflection forpliktelser til å frigi modellvekter, publisere sin forskning og gjøre programvare åpen kildekode, inkludert forsterknings‑læringsverktøy og -miljøer. Siden oppgir at Reflection er validert på Dell AI Factory med NVIDIA, at de er et sertifisert konsortiummedlem av Department of Energy sin Genesis Mission, som betjener de 17 amerikanske nasjonale laboratoriene med sine åpne‑vekt‑modeller, og at de bygger en 250‑megawatt suveren AI‑sky i Sør‑Korea sammen med Shinsegae, støttet av USA‑ og Sør‑Korea‑regjeringene.
Reflection sa at de vil frigi Beam sine vekter under en Apache 2.0‑lisens senere i oktober 2026, ledsaget av en teknisk rapport, modellkort, dokumentasjon og hele stacken for å kjøre, evaluere og finjustere modellen, med distribusjonspartnere og integrasjoner med åpen‑kilde‑biblioteker og verktøy planlagt for lansering.












