Modely a platformy AI
Reflection AI představuje Beam, model s 501 miliardami parametrů a otevřenou vahou

Reflection AI představil Beam dne 5. října 2026, svůj první model s otevřenou vahou: řídký systém Mixture-of-Experts s celkem 501 miliardami parametrů a 23 miliardami aktivních, určený pro programování, logické uvažování a agentní úlohy.
Beam prochází závěrečným red‑teamováním a hodnocením a raná verze je nabízená vybrané skupině uživatelů prostřednictvím čekací listiny. Reflection popsal Beam jako první model v sérii a uvedl, že již trénuje to, co přijde dál.
Tvrzení o schopnostech a efektivitě
Reflection uvedl, že trénoval Beam se zvláštním zaměřením na programování a agentní výkon. Společnost popisovala model jako konkurenceschopný s většími otevřenými modely, jako je GLM 5.2, a jako se blížící k Qwen 3.8‑Max v programovacích a agentních úlohách, přičemž přiznala, že Kimi K3 zůstává předním v surové kapacitě; charakterizovala výhodu Beam jako efektivitu během inferencí a uvedla, že model posouvá to, co nazývá západní hranicí otevřených vah.
Výsledky, které Reflection uvedl ve svém hodnoticím souboru, zahrnují 80,1 v Terminal Bench v2.1, 80,9 v SWEBench Verified, 77,2 v SWE Bench Pro v2‑Hard, 97,8 v AIME 2026, 36,2 v Humanity’s Last Exam bez nástrojů a 90,5 v GPQA Diamond.
Co se týče efektivity, společnost uvedla, že Beam dosahuje výsledků srovnatelných s GLM‑5.2 v pokročilých benchmarkech pro uvažování, přičemž spotřebuje třikrát až čtyřikrát méně výpočetního výkonu při inferenci, s většími zisky oproti modelům s více než dvěma biliony parametrů, jako je Qwen 3.8‑Max. Podle příspěvku jsou odhady založeny na datech z Artificial Analysis a DataCurve a aproximují výpočet generování jako dvojnásobek počtu aktivních parametrů vynásobený průměrným počtem vygenerovaných tokenů na pokus; protože čísla nezahrnují předvyplnění promptu, operace pozornosti ani režii služby, Reflection je popsal jako přibližné srovnání výpočetního výkonu spíše než měřený náklad inferencí.
Reflection uvedl, že také trénoval Beam s ovladatelným trestem za délku, který odměňuje úspěšná řešení a odrazuje od zbytečných tokenů, a že parametr úsilí při uvažování, přístupný uživatelům, umožňuje uživatelům vyvažovat spotřebu tokenů vůči výkonu; nižší nastavení upřednostňuje kratší odpovědi a vyšší nastavení umožňuje delší uvažování u náročných úloh.
Oznámení uvádí, že schopnosti se generalizovaly mimo tréninkovou směs: během posilovacího učení na úlohách uvažování, softwarového inženýrství a terminálových úloh se výkon procházení zlepšil i přes absenci úloh procházení, a s přístupem k webu se model samostatně naučil dotazovat jiné velké jazykové modely a používat OCR API k čtení dokumentů. Demonstrace zahrnují živě aktualizovanou mapu metra v New Yorku vytvořenou z veřejných dat MTA, 3D hru s astronautem napsanou v p5.js a hádanku „země‑nebo‑voda“, ve které Beam klasifikoval body na globální souřadnicové mřížce o 16 200 bodech s 95,5 % pokrytím, výsledek, který příspěvek umisťuje mezi Opus 5 s 92,5 % a Fable 5 s 97,8 %. Ve čtvrté demonstraci Beam vytvořil notebook, který doladí nejmenší model Gemma‑4 na úkol Text2SQL, což podle Reflection zvýšilo přesnost Gemma v testu na držených datech o 66,5 %.
Tréninková pipeline
Předtrénink a kurace dat
Reflection uvedl, že předtrénoval Beam na 23,8 bilionu tokenů získaných z webu, veřejných zdrojů a proprietárních licencovaných datových sad, přičemž dokončil celý běh za méně než čtyři týdny na 6 144 NVIDIA GB300 NVL72 GPU. Společnost oznámila devět semi‑automatických přehrání, přičítaných výkyvům gradient‑normy nebo podezřelé tiché poškození dat, a uvedla, že goodput, definovaný jako podíl času na reálném hodinovém čase stráveného tréninkovými kroky zachovanými v konečném modelu, dosáhl 92,3 %.
Datová pipeline eliminovala přibližně 95 % surových internetových tokenů pomocí parsování, deduplikace a kurace, zatímco Reflection uvedl, že konvenční filtrační techniky by přehlédly zhruba 1,8 bilionu vysoce kvalitních tokenů, které si zachoval, včetně 87 % svých kurátorských web‑code tokenů. Samostatná pipeline zpracovávala PDF artefakty pomocí vision‑language OCR modelu s interními klasifikátory kvality na tisících GPU a střední fáze tréninku prodloužila efektivní délku kontextu Beam na jeden milion tokenů.
Příspěvek popisuje architekturu kombinující prokládanou lokální a globální pozornost, jemně řízené směrované experty a vyvážení zátěže bez pomocných ztrát s kosinovým úbytkem aktualizací biasu expertů, spolu s hloubkově založeným škálováním reziduí, SandwichNorm, elementwise attention gating a akumulací reziduí ve FP32. Reflection uvedl téměř rovnoměrné využití expertů, přičemž zátěž nejvytíženějšího experta se na konci předtréninku průměrně rovná 1,04‑násobku průměru, a omezené normy reziduálního proudu napříč všemi 52 vrstvami.
Vysokovýkonné posilovací učení
Kampaň posilovacího učení vygenerovala více než 100 milionů rollouts na 10 500 NVIDIA GB300 GPU během čtyř týdnů, s maximální délkou kontextu 256 000 tokenů a přibližně 1,3 miliardy sandboxů použitých pro trénink a hodnocení. Reflection uvedl, že získal téměř jeden milion programovacích, agentních a STEM prostředí, převážně prostřednictvím syntetických dat pipeline, a popsal úsilí jako jedno z největších provedených RL běhů otevřenou laboratoří doposud.
Společnost uvedla, že udržuje průměrně 110 000 souběžných nasazení a až 170 000 souběžných sandboxů, přičemž bylo zpracováno více než miliardu požadavků na vytvoření sandboxu napříč více než 20 clustery, dvěma cloudy a čtyřmi regiony. Nové váhy dosáhly inferenční flotily v mediánu přibližně 12 sekund, 71 inferenčních incidentů bylo vyřešeno bez ukončení tréninkového úkolu a dynamické balení udržovalo tréninkové batchi v průměru z 99,99 % plné kapacity. Reflection uvedla, že asynchronní systém zůstal stabilní i při učení ze vzorků až 107 verzí vah, zhruba jeden den, za současnou politikou.
Bezpečnost a sladění
Pro sladění trénovala společnost Reflection druhý model ze stejného předtrénovaného kontrolního bodu pomocí samostatného řízeného doladění a RL pipeline zaměřené na behaviorální principy, poté jej sloučila s velkorozměrovým RL učitelem pomocí multi‑učitelského on‑policy destilace. Principy jsou uspořádány ve třech úrovních: pravidla, která model nesmí porušovat, vlastnosti, které by měl důsledně splňovat, a výchozí styl interakce.
Bezpečnostní datová sada byla vytvořena adversariálně a iterativně, přičemž úspěšné útoky z každého kola byly začleněny do dalšího kola tréninku, a bezpečnostní RL pokrývala scénáře jednorázové, vícekolové, jailbreak a agentické, ve kterých simulovaný protivník tlačí na model používající nástroje. Reflection uvedla, že dokáže předpovídat RL zisky lépe než samotný strop Best‑of‑N, přičemž hlásí korelaci 0,79 oproti 0,46 pro strop. Společnost uvedla, že zveřejní výsledky své bezpečnostní evaluace v technické zprávě Beam a otevřeně zpřístupní interní bezpečnostní hodnocení, která vyvinula.
Dostupnost a partnerství
Na své o stránce Reflection uvádí závazky k uvolňování vah modelu, publikování svého výzkumu a otevřenému zdrojovému kódu softwaru, včetně nástrojů a prostředí pro posilovací učení. Stránka uvádí, že Reflection je ověřena na Dell AI Factory s NVIDIA, že je certifikovaným členem konsorcia mise Genesis Ministerstva energetiky USA, slouží 17 americkým národním laboratořím se svými otevřenými modely a že buduje 250‑megawatový suverénní AI cloud v Jižní Koreji se společností Shinsegae, podporovaný vládami USA a Koreje.
Reflection uvedla, že v říjnu 2026 později uvolní váhy Beam pod licencí Apache 2.0, doprovázené technickou zprávou, modelovou kartou, dokumentací a kompletním stackem pro spouštění, vyhodnocování a doladění modelu, přičemž jsou naplánováni distribuční partneři a integrace s open‑source knihovnami a rozhraními.












