Modele i platformy AI
Reflection AI prezentuje Beam, model Open-Weight z 501 miliardami parametrów

Reflection AI wprowadziła Beam 5 października 2026, swojego pierwszego modelu Open-Weight: rzadkiego systemu Mixture-of-Experts z 501 miliardami parametrów łącznie i 23 miliardami aktywnych, zaprojektowanego do programowania, rozumowania i zadań agentowych.
Beam przechodzi ostatnie testy red‑teamingu i oceny, a wczesna wersja jest udostępniana wybranej grupie użytkowników za pośrednictwem listy oczekujących. Reflection opisała Beam jako pierwszy model w serii i poinformowała, że już trenuje kolejny etap.
Twierdzenia dotyczące możliwości i wydajności
Reflection poinformowała, że wytrenowała Beam ze szczególnym naciskiem na wydajność w programowaniu i zadaniach agentowych. Firma opisała model jako konkurencyjny wobec większych otwartych modeli, takich jak GLM 5.2, oraz zbliżający się do Qwen 3.8‑Max w zadaniach programistycznych i agentowych, przy jednoczesnym przyznaniu, że Kimi K3 pozostaje przewyższający pod względem surowej zdolności; podkreśliła, że przewagą Beam jest efektywność w czasie inferencji i stwierdziła, że model posuwa naprzód to, co nazywa zachodnią granicą Open‑Weight.
Wyniki, które Reflection podała w swoim zestawie ocen, obejmują 80,1 w Terminal Bench v2.1, 80,9 w SWEBench Verified, 77,2 w SWE Bench Pro v2‑Hard, 97,8 w AIME 2026, 36,2 w Humanity’s Last Exam bez narzędzi oraz 90,5 w GPQA Diamond.
Jeśli chodzi o wydajność, firma podała, że Beam osiąga wyniki porównywalne z GLM‑5.2 w zaawansowanych benchmarkach rozumowania, przy jednoczesnym zużyciu trzykrotnie‑czterokrotnie mniejszej mocy obliczeniowej podczas inferencji, a korzyści są jeszcze większe w stosunku do modeli posiadających ponad dwa biliony parametrów, takich jak Qwen 3.8‑Max. Według wpisu szacunki opierają się na danych z Artificial Analysis i DataCurve oraz przybliżają koszt generacji jako podwójną liczbę aktywnych parametrów pomnożoną przez średnią liczbę wygenerowanych tokenów na próbę; ponieważ liczby nie uwzględniają wstępnego wypełniania promptu, operacji uwagi ani narzutu serwowania, Reflection opisała je jako przybliżone porównanie mocy obliczeniowej, a nie zmierzone koszty inferencji.
Reflection poinformowała, że wytrenowała Beam także z kontrolowanym karą za długość, która nagradza udane rozwiązania, jednocześnie zniechęcając do niepotrzebnych tokenów, oraz że parametr wysiłku rozumowania dostępny dla użytkownika pozwala wymieniać zużycie tokenów na wydajność – niższe ustawienia sprzyjają krótszym odpowiedziom, a wyższe umożliwiają dłuższe rozumowanie w wymagających zadaniach.
W komunikacie podano, że możliwości uogólniły się poza mieszankę treningową: podczas uczenia ze wzmocnieniem w zakresie rozumowania, inżynierii oprogramowania i zadań terminalnych, wydajność przeglądania poprawiła się mimo braku zadań przeglądania, a przy dostępie do sieci model samodzielnie nauczył się odpytywać inne duże modele językowe oraz korzystać z interfejsów OCR do odczytu dokumentów. Demonstracje obejmują mapę metra Nowego Jorku aktualizowaną na żywo, opartą na publicznych danych MTA, grę 3‑D z astronautą napisaną w p5.js oraz zagadkę ląd‑lub‑woda, w której Beam klasyfikował punkty na globalnej siatce 16 200 punktów, osiągając 95,5 % pokrycia – wynik umieszczony przez wpis pomiędzy Opus 5 (92,5 %) a Fable 5 (97,8 %). W czwartej demonstracji Beam wygenerował notebook, w którym dopasowano najmniejszy model Gemma‑4 do zadania Text2SQL, co, jak podała Reflection, podniosło dokładność testu odłożonego Gemmy o 66,5 %.
Pipeline treningowy
Pre‑trening i kuracja danych
Reflection poinformowała, że przeprowadziła pre‑trening Beam na 23,8 biliona tokenów pochodzących z sieci, źródeł publicznych oraz własnych licencjonowanych zbiorów danych, kończąc proces w mniej niż cztery tygodnie na 6 144 NVIDIA GB300 NVL72 GPU. Firma zgłosiła dziewięć półautomatycznych cofnięć, przypisanych skokom normy gradientu lub podejrzanej cichej korupcji danych, i podała, że wskaźnik goodput, definiowany jako odsetek czasu rzeczywistego poświęconego na kroki treningowe zachowane w ostatecznym modelu, osiągnął 92,3 %.
Pipeline danych wyeliminował około 95 % surowych tokenów internetowych poprzez parsowanie, deduplikację i kurację, podczas gdy Reflection podkreśliła, że tradycyjne techniki filtrowania pominęłyby około 1,8 biliona wysokiej jakości tokenów, które zachowano, w tym 87 % kurowanych tokenów kodu internetowego. Oddzielny pipeline przetwarzał artefakty PDF przy użyciu modelu OCR łączącego wizję i język oraz wewnętrznych klasyfikatorów jakości na tysiącach GPU, a etap środkowego treningu wydłużył efektywną długość kontekstu Beam do jednego miliona tokenów.
Wpis opisuje architekturę łączącą przeplatane lokalne i globalne uwagi, drobno‑ziarnistych ekspertów z trasowaniem oraz równoważenie obciążenia bez dodatkowych strat przy użyciu kosinusowego zaniku aktualizacji biasu ekspertów, wraz ze skalowaniem rezydualnym opartym na głębokości, SandwichNorm, elementarnym bramkowaniem uwagi oraz akumulacją rezydualną w FP32. Reflection podała, że wykorzystanie ekspertów było prawie jednorodne, przy czym obciążenie najbardziej zajętego eksperta średnio wynosiło 1,04‑krotność średniej pod koniec pre‑treningu, a normy strumieni rezydualnych były ograniczone we wszystkich 52 warstwach.
Uczenie ze wzmocnieniem przy wysokiej mocy obliczeniowej
Kampania uczenia ze wzmocnieniem wygenerowała ponad 100 milionów rolloutów na 10 500 GPU NVIDIA GB300 w ciągu czterech tygodni, przy maksymalnej długości kontekstu 256 000 tokenów i około 1,3 miliarda piaskownic używanych do treningu i oceny. Reflection poinformowała, że pozyskała prawie milion środowisk programistycznych, agentowych i STEM, głównie poprzez syntetyczne dane w pipeline’ach, i opisała to przedsięwzięcie jako jedno z największych uruchomień RL prowadzonych dotąd przez otwarty laboratorium.
Firma poinformowała, że utrzymuje średnio 110 000 równoczesnych wdrożeń i do 170 000 równoczesnych piaskownic, przy przetworzeniu ponad miliarda żądań tworzenia piaskownic w ponad 20 klastrach, dwóch chmurach i czterech regionach. Nowe wagi dotarły do floty inferencyjnej w medianie około 12 sekund, 71 incydentów inferencyjnych obsłużono bez przerywania zadania treningowego, a dynamiczne pakowanie utrzymywało partie treningowe w średniej w 99,99 % pełności. Reflection stwierdziło, że system asynchroniczny pozostał stabilny nawet przy uczeniu się z próbek obejmujących do 107 wersji wag, czyli mniej więcej jeden dzień, za aktualną polityką.
Bezpieczeństwo i Zgodność
W celu zapewnienia zgodności, Reflection wytrenowało drugi model z tego samego wstępnie wytrenowanego punktu kontrolnego, wykorzystując oddzielny nadzorowany proces dostrajania oraz pipeline RL skierowany na zasady zachowań, a następnie połączyło go z dużym modelem nauczyciela RL poprzez wielonauczycielską destylację on‑policy. Zasady są podzielone na trzy poziomy: reguły, których model nie może łamać, cechy, które powinien konsekwentnie spełniać, oraz domyślny styl interakcji.
Zbiór danych bezpieczeństwa został zbudowany w sposób adwersarialny i iteracyjny, przy czym udane ataki z każdej rundy włączano do kolejnej rundy treningu, a bezpieczeństwo RL obejmowało scenariusze jednorazowe, wieloetapowe, jailbreak oraz agenty, w których symulowany przeciwnik wywiera presję na model używający narzędzi. Reflection stwierdziło, że potrafi przewidywać zyski RL lepiej niż sam limit Best‑of‑N, raportując korelację 0,79 w porównaniu do 0,46 dla tego limitu. Firma poinformowała, że opublikuje wyniki oceny bezpieczeństwa w raporcie technicznym Beam oraz udostępni jako open source wewnętrzne oceny bezpieczeństwa, które opracowała.
Dostępność i Partnerstwa
Na swojej stronie o nas, Reflection przedstawia zobowiązania do udostępniania wag modeli, publikowania badań oraz otwarto‑źródłowego udostępniania oprogramowania, w tym narzędzi i środowisk uczenia ze wzmocnieniem. Strona stwierdza, że Reflection jest zweryfikowane w Dell AI Factory przy współpracy z NVIDIA, że jest certyfikowanym członkiem konsorcjum Genesis Mission Departamentu Energii, obsługując 17 amerykańskich laboratoriów narodowych swoimi modelami otwartymi, oraz że buduje 250‑megawatowy suwerenny chmurę AI w Korei Południowej we współpracy z Shinsegae, wspieraną przez rządy USA i Korei.
Reflection poinformowało, że udostępni wagi Beam na licencji Apache 2.0 pod koniec października 2026, wraz z raportem technicznym, kartą modelu, dokumentacją oraz pełnym zestawem narzędzi do uruchamiania, oceny i dostrajania modelu, a także planuje partnerów dystrybucyjnych i integracje z bibliotekami open‑source oraz harnessami przy uruchomieniu.












