Model dan platform AI
Reflection AI Memperkenalkan Beam, Model Open-Weight 501 Miliar Parameter

Reflection AI memperkenalkan Beam pada 5 Oktober 2026, model open-weight pertamanya: sistem Mixture-of-Experts yang jarang dengan total 501 billion total parameters dan 23 billion active, dibangun untuk coding, reasoning, dan agentic workloads.
Beam sedang menjalani final red‑teaming dan evaluasi, dan versi awalnya ditawarkan kepada sekelompok pengguna terpilih melalui waitlist. Reflection menggambarkan Beam sebagai model pertama dalam serinya dan mengatakan bahwa model ini sudah melatih apa yang akan datang berikutnya.
Klaim Kapabilitas dan Efisiensi
Reflection mengatakan bahwa mereka melatih Beam dengan fokus khusus pada kinerja coding dan agentic. Perusahaan menggambarkan model ini kompetitif dengan model open yang lebih besar seperti GLM 5.2 dan mendekati Qwen 3.8-Max pada tugas coding dan agentic, sambil mengakui bahwa Kimi K3 tetap unggul dalam kemampuan mentah; mereka menyatakan keunggulan Beam terletak pada efisiensi saat inferensi dan mengatakan model ini memajukan apa yang mereka sebut frontier open-weight Barat.
Skor yang dilaporkan Reflection dari rangkaian evaluasinya meliputi 80.1 pada Terminal Bench v2.1, 80.9 pada SWEBench Verified, 77.2 pada SWE Bench Pro v2-Hard, 97.8 pada AIME 2026, 36.2 pada Humanity’s Last Exam tanpa tools, dan 90.5 pada GPQA Diamond.
Mengenai efisiensi, perusahaan melaporkan bahwa Beam mencapai skor yang sebanding dengan GLM-5.2 pada benchmark penalaran lanjutan sambil menggunakan tiga hingga empat kali lebih sedikit komputasi inferensi, dengan peningkatan yang lebih besar dibandingkan model dengan lebih dari dua triliun parameter, seperti Qwen 3.8-Max. Menurut postingan tersebut, perkiraan tersebut didasarkan pada data Artificial Analysis dan DataCurve serta memperkirakan komputasi generasi sebagai dua kali jumlah parameter aktif dikalikan rata‑rata token yang dihasilkan per percobaan; karena angka-angka tersebut tidak memasukkan pengisian prompt, operasi perhatian, dan overhead layanan, Reflection menggambarkannya sebagai perbandingan komputasi perkiraan bukan biaya inferensi terukur.
Reflection menyatakan bahwa mereka juga melatih Beam dengan penalti panjang yang dapat dikendalikan yang memberi penghargaan pada solusi berhasil sekaligus mengurangi token yang tidak perlu, dan bahwa parameter upaya penalaran yang terlihat oleh pengguna memungkinkan pengguna menukar penggunaan token dengan kinerja, dengan pengaturan rendah memberikan respons yang lebih singkat dan pengaturan tinggi memungkinkan penalaran yang lebih panjang pada tugas yang menuntut.
Pengumuman tersebut melaporkan bahwa kapabilitas meluas melampaui campuran pelatihan: selama reinforcement learning pada penalaran, rekayasa perangkat lunak, dan tugas terminal, kinerja penelusuran meningkat meskipun tidak ada tugas penelusuran, dan dengan akses web model belajar secara mandiri untuk menanyakan model bahasa besar lainnya dan menggunakan API OCR untuk membaca dokumen. Demonstrasi meliputi peta subway Kota New York yang diperbarui secara langsung yang dibangun dari data publik MTA, sebuah permainan astronot 3D yang ditulis dalam p5.js, dan teka‑teki darat‑atau‑air di mana Beam mengklasifikasikan titik pada kisi koordinat global berjumlah 16,200 titik dengan cakupan 95.5 percent, hasil yang ditempatkan postingan antara Opus 5 dengan 92.5 percent dan Fable 5 dengan 97.8 percent. Pada demonstrasi keempat, Beam menghasilkan notebook yang melakukan fine‑tuning pada model Gemma-4 terkecil untuk tugas Text2SQL, yang menurut Reflection meningkatkan akurasi tes heldout Gemma sebesar 66.5 percent.
Pipeline Pelatihan
Pra‑pelatihan dan Kurasi Data
Reflection mengatakan bahwa mereka melakukan pra‑pelatihan Beam pada 23.8 trillion tokens yang diambil dari web, sumber publik, dan dataset berlisensi proprietari, menyelesaikan proses secara menyeluruh dalam kurang dari empat minggu pada 6,144 NVIDIA GB300 NVL72 GPU. Perusahaan melaporkan sembilan semi‑automatic rewinds, yang disebabkan oleh lonjakan gradient‑norm atau dugaan korupsi data diam, dan menyatakan bahwa goodput, yang didefinisikan sebagai proporsi waktu wall‑clock yang dihabiskan untuk langkah pelatihan yang dipertahankan dalam model akhir, mencapai 92.3 percent.
Pipeline data mengeliminasi sekitar 95 percent token internet mentah melalui parsing, deduplication, dan curation, sementara Reflection mengatakan teknik penyaringan konvensional akan melewatkan kira‑kira 1.8 trillion high-quality tokens yang dipertahankannya, termasuk 87 percent token web-code yang dikurasi. Pipeline terpisah memproses artefak PDF menggunakan model OCR visi‑bahasa dengan classifier kualitas internal pada ribuan GPU, dan tahap pertengahan pelatihan memperpanjang panjang konteks efektif Beam menjadi satu juta token.
Postingan tersebut menggambarkan arsitektur yang menggabungkan perhatian lokal dan global yang berselang-seling, pakar ber‑rute halus, dan penyeimbangan beban tanpa kerugian tambahan dengan peluruhan kosinus pada pembaruan bias pakar, bersama dengan skala residual berbasis kedalaman, SandwichNorm, gating perhatian elemen‑per‑elemen, dan akumulasi residual FP32. Reflection melaporkan pemanfaatan pakar yang hampir seragam, dengan beban pakar paling sibuk rata‑rata 1.04 kali rata‑rata pada akhir pra‑pelatihan, dan norma aliran residual terbatas di seluruh 52 lapisan.
Reinforcement Learning dengan Komputasi Tinggi
Kampanye reinforcement learning menghasilkan lebih dari 100 million rollouts pada 10,500 NVIDIA GB300 GPU selama empat minggu, dengan panjang konteks maksimum 256,000 token dan sekitar 1.3 billion sandboxes yang digunakan untuk pelatihan dan penilaian. Reflection mengatakan bahwa mereka memperoleh hampir satu juta lingkungan coding, agentic, dan STEM, terutama melalui pipeline data sintetis, dan menggambarkan upaya tersebut sebagai salah satu run RL terbesar yang pernah dilakukan oleh laboratorium terbuka hingga saat ini.
Perusahaan melaporkan mempertahankan rata-rata 110.000 rollout bersamaan dan hingga 170.000 sandbox bersamaan, dengan lebih dari satu miliar permintaan pembuatan sandbox diproses di lebih dari 20 klaster, dua cloud, dan empat wilayah. Bobot baru mencapai armada inferensi dengan median sekitar 12 detik, 71 insiden inferensi ditangani tanpa menghentikan pekerjaan pelatihan, dan pengemasan dinamis menjaga batch pelatihan terisi rata-rata 99,99 persen. Reflection mengatakan sistem asinkron tetap stabil bahkan ketika belajar dari sampel hingga 107 versi bobot, kira-kira satu hari, di belakang kebijakan saat ini.
Keamanan dan Penyelarasan
Untuk penyelarasan, Reflection melatih model kedua dari checkpoint pra‑latih yang sama menggunakan pipeline fine‑tuning terawasi dan RL terpisah yang ditargetkan pada prinsip perilaku, kemudian menggabungkannya dengan guru RL skala besar melalui distilasi kebijakan on‑policy multi‑guru. Prinsip‑prinsip tersebut diatur dalam tiga tingkatan: aturan yang tidak boleh dilanggar model, kualitas yang harus dipenuhi secara konsisten, dan gaya interaksi default.
Dataset keamanan dibangun secara adversarial dan iteratif, dengan setiap serangan berhasil pada satu putaran dimasukkan kembali ke putaran pelatihan berikutnya, dan RL keamanan mencakup skenario satu giliran, multi‑giliran, jailbreak, dan agen di mana lawan simulasi menekan model yang menggunakan alat. Reflection mengatakan bahwa ia dapat memprediksi peningkatan RL lebih baik daripada batas Best‑of‑N saja, melaporkan korelasi 0,79 dibandingkan 0,46 untuk batas tersebut. Perusahaan menyatakan akan mempublikasikan hasil evaluasi keamanannya dalam laporan teknis Beam dan akan membuka sumber evaluasi keamanan internal yang dikembangkannya.
Ketersediaan dan Kemitraan
Pada halaman tentang, Reflection menguraikan komitmen untuk merilis bobot model, mempublikasikan penelitiannya, dan membuka sumber perangkat lunak, termasuk alat dan lingkungan pembelajaran penguatan. Halaman tersebut menyatakan bahwa Reflection divalidasi di Dell AI Factory dengan NVIDIA, bahwa ia merupakan anggota konsorsium bersertifikat dari Genesis Mission Departemen Energi, melayani 17 Laboratorium Nasional AS dengan model open‑weight‑nya, dan bahwa ia sedang membangun cloud AI berdaulat berkapasitas 250 megawatt di Korea Selatan bersama Shinsegae, yang didukung oleh pemerintah AS dan Korea.
Reflection mengatakan akan merilis bobot Beam di bawah lisensi Apache 2.0 pada akhir Oktober 2026, disertai dengan laporan teknis, kartu model, dokumentasi, serta seluruh stack untuk menjalankan, mengevaluasi, dan melakukan fine‑tuning model, dengan mitra distribusi dan integrasi dengan pustaka open‑source serta harness yang direncanakan untuk diluncurkan.












