Yapay zeka modelleri ve platformları
Reflection AI, 501B Parametreli Açık Ağırlıklı Model Beam’i Tanıttı

Reflection AI Beam’i tanıttı 5 Ekim 2026’da, ilk açık ağırlıklı modeli: 501 milyar toplam parametre ve 23 milyar aktif parametreye sahip seyrek Uzman Karışımı sistemi, kodlama, akıl yürütme ve ajan tabanlı iş yükleri için inşa edildi.
Beam, son red-teaming ve değerlendirmelerden geçiyor ve erken bir sürümü bekleme listesi aracılığıyla seçkin bir kullanıcı grubuna sunuluyor. Reflection, Beam’i serinin ilk modeli olarak tanımladı ve zaten bir sonraki modeli eğittiğini söyledi.
Yetenek ve Verimlilik İddiaları
Reflection, Beam’i özellikle kodlama ve ajan performansına odaklanarak eğittiğini söyledi. Şirket, modeli GLM 5.2 gibi daha büyük açık modellerle rekabetçi ve kodlama ile ajan görevlerinde Qwen 3.8-Max’e yaklaşan bir model olarak tanımladı; ancak Kimi K3‘nin ham yetenek açısından hâlâ önde olduğunu kabul etti; Beam’in avantajını çıkarım süresi verimliliği olarak nitelendirdi ve modelin, kendisinin “Batı açık ağırlıklı sınırı” olarak adlandırdığı alanda ilerlediğini belirtti.
Reflection’ın değerlendirme paketinden rapor ettiği puanlar şunlardır: Terminal Bench v2.1’de 80,1, SWEBench Verified’de 80,9, SWE Bench Pro v2-Hard’de 77,2, AIME 2026’da 97,8, araçsız Humanity’s Last Exam’de 36,2 ve GPQA Diamond’da 90,5.
Verimlilik konusunda, şirket Beam’in gelişmiş akıl yürütme benchmark’lerinde GLM-5.2’ye benzer puanlar elde ettiğini, ancak çıkarım hesaplamasını üç ila dört kat daha az kullandığını, iki trilyonun üzerindeki parametreye sahip modellerde, örneğin Qwen 3.8-Max’te daha büyük kazançlar sağladığını rapor etti. Gönderiye göre, tahminler Artificial Analysis ve DataCurve verilerine dayanıyor ve üretim hesaplamasını aktif parametre sayısının iki katı ile deneme başına ortalama üretilen token sayısının çarpımı olarak yaklaşıyor; çünkü rakamlar istem ön doldurma, dikkat işlemleri ve hizmet yükünü içermiyor, Reflection bunları ölçülmüş çıkarım maliyeti yerine yaklaşık bir hesaplama karşılaştırması olarak tanımladı.
Reflection, Beam’i başarılı çözümleri ödüllendirirken gereksiz token’ları caydıran kontrol edilebilir bir uzunluk cezası ile de eğittiğini ve kullanıcı odaklı bir akıl yürütme çaba parametresinin, kullanıcıların token kullanımını performans karşılığında takas etmelerine izin verdiğini söyledi; düşük ayarlar daha kısa yanıtları, yüksek ayarlar ise zorlu görevlerde daha uzun akıl yürütmeyi mümkün kılıyor.
Duyuru, yeteneklerin eğitim karışımının ötesine genelleştiğini rapor ediyor: akıl yürütme, yazılım mühendisliği ve uç görevlerde pekiştirmeli öğrenme sırasında, gezinme görevlerinin olmamasına rağmen gezinme performansı iyileşti ve web erişimiyle model, diğer büyük dil modellerine sorgu gönderme ve belgeleri okumak için OCR API’lerini kullanma yeteneğini kendi kendine öğrendi. Demonstrasyonlar arasında kamu MTA verilerinden oluşturulmuş canlı güncellenen New York City metro haritası, p5.js ile yazılmış 3D astronot oyunu ve Beam’in 16.200 noktalı küresel koordinat ızgarasında %95,5 kapsama oranı ile noktaları sınıflandırdığı bir kara‑su bulmacası yer alıyor; bu sonuç gönderide Opus 5’in %92,5’i ile Fable 5’in %97,8’i arasında konumlandırılıyor. Dördüncü demonstrasyonda, Beam en küçük Gemma-4 modelini bir Text2SQL görevinde ince ayar yapan bir notebook üretti ve Reflection, bunun Gemma’nın tutma testi doğruluğunu %66,5 artırdığını belirtti.
Eğitim Boru Hattı
Ön Eğitim ve Veri Düzenleme
Reflection, Beam’i web, kamu kaynakları ve tescilli lisanslı veri setlerinden elde edilen 23,8 trilyon token üzerinde önceden eğittiğini ve 6.144 NVIDIA GB300 NVL72 GPU üzerinde dört haftadan kısa bir sürede uçtan uca çalıştırmayı tamamladığını söyledi. Şirket, gradient normu dalgalanmalarına ya da muhtemel sessiz veri bozulmasına bağlanan dokuz yarı otomatik geri sarma olduğunu rapor etti ve iyi aktarım oranını (goodput), son modelde tutulan eğitim adımlarına harcanan duvar saati zamanının payı olarak tanımlayarak %92,3’e ulaştığını belirtti.
Veri boru hattı, ayrıştırma, tekrarsızlaştırma ve düzenleme yoluyla ham internet token’larının yaklaşık %95’ini ortadan kaldırdı; Reflection, geleneksel filtreleme tekniklerinin tutulan yaklaşık 1,8 trilyon yüksek kaliteli token’ı, özellikle düzenlenmiş web‑kod token’larının %87’sini kaçıracağını söyledi. Ayrı bir boru hattı, binlerce GPU üzerinde dahili kalite sınıflandırıcılarıyla bir görsel‑dil OCR modeli kullanarak PDF artefaktlarını işledi ve orta eğitim aşaması Beam’in etkili bağlam uzunluğunu bir milyon token’a genişletti.
Gönderi, iç içe geçmiş yerel ve küresel dikkat, ince taneli yönlendirilmiş uzmanlar ve uzman önyargı güncellemelerinin kosinüs azalışı ile ek kayıpsız yük dengelemesi, ayrıca derinlik tabanlı artımsal ölçekleme, SandwichNorm, öğe bazlı dikkat geçidi ve FP32 artımsal birikim kombinasyonunu birleştiren bir mimariyi tanımlıyor. Reflection, ön eğitim sonunda en yoğun uzman yükünün ortalamanın 1,04 katı olduğu ve 52 katman boyunca artımsal akış normlarının sınırlı olduğu neredeyse eşit uzman kullanımını rapor etti.
Yüksek Hesaplamalı Pekiştirmeli Öğrenme
Pekiştirmeli öğrenme kampanyası, dört hafta boyunca 10.500 NVIDIA GB300 GPU üzerinde 100 milyondan fazla rollout üretti; maksimum bağlam uzunluğu 256.000 token ve eğitim ve değerlendirme için yaklaşık 1,3 milyar sandbox kullanıldı. Reflection, neredeyse bir milyon kodlama, ajan ve STEM ortamını, öncelikle sentetik veri boru hatları aracılığıyla temin ettiğini ve bu çabayı şu ana kadar açık bir laboratuvar tarafından yürütülen en büyük RL çalıştırmalarından biri olarak gördüğünü belirtti.
Şirket, ortalama 110.000 eşzamanlı rollout ve en fazla 170.000 eşzamanlı sandbox sürdürdüğünü, 20’den fazla küme, iki bulut ve dört bölge boyunca bir milyardan fazla sandbox oluşturma isteğinin işlendiğini rapor etti. Yeni ağırlıklar, ortalama yaklaşık 12 saniyede çıkarım filosuna ulaştı, 71 çıkarım olayı eğitim işi sonlandırılmadan ele alındı ve dinamik paketleme, eğitim batch’lerini ortalama %99,99 dolu tuttu. Reflection, asenkron sistemin, mevcut politikadan yaklaşık bir gün geride, 107 ağırlık sürümüne kadar örneklerden öğrenirken bile istikrarlı kaldığını söyledi.
Güvenlik ve Uyum
Uyum için, Reflection aynı önceden eğitilmiş kontrol noktasından ayrı bir denetimli ince ayar ve RL boru hattı kullanarak davranış ilkelerine odaklanan ikinci bir model eğitti, ardından büyük ölçekli RL öğretmeniyle çok öğretmenli çevrim içi damıtma yoluyla birleştirdi. İlkeler üç katmanda düzenlenmiştir: modelin ihlal etmemesi gereken kurallar, sürekli olarak karşılaması gereken nitelikler ve varsayılan etkileşim tarzı.
Güvenlik veri seti, her turdaki başarılı saldırıların bir sonraki eğitim turuna geri katıldığı adversarial ve yinelemeli bir şekilde oluşturuldu; güvenlik RL, tek tur, çok tur, jailbreak ve bir simüle edilmiş düşmanın bir araç kullanan modele baskı yaptığı senaryoları kapsadı. Reflection, RL kazançlarını yalnızca bir Best-of-N tavanından daha iyi tahmin edebildiğini, tavan için 0,46 iken 0,79 korelasyon bildirdiğini söyledi. Şirket, güvenlik değerlendirme sonuçlarını Beam’in teknik raporunda yayınlayacağını ve geliştirdiği iç güvenlik değerlendirmelerini açık kaynak yapacağını belirtti.
Erişilebilirlik ve Ortaklıklar
Reflection, hakkında sayfası sayfasında model ağırlıklarını yayınlama, araştırmalarını duyurma ve takviye öğrenme araçları ve ortamları dahil olmak üzere yazılımı açık kaynak yapma taahhütlerini özetliyor. Sayfa, Reflection’ın NVIDIA ile Dell AI Factory’de doğrulandığını, Enerji Bakanlığı’nın Genesis Misyonu’nun sertifikalı bir konsorsiyum üyesi olduğunu, 17 ABD Ulusal Laboratuvarına açık‑ağırlıklı modelleriyle hizmet verdiğini ve Shinsegae ile Güney Kore’de 250 megavatlık bir egemen AI bulutu inşa ettiğini, bu projenin ABD ve Kore hükümetleri tarafından desteklendiğini belirtiyor.
Reflection, Beam’in ağırlıklarını Ekim 2026’nın ilerleyen zamanlarında Apache 2.0 lisansı altında yayınlayacağını, teknik rapor, model kartı, dokümantasyon ve modeli çalıştırmak, değerlendirmek ve ince ayar yapmak için tam yığını içereceğini, dağıtım ortakları ve açık kaynak kütüphanelerle entegrasyonların lansman için planlandığını duyurdu.












