AIモデルとプラットフォーム

Reflection AI、5010億パラメータのオープンウェイトモデル「Beam」を発表

mm
Unite.AI を Google の優先ソースに追加

Reflection AI Beamを導入したのは2026年10月5日で、同社初のオープンウェイトモデルです。合計5010億パラメータ、うち有効230億パラメータのスパースMixture-of-Expertsシステムで、コーディング、推論、エージェントワークロード向けに構築されています。

Beamは最終的なレッドチーミングと評価を受けており、初期バージョンはウェイトリストを通じて選ばれたユーザーに提供されています。ReflectionはBeamをシリーズの最初のモデルと位置付け、すでに次のモデルのトレーニングを進めていると述べました。

機能と効率に関する主張

Reflectionは、Beamをコーディングとエージェント性能に特化して訓練したと述べました。同社はこのモデルがGLM 5.2などの大規模オープンモデルと競合でき、コーディングとエージェントタスクにおいてQwen 3.8-Maxに近づいていると説明していますが、Kimi K3が生の能力では依然として上回っていることを認めました。Beamの優位性は推論時の効率性にあると特徴付け、同モデルが「Westernオープンウェイトの最前線」を推進すると述べています。

Reflectionが評価スイートで報告したスコアは、Terminal Bench v2.1で80.1、SWEBench Verifiedで80.9、SWE Bench Pro v2-Hardで77.2、AIME 2026で97.8、ツールなしのHumanity’s Last Examで36.2、GPQA Diamondで90.5です。

効率性に関して、同社はBeamが高度な推論ベンチマークでGLM-5.2と同等のスコアを達成しながら、推論計算量を3〜4倍削減でき、2兆パラメータ以上のモデル(例:Qwen 3.8-Max)に対してはさらに大きな利得があると報告しました。投稿によれば、これらの推定はArtificial AnalysisとDataCurveのデータに基づき、生成計算量を「有効パラメータ数の2倍に、試行あたりの平均生成トークン数を掛けたもの」と概算しています。なお、これらの数値はプロンプトの事前入力、注意演算、サービスオーバーヘッドを除外しているため、Reflectionは実測推論コストではなく、概算の計算比較として提示しています。

Reflectionは、Beamに制御可能な長さペナルティを導入し、成功した解答を報酬しつつ不要なトークンを抑制するよう訓練したと述べました。また、ユーザー向けの推論努力パラメータにより、トークン使用量と性能をトレードオフでき、設定を低くすれば短い応答を、設定を高くすれば要求の厳しいタスクで長い推論を可能にします。

発表によれば、能力はトレーニングミックスを超えて汎化しました。推論、ソフトウェアエンジニアリング、ターミナルタスクに対する強化学習中、ブラウジングタスクが無いにもかかわらずブラウジング性能が向上し、ウェブアクセスによりモデルは自ら他の大規模言語モデルに問い合わせ、OCR APIを用いて文書を読み取ることを学習しました。デモとしては、公共MTAデータから構築されたリアルタイム更新されるニューヨーク市地下鉄マップ、p5.jsで作成された3D宇宙飛行士ゲーム、そしてBeamが16,200点の全球座標グリッド上のポイントを95.5%のカバレッジで分類した陸・水パズルが示され、結果はOpus 5(92.5%)とFable 5(97.8%)の間に位置付けられています。第四のデモでは、Beamが最小のGemma-4モデルをText2SQLタスクでファインチューニングするノートブックを生成し、ReflectionはこれによりGemmaの保持テスト精度が66.5%向上したと述べました。

トレーニングパイプライン

事前学習とデータキュレーション

Reflectionは、Web、公開ソース、独自のライセンスデータセットから取得した23.8兆トークンでBeamを事前学習し、6,144台のNVIDIA GB300 NVL72 GPU上で4週間未満でエンドツーエンドの実行を完了したと述べました。同社は、勾配ノルムのスパイクや疑わしいサイレントデータ破損が原因とされる9回の半自動リワインドを報告し、最終モデルに残されたトレーニングステップに費やされた実時間の割合(goodput)が92.3%に達したと述べました。

データパイプラインは、パーシング、重複排除、キュレーションにより生のインターネットトークンの約95%を除去しましたが、Reflectionは従来のフィルタリング手法では約1.8兆の高品質トークン(うちキュレーションされたウェブコードトークンの87%)を見逃すだろうと指摘しました。別のパイプラインでは、数千台のGPUを用いて社内品質分類器付きのビジョン・ランゲージOCRモデルでPDFアーティファクトを処理し、ミッドトレーニング段階でBeamの実効コンテキスト長を100万トークンに拡張しました。

投稿では、ローカルとグローバルの注意を交互に配置したアーキテクチャ、細粒度のルーティングエキスパート、エキスパートバイアス更新の余弦減衰を伴う補助損失なしの負荷分散、さらに深さに基づく残差スケーリング、SandwichNorm、要素ごとの注意ゲーティング、FP32残差蓄積が組み合わされていると説明しています。Reflectionは、事前学習終了時に最も負荷が高いエキスパートの負荷が平均の1.04倍にとどまるなど、エキスパート利用率がほぼ均一であり、全52層で残差ストリームのノルムが制限されていると報告しました。

大規模計算強化学習

強化学習キャンペーンは、10,500台のNVIDIA GB300 GPU上で4週間にわたり1億回以上のロールアウトを生成し、最大コンテキスト長は256,000トークン、トレーニングと評価に約13億のサンドボックスを使用しました。Reflectionは、約100万件のコーディング、エージェント、STEM環境を主に合成データパイプラインを通じて取得し、これがオープンラボが実施した最大規模のRL実行の一つであると述べました。

同社は、平均110,000の同時ロールアウトと最大170,000の同時サンドボックスを維持し、20以上のクラスター、2つのクラウド、4つのリージョンにわたって10億件以上のサンドボックス作成リクエストを処理したと報告した。新しい重みは中央値で約12秒で推論フリートに到達し、71件の推論インシデントはトレーニングジョブを終了させることなく処理され、動的パッキングによりトレーニングバッチは平均で99.99%の稼働率を保った。Reflectionは、最大107バージョンの重みサンプル、約1日分の学習でも、非同期システムが現在のポリシーの後ろで安定していると述べた。

安全性と整合性

整合性のために、Reflectionは同じ事前学習チェックポイントから別の監督付き微調整とRLパイプラインを使用して第二のモデルを訓練し、行動原則を対象とした。その後、マルチティーチャーオンポリシー蒸留を通じて大規模RL教師と統合した。原則は3つの層に整理されている:モデルが破ってはならない規則、常に満たすべき特性、そしてデフォルトの対話スタイルである。

安全性データセットは敵対的かつ反復的に構築され、各ラウンドの成功した攻撃が次のラウンドの訓練に組み込まれ、単一ターン、マルチターン、ジャイルブレイク、エージェントシナリオなど、ツールを使用するモデルに対してシミュレートされた敵対者が圧力をかけるシナリオを含んだ安全性RLが展開された。Reflectionは、Best-of-N上限だけよりもRLの利益を予測できると述べ、上限の0.46に対し0.79の相関を報告した。同社は、Beamの技術報告書で安全性評価結果を公開し、開発した内部安全性評価をオープンソース化する予定だと発表した。

利用可能性とパートナーシップ

自身の紹介ページで、Reflectionはモデル重みの公開、研究の発表、ソフトウェアのオープンソース化(強化学習ツールと環境を含む)へのコミットメントを概説している。このページは、ReflectionがNVIDIAと共にDell AI Factoryで検証され、米エネルギー省のGenesis Missionの認定コンソーシアムメンバーであり、オープンウェイトモデルで米国の17の国立研究所にサービスを提供し、さらに韓国のShinsegaeと共に250メガワット規模の主権AIクラウドを韓国で構築中で、米国と韓国政府の支援を受けていると述べている。

Reflectionは、2026年10月下旬にBeamの重みをApache 2.0ライセンスでリリースし、技術報告書、モデルカード、ドキュメント、モデルの実行・評価・ファインチューニング用のフルスタックを添付すると発表した。配布パートナーやオープンソースライブラリとの統合、ハーネスの提供もローンチ時に計画されている。

Jonas Reeve は Unite.AI のAI生成アナリストで、認知AI、汎用人工知能(AGI)、および機械知能の理論的基盤に焦点を当てています。彼の研究は、学習、推論、記憶、抽象化が生物学的システムと人工システムの両方でどのように現れるかを探求し、現代のAIアーキテクチャと認知科学や心の哲学における長年の問いとのつながりを描き出します。

概念的かつ省察的なアプローチで、Jonas は推論モデル、エージェントシステム、出現認知、アラインメント理論といったフレームワークを検討し、AGI への進展が実際に何を意味するのか、そして何を意味しないのかを明らかにしようとします。タイムラインや誇大宣伝に追随するのではなく、第一原理、概念的厳密さ、そして現行モデルの限界を重視しています。

Jonas Reeve が執筆した記事は AI 生成であり、Unite.AI の編集チームがレビューして正確性、明瞭さ、そして高度な AI 概念に関する責任ある議論を保証しています。