AI 模型与平台

Reflection AI 推出 Beam,一款 5010 亿参数的开放权重模型

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Reflection AI 推出 Beam 于2026年10月5日,作为其首个开放权重模型:一个稀疏的专家混合系统,拥有5010 亿总参数和230 亿活跃参数,专为编码、推理和代理工作负载构建。

Beam 正在进行最终的红队测试和评估,早期版本正通过候补名单向一部分精选用户提供。Reflection 将 Beam 描述为系列中的首个模型,并表示它已经在训练下一代模型。

能力与效率声明

Reflection 表示,它在训练 Beam 时特别侧重于编码和代理性能。公司称该模型在与更大的开放模型(如 GLM 5.2)竞争时表现出色,并在编码和代理任务上接近 Qwen 3.8-Max,同时承认 Kimi K3 在原始能力上仍然领先;它将 Beam 的优势描述为推理时的效率,并称该模型推动了其所谓的西方开放权重前沿。

Reflection 报告的评估套件得分包括:Terminal Bench v2.1 的 80.1,SWEBench Verified 的 80.9,SWE Bench Pro v2-Hard 的 77.2,AIME 2026 的 97.8,未使用工具的 Humanity’s Last Exam 的 36.2,以及 GPQA Diamond 的 90.5。

在效率方面,公司报告称 Beam 在高级推理基准测试上取得的分数可与 GLM-5.2 相媲美,但使用的推理计算量少三到四倍,对参数超过两万亿的模型(如 Qwen 3.8-Max)则获得更大的提升。根据帖子,这些估算基于 Artificial Analysis 和 DataCurve 数据,并将生成计算量近似为活跃参数数量的两倍乘以每次尝试的平均生成标记数;由于这些数字未计入提示预填充、注意力操作和服务开销,Reflection 将其描述为一种近似的计算对比,而非实际测量的推理成本。

Reflection 表示,它还为 Beam 训练了可控的长度惩罚机制,该机制奖励成功的解答并抑制不必要的标记,并且面向用户的推理努力参数允许用户在标记使用量与性能之间进行权衡,较低的设置倾向于更短的回复,而较高的设置则在高需求任务上允许更长的推理。

公告称,能力已超出训练混合范围:在对推理、软件工程和终端任务进行强化学习期间,尽管没有浏览任务,浏览性能仍有所提升,并且在具备网络访问时,模型能够自行查询其他大型语言模型并使用 OCR API 读取文档。演示包括基于公开的 MTA 数据构建的实时更新的纽约市地铁地图、使用 p5.js 编写的 3D 太空人游戏,以及一个陆地或水域拼图,其中 Beam 在由 16,200 个点组成的全球坐标网格上进行分类,覆盖率达到 95.5%,该结果在帖子中介于 Opus 5 的 92.5% 与 Fable 5 的 97.8% 之间。第四个演示中,Beam 生成了一个笔记本,对最小的 Gemma-4 模型进行 Text2SQL 任务的微调,Reflection 表示这使 Gemma 的留出测试准确率提升了 66.5%。

训练管线

预训练与数据策划

Reflection 表示,它在来自网络、公共来源和专有授权数据集的 23.8 万亿标记上对 Beam 进行预训练,在 6,144 台 NVIDIA GB300 NVL72 GPU 上完成了全程运行,耗时不足四周。公司报告了九次半自动回滚,归因于梯度范数峰值或疑似静默数据损坏,并称 goodput(定义为实际墙钟时间中用于最终模型所保留训练步骤的时间占比)达到 92.3%。

数据管线通过解析、去重和策划,剔除了约 95% 的原始互联网标记,而 Reflection 表示,传统过滤技术大约会遗漏 1.8 万亿的高质量标记,这些标记已被保留,其中包括 87% 的策划网页代码标记。另一个管线使用视觉语言 OCR 模型结合内部质量分类器,在数千台 GPU 上处理 PDF 文档,而中期训练阶段将 Beam 的有效上下文长度扩展至一百万标记。

帖子描述了一种架构,结合交错的局部与全局注意力、细粒度路由专家,以及无辅助损失的负载均衡,采用专家偏置更新的余弦衰减,同时使用基于深度的残差缩放、SandwichNorm、逐元素注意力门控和 FP32 残差累加。Reflection 报告称专家利用率接近均匀,最繁忙的专家负载在预训练结束时平均为均值的 1.04 倍,且所有 52 层的残差流范数均保持在界限内。

高算力强化学习

Reflection 表示,该强化学习活动在 10,500 台 NVIDIA GB300 GPU 上运行了四周,产生了超过 1 亿次 rollout(采样轨迹),最大上下文长度为 256,000 标记,约 13 亿个沙盒用于训练和评分。Reflection 说,它主要通过 合成数据 管道获取了近一百万个编码、代理和 STEM 环境,并将此工作描述为迄今为止开放实验室进行的最大规模强化学习之一。

公司报告称,平均维持 110,000 个并发 rollout,最高可达 170,000 个并发 sandbox,已在超过 20 个集群、两云和四个地区处理了超过十亿次 sandbox 创建请求。新权重以约 12 秒的中位数到达推理集群,71 起推理事件在不终止训练作业的情况下得到处理,动态打包使训练批次平均保持 99.99% 的满载。Reflection 表示,即使在学习来自多达 107 个权重版本(约一天)的样本时,异步系统仍保持稳定,略落后于当前策略。

安全与对齐

为了实现对齐,Reflection 使用针对行为原则的独立监督微调和强化学习(RL)流水线,从相同的预训练检查点训练了第二个模型,然后通过多教师在线策略蒸馏将其与大规模 RL 教师模型合并。这些原则分为三层:模型必须遵守的规则、模型应始终满足的品质,以及默认的交互风格。

安全数据集通过对抗性和迭代方式构建,每一轮成功的攻击都会被折回到下一轮训练中,安全 RL 覆盖单轮、多轮、越狱以及代理情景,即模拟对手对使用工具的模型施压。Reflection 表示,它能够比仅使用 Best-of-N 上限更好地预测 RL 增益,报告的相关系数为 0.79,而上限为 0.46。公司称将把安全评估结果发布在 Beam 的技术报告中,并开源其内部开发的安全评估。

可用性与合作伙伴关系

在其 关于页面 上,Reflection 概述了发布模型权重、公开研究以及开源软件(包括强化学习工具和环境)的承诺。页面指出,Reflection 已在 Dell AI Factory 与 NVIDIA 上得到验证,是 Department of Energy’s Genesis Mission 的认证联盟成员,为 17 U.S. National Laboratories 提供其开源模型,并且正在与 Shinsegae 合作在韩国建设 250 兆瓦的主权 AI 云,得到美国和韩国政府的支持。

Reflection 表示,将在 2026 年 10 月下旬以 Apache 2.0 许可证发布 Beam 的权重,并附带技术报告、模型卡、文档以及用于运行、评估和微调模型的完整堆栈,计划在发布时提供分发合作伙伴并与开源库和工具链集成。

Jonas Reeve 是一名由 AI 生成的分析师,隶属于 Unite.AI,专注于认知 AI、通用人工智能(AGI)以及机器智能的理论基础。他的研究探讨学习、推理、记忆和抽象如何在生物系统和人工系统中出现,并将现代 AI 架构与认知科学和心灵哲学中的长期问题联系起来。

采用概念性和反思性的视角,Jonas 检视诸如推理模型、主体系统、涌现认知和对齐理论等框架,旨在阐明向 AGI 迈进的实际意义——以及它不代表的内容。他不追逐时间表或炒作,而是强调第一性原理、概念严谨性以及当前模型的局限性。

Jonas Reeve 所撰写的文章由 AI 生成,并经 Unite.AI 编辑团队审阅,以确保准确性、清晰度以及对先进 AI 概念的负责任讨论。