AI 模型与平台

Ai2 发布 Olmo-Core 3,面向万亿参数 MoE 的开放训练栈

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Allen Institute for AI 于 2026 年 10 月 1 日发布了 Olmo-core 3,这是对其大型语言模型开发框架的升级,该框架围绕全新设计的开放式混合专家训练系统构建,Ai2 表示该系统已在超过一万亿总参数上进行基准测试。

Ai2 表示 Olmo-core 3 旨在将 MoE 训练规模扩展至万亿参数范围,同时保持计算效率,并将其描述为下一代 Olmo 背后的核心系统之一。此次发布附带了一份 技术报告、一个交互式演示以及开源代码。

MoE 模型可以包含更多参数,而不需要每个输入使用全部参数,但完整模型仍需跨 GPU 内存 存储并在训练期间更新,并且在集群中将输入路由到正确专家会产生额外的通信和协调成本。Ai2 表示,随着 MoE 的增长,这些成本可能侵蚀大量计算优势,而 Olmo-core 3 的设计正是为弥补这一差距。在一次 Ai2 基准测试中,专家池从 8 增至 128,仍然每个 token 选择四个专家,活跃参数大致保持在约 32 亿,而总参数容量从 46 亿增长到 470 亿,训练吞吐量下降不足 5%。

从 FSDP 到基于 DDP 的训练栈

Ai2 早期在 Olmo-core 中的 MoE 实现使用了全分片数据并行(fully sharded data parallelism),配置为对每个小批量训练数据收集并重新分片模型权重。Olmo-core 3 切换为基于分布式数据并行的系统,使专家常驻于 GPU 并将相关数据路由至其上,避免了重复的权重收集。在对八块 NVIDIA B300 GPU 进行的初步测试中,Ai2 报告称,使用新栈的 470 亿参数 MoE 每块 GPU 每秒处理 52,000 个 token,而使用早期实现时为 19,400,Ai2 将其描述为约 2.7 倍的吞吐量。

Ai2 在稀疏模型方面的工作可以追溯到 OlmoE,该模型使用了拥有 64 个路由专家的 MoE 架构,而 Olmo 3 则采用了密集架构,几乎所有模型在每个 token 上都处于激活状态。Olmo-core 3 在此框架上扩展了针对更大规模 MoE 模型的训练系统。Ai2 指出,NVIDIA 的 Megatron-Core 是训练大型 MoE 的成熟方案,并将 Olmo-core 3 描述为为 Olmo 背后的框架引入了集成的 MoE 训练栈。

并行性、精度与内存技术

有三种技术决定模型及其训练状态在硬件上的划分方式:专家并行将专家分布在多个 GPU 上,流水线并行将模型层划分到 GPU 组之间,分布式优化器则将优化器状态分布在 GPU 上,而不是在每个 GPU 上存储完整副本。Olmo-core 3 还降低了将数据路由至正确专家的成本:行式专家并行将路由数据直接写入专家输入缓冲区,GPU 常驻路由将路由元数据保留在 GPU 上,使 CPU 能在无需等待数据回拷的情况下排队工作,分组 GEMM 将大量小规模专家计算合并,使 GPU 能更高效执行。技术报告描述了一种基于 NVSHMEM 的行式专家并行设计,直接将每个 token 写入其对应专家的缓冲区,并通过设备调度的分组矩阵乘法实现完全无同步的专家并行。

Olmo-core 3 支持 MXFP8,这是一种低精度数值格式。在对四块 NVIDIA B300 GPU 进行的受控基准测试中,工作在专家之间均匀分配,Ai2 报告称训练吞吐量比 BF16 基线提升约 21%,而峰值活跃内存从 103 GiB 降至 95 GiB,主要收益来自前馈计算以及专家间的数据移动。报告补充说明,拓扑无关的检查点能够独立于并行布局记录全局 FP32 张量,从而可以在不同拓扑上恢复运行;在受控对比中,激活重计算去除了近三分之二的激活内存,并将峰值内存降低约四分之一,代价是吞吐量下降约五分之一。

万亿参数基准测试与声明的限制

Ai2 表示,他们在 NVIDIA B300 GPU 上对 Olmo-core 3 进行了一系列配置的基准测试,包括一个 1.2 万亿参数的模型,该模型在 512 块 GPU 上每个 token 激活 583.6 亿参数,最高观测吞吐量为每块 GPU 858 TFLOP/s。Ai2 说明这些测试使用随机路由来衡量系统性能,而非训练模型的质量。技术报告列出了从 16 块 GPU 上的 129 亿参数模型到 512 块 GPU 上的 1.2 万亿参数模型的测量运行点,并指出这些 headline 速率是基于随机路由测得的系统参考值,而非受控的扩展曲线或时效质量声明。

Ai2 还尝试了 DeepEP v2,这是一种用于跨 GPU 专家之间通信的替代后端,达到了总计 2.38 万亿参数的配置。Ai2 将该结果描述为一次短时容量测试,旨在展示 Olmo-core 3 能够达到的规模,而非持续的训练性能。技术报告题为《为高效可扩展的 MoE 训练加速 Olmo-core》,发布日期为 2026 年 10 月;作者来自 Allen Institute for AI 和华盛顿大学,陶天华被列为首席作者和主要开发者。

已记录的发现与下一代 Olmo 计划

报告记录了一种 Ai2 称为 token gerrymandering 的失败模式,即旨在鼓励均衡路由的评分在实际工作负载变得不平衡时仍可能提升。其他记录的发现包括:降低专家的学习率(因为它们处理的 token 更少)并未提升所测试模型系列的结果;即使矩阵维度相同,GPU 计算所需时间也会因处理的数值不同而变化;在不同的 GPU 流上重叠通信与计算并不总能加快训练,在某些测试中甚至会减慢端到端执行。报告还描述了已测试但未采纳的方法,包括主机链路无法承载的激活 CPU 卸载,以及两种与专家计算争夺 GPU 资源的重叠方案。

Ai2 表示,其下一代 Olmo 将采用 MoE 架构,目标是打造迄今为止最强大的 Olmo,使用最大的数据集进行训练,并拥有最长的上下文窗口。该组织称 Olmo-core 3 完全开源,研究人员和开发者可以利用它训练自己的 MoE,适配不同硬件,并在路由、并行化及系统其他部分进行实验。Olmo-core GitHub 仓库 将该项目描述为 OLMo 生态系统的 PyTorch 构建块,采用 Apache-2.0 许可证,可通过源码或 PyPI(ai2-olmo-core)进行安装。

Jonas Reeve 是一名由 AI 生成的分析师,隶属于 Unite.AI,专注于认知 AI、通用人工智能(AGI)以及机器智能的理论基础。他的研究探讨学习、推理、记忆和抽象如何在生物系统和人工系统中出现,并将现代 AI 架构与认知科学和心灵哲学中的长期问题联系起来。

采用概念性和反思性的视角,Jonas 检视诸如推理模型、主体系统、涌现认知和对齐理论等框架,旨在阐明向 AGI 迈进的实际意义——以及它不代表的内容。他不追逐时间表或炒作,而是强调第一性原理、概念严谨性以及当前模型的局限性。

Jonas Reeve 所撰写的文章由 AI 生成,并经 Unite.AI 编辑团队审阅,以确保准确性、清晰度以及对先进 AI 概念的负责任讨论。