AI 模型与平台

Cerebras 报告称通过解耦实现了 5 倍推理吞吐量提升

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Cerebras Systems 于 2026 年 10 月 1 日表示,在早期结果中使用一种称为解耦的技术将推理吞吐量提升了 5 倍,使用的 Cerebras 系统数量相同,且令牌生成速度未出现下降。此披露出现在 Disaggregated Inference From the Ground Up,这是一篇由 Isaac Tai 和 Zhenwei Gao 撰写的公司博客文章,开启了该主题的计划系列。

该文章为已经听说过“解耦”一词,或听闻预填阶段受计算限制、解码阶段受内存限制的说法,并想了解其实际含义的读者设定了系列框架。它从基础开始构建解释,首先说明加速器如何在算术运算与数据移动之间取得平衡。

预填和解码对硬件提出不同需求

文章将算术强度定义为浮点运算次数除以在内存与加速器计算单元之间传输的字节数。在其中一个示例中,两个矩阵相加每移动 6 字节就进行 1 次 FLOP,算术强度为每字节 0.167 FLOP,且该比例随矩阵规模增大保持不变。矩阵乘法的行为则不同:每个输出值由一个输入的整行和另一个输入的整列构成,因此已加载的数值会贡献给更多的输出,算术强度随输入规模而提升。

文章解释说,推理是模型固定权重与输入令牌之间进行的一系列矩阵乘法,并分为两个强度特征不同的阶段。预填阶段,整个提示会并行处理为一次大型矩阵运算,实际使用中提示可能包含数千甚至数十万令牌。解码阶段,令牌逐个生成,模型依赖 KV 缓存,该缓存存储先前令牌计算得到的键和值,以便复用而非重新计算。

两个阶段仍然需要在每个生成的令牌时将模型的全部权重(可能高达数百 GB 或 TB)搬移到计算单元。文章显示,内存搬移基本保持不变,而算术强度在预填之后下降,并指出正是这一差距导致单纯增加计算能力并不一定能让解码阶段的令牌更快到达。

解耦将推理拆分为独立的资源池

在生产环境中,推理服务器通常会并发处理大量请求,而当预填和解码在同一硬件上运行时,计算密集的预填可能会阻塞正在进行的解码请求。调度器因此必须在快速让新请求获取首个令牌、保持活动响应流畅以及最大化整体吞吐量之间进行取舍。批处理可以让并发请求共享模型权重的读取工作,但更大的批次会导致每个解码步骤耗时更长,从而整体吞吐量提升的同时,每位用户收到令牌的速度会变慢。

文章将解耦描述为一种系统设计模式,将两个阶段分别运行在独立的硬件池中。阶段分离后,运营者可以独立分配硬件、设定批处理策略,并针对每个阶段优先考虑延迟或吞吐量:对首令牌响应时间要求严格的系统可以为预填预留更多资源,而以平滑流式为目标的系统则可以为解码分配更大或更紧凑调度的池。各池也可以单独进行扩容。

分离带来了新的需求。预填阶段构建 KV 缓存后,该请求特有的状态必须转移到解码池,在生成继续之前加载到内存中,而模型权重已经在两个池中预先加载。文章指出,这一交接会增加网络和协调开销;如果容量与需求不匹配,任一池可能会闲置;且额外的延迟取决于缓存是跨同机房机器还是跨地区移动。作者认为,解耦在大规模场景下最具吸引力,因为独立调整和调度各池的规模所带来的收益可以抵消传输和运营成本,并且它改变了服务系统的控制接口,而不仅仅是平滑流式。

异构硬件、早期结果与合作伙伴关系

Cerebras 表示其在异构解耦方面处于领先地位,将多种芯片组合在同一推理系统中,并为内存受限或计算受限的部分分配不同的硬件。文章将公司采用的晶圆级设计进行对比,该设计在整块晶圆上将 SRAM 与计算单元一起分布,而 GPU 则通过较小的片上存储和缓存,将模型数据从高带宽存储分阶段调入。

文章中发布的峰值内存带宽图表(日期为 2026 年 9 月 10 日)列出 Cerebras WSE-3 片上 SRAM 的带宽为每块晶圆 21,000 TB/s,同时还有未命名的片上 SRAM 加速器为 150 TB/s,以及 HBM4 GPU 的带宽分别为 23.3 和 22 TB/s。图表提醒,SRAM 数据是对处理器内部本地内存带宽的累计,而 HBM 数据则衡量的是来自片外存储的流量,因此这些数值描述的是不同的内存层级,而非实际的令牌速度。

该帖子还重现了2026年9月10日的Artificial Analysis数据,针对运行高推理的GPT-oss-120B,使用10,000个输入令牌。数据列出Cerebras的输出速率为每秒1,669个令牌,SambaNova为708个,Groq为475个,Microsoft Azure为319个,Nebius为294个,Baseten为293个。

Cerebras表示,在传统的聚合系统中,提升容量需要部署更多硬件;通过利用合作伙伴加速器来处理提示处理,在相同的WSE占用下,早期测试中容量提升了5倍。公司称已与多家硬件合作伙伴宣布合作,以将更多超高速令牌推向市场,帖子中的示意图显示,AWS Trainium和AMD Helios Instinct GPU系统是填充硬件选项之一,为Cerebras的解码池提供支持。

该帖子指出,代理应用是异构分散的极佳匹配,因为它们通常涉及长时间、多轮的工作流,模型调用之间的上下文会不断增长,且每一步的延迟会累积。Cerebras表示,后续章节将涵盖所涉及的硬件和软件堆栈以及部署大规模分散推理的经济权衡。

Theo Nash 是 Unite.AI 的 AI 生成专家,专注于 AI 基础设施、计算以及驱动现代人工智能的硬件系统。他的工作聚焦于大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接在一起的软件堆栈。

凭借分析性和工程导向的视角,Theo 检视 GPU、定制硅片、内存架构以及分布式系统的进步如何推动新一代 AI 模型的出现。他特别关注性能权衡、能效、可扩展性以及塑造 AI 基础设施真实部署的实际约束。

由 Theo Nash 撰写的文章为 AI 生成,并经 Unite.AI 编辑团队审阅,以确保技术准确性、清晰度以及对快速演变的 AI 计算格局的负责任报道。