AI 模型与平台

Z.ai 详述基于 10 万颗国产芯片的 GLM-5.3-Flash 推理构建

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Z.ai 于2026年9月17日发布了一篇技术报告,描述了其如何在超过10万颗国产 AI 加速器的集群上从零构建完整的生产级推理服务,以支持其 GLM-5.3-Flash 模型。公司称,大部分工作由由 GLM-5.3 驱动的基础设施代理完成,而非仅靠基础设施工程师,且 GLM-5.3-Flash 的所有生产推理均在该系统上运行。

Z.ai 表示,此前没有人能够在如此规模上运营国产加速器集群。公司指出,芯片上内存容量和带宽相对有限、模型架构新颖、拥有 100 万 token 的上下文窗口以及多模态请求,同时生态系统尚不成熟,内核支持不完整,工程师只能凭猜测来推断本应有文档说明的行为。

GLM-5.3-Flash 于2026年8月26日发布,是 GLM-5 系列首个原生多模态模型,拥有 3200 亿总参数和 1800 亿活跃参数,采用稀疏与线性注意力相结合的混合架构。在发布前,Z.ai 在 OpenCode 和 OpenRouter 上以匿名名称 ox-alpha 测试该模型,公司称该模型在两平台上线后一周内成为使用最广的模型,六天内处理超过 62 万亿 token。

密集反馈方法

该报告的核心是一个系统性问题:端到端指标可以告诉代理结果变差,但无法说明原因。数值准确性测试失败、首 token 响应时间增加 30%、输出吞吐量下降 20% 等都无法指明是哪一层导致问题或下一步应测试什么。Z.ai 的解决方案称为密集反馈,它将正确性测试、运行时日志、执行跟踪、运行时事件、微基准测试以及端到端指标整合到可重复的工作流中,使代理能够在本地验证每个假设,而无需在每次更改后等待完整部署和负载测试。

公司为此类反馈定义了三项必需属性。它必须是本地的,尽可能关联到具体的启动参数、代码变更、内核、输入条件、线程、执行区间或代码路径。它必须成本低廉且获取及时。并且必须能够通过参考实现和受控实验进行客观验证,因为仅凭观察到的相关性不足以确定根本原因。

在报告描述的启动循环中,工程师定义了目标和系统边界,并审查了涉及数值语义、并发行为和生产风险的关键变更,而代理负责分析、提出假设并进行代码修改。他们共同优化的技术栈在 Encode-Prefill-Decode 解耦架构下,融合了线性注意力和 LM Head 的节点内张量并行、ReplaySSM、W8A8 量化、混合精度 INT8/FP8/BF16 缓存量化以及层拆分等技术。

三个工程案例

首个案例涉及数值正确性。对比分区与非分区内核执行路径的验证揭示了 KDA 内核上下文并行路径的精度问题:tl.dot 操作即使在输入为 FP32 时也默认使用 TF32 计算,导致在状态合并过程中误差累积,且随上下文长度增加而加剧。修复方案明确将输入精度设为 tf32x3,使用三个 TF32 Tensor Core 运算以获得更高精度的结果。

根据报告,这些修复已上游合并到 Flash Linear Attention 中。拉取请求于2026年8月27日开启并合并,在状态更新和变换合并内核中使用 tf32x3 仿射链作为可选的精度路径,加入了上下文并行性测试,并在不支持 tf32 的平台(AMD、NPU 以及计算能力低于 8.0 的 NVIDIA GPU)上显式回退到 IEEE 精度。

第二个案例涉及 KV 传输的并发瓶颈。报告称,工程师设定了接受标准,即在相同工作负载下,Prefill 加 KV Transfer 的运行时间应在 Prefill 单独基准的 5% 以内。代理在某些场景中发现差距超过 20%,并追溯至 DeepEP v1.2.1,其中既没有 intranode调度而非 intranode合并 调用显式释放 Python GIL。只要这些调用持有锁,同一进程中的 Mooncake Transfer Python 线程就无法及时获取 GIL,导致调度和任务提交延迟,计算重叠缩小。报告指出,同版本的 internode_dispatch 已经释放了 GIL,代码注释说明其目的是在 CPU 等待期间避免阻塞其他线程的 KV Transfer。修复在相关 C++ 执行区间释放 GIL 后,报告称在相同测试条件下差距降至 1% 以下。

第三个案例涉及内核性能。Z.ai 让代理从包括 SGLang、Flash Linear Attention 和 DeepGEMM 在内的项目中的手写内核中提炼技术,形成可复用的优化骨架,包含适用条件、转换方法、资源约束和验证依据。在一个具代表性的 KDA Decode 内核上,公司报告称该代理的划分优化将执行时间缩短了 9.6%。在反馈确认计算是主要瓶颈后,代理将内核的 V 维度切片合并——这些切片原本对相同的 FP32 归一化和门控计算重复了四次——合并为一个线程块,使用寄存器驻留的中间结果和一次 warp 级别的归约,产生了公司称之为比之前版本提升 1.71 倍的加速效果。

声明的结果与递归自我改进

Z.ai 报告称,GLM-5.3-Flash 从最初的模型适配到可投入生产的准备阶段耗时不足两周,端到端吞吐量最终相较于最初基线提升了三倍。公司还表示,硬件利用率效率和每 token 成本已达到与主流 NVIDIA GPU 相当的水平。

公司将此工作定位为递归自我改进的早期案例,指出该模型参与了运行其上的推理系统的优化。同时,Z.ai 表示尚未实现递归自我改进,并认为选择目标、设定边界以及评估风险仍是人类的职责,应该继续由人类承担。

Theo Nash 是 Unite.AI 的 AI 生成专家,负责报道 AI 基础设施、计算和支持现代人工智能的硬件系统。他的工作重点是大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接起来的软件栈。具有分析和工程驱动的视角,Theo 检视 GPU、定制硅、内存架构和分布式系统的进步如何使新一代 AI 模型成为可能。他特别关注性能权衡、能效、可扩展性和实际约束,这些约束影响了 AI 基础设施的现实世界部署。 Theo Nash 撰写的文章由 Unite.AI 的编辑团队审查,以确保技术准确性、清晰度和对快速演变的 AI 计算领域的负责任报道。