AI 模型与平台

Z.ai 发布 GLM-5.3,具有前沿编码和超出训练的网络安全能力

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Z.ai 于 2026 年 8 月 14 日发布了 GLM-5.3,这是一项公司声称在 GLM-5.2 的基础模型上进行了扩大规模的后期训练,从而获得了所有功能增强的更新。主要结果是在编码和网络安全方面:Z.ai 报告该模型是其测量的最强的开放权重系统,并且网络安全能力的增长速度超过了公司的预期,因为训练规模的扩大。权重尚未公开:Z.ai 表示将在安全评估和加固完成后大约两周内发布权重。

根据 公司的公告,GLM-5.3 现已通过 Z.ai 的 API 和其 GLM 编码计划提供,并已推出到所有现有的编码计划订阅者。

此次发布发生在 DeepSeek 发布其旗舰 V4 Pro 的几天后,Z.ai 的比较表直接将 GLM-5.3 与 DeepSeek-V4 Pro、Moonshot 的 Kimi K3 和 OpenAI 的 GPT-5.6 Sol 进行了比较,涵盖编码、网络安全和代理套件。

在更大的工作环境集上进行后期训练

正如 Z.ai 所描述的,配方是环境扩展而不是架构更改。GLM-5.2 引入了训练栈(一种称为 IndexShare 的长上下文技术,称为 SAO 的长视距任务的强化学习方法,以及称为 slime 的大规模异步 RL 的开源框架),公司表示 GLM-5.3 是通过在该栈上花费更多计算资源来构建更多和更多样化的任务环境而产生的。

这些环境的构建是为了模仿专业工作单位,而不是编码练习。公司给出的一个例子是,模型被放置在一个机器学习基础设施工程师的工作环境中,具有访问计算集群、内部文档、代码库和实验结果的权限,必须诊断瓶颈、实施优化,并提供可衡量的端到端加速。一些任务,Z.ai 表示,代表了几天的工作量,相当于一位经验丰富的工程师。为了批量生产环境,Z.ai 建立了管道,研究代理将现实工作中的任务模式转换为可运行的长视距环境,一个判断代理验证每个任务是否实际可解,验证器在没有参考解决方案的情况下合成。奖励信号本身是针对任务子集的机器生成,使用求解器轨迹来关闭奖励捷径。Z.ai 指出,管道仍然需要有意义的人工干预。

报告的结果遵循该配方预测的模式:最大的收益位于最长的视野评估上。在 Terminal-Bench 3.0 上,GLM-5.3 从 4.6 提升到 28.3,相对于 GLM-5.2;在 DeepSWE v1.1 上,从 46.2 提升到 66.9;在 Agents’ Last Exam 的 CLI 变体上,从 23.8 提升到 28.5。所有数字都是供应商报告的,方法注释在公告中涵盖了每个基准的套件、上下文长度和采样设置。

相对于其他模型,情况是混合的。在 Z.ai 的内部代码基准测试中,公司报告了 50% 的改进,表示该模型在可比努力下超越了 Claude Opus 4.8,同时消耗了较少的输出令牌(在大约 50,000 个输出令牌每任务中为 31.4%,而在 120,000 个输出令牌中为 29.5%),但仍然落后于 Anthropic 的 Claude Fable 5,它在最大努力下达到 39.5%。在公共套件中,GLM-5.3 在几个更难的编码评估中落后于 GPT-5.6 Sol 和 Fable 5,包括 Terminal-Bench 3.0 和 DeepSWE。作为一个私人基准,公司认为 Z.ai 代码基准降低了来自公共测试集的污染风险。

Z.ai 表示没有计划的网络安全结果

第二个标题是 Z.ai 自己标记为意外的。公司引入了漏洞发现数据和环境到后期训练中,预期模型将变得更擅长于发现和推理个别缺陷。相反,它表示,能力在训练规模扩大时继续复合,模型开始跨多个利用阶段进行推理,形成了完整的利用链计划,而不是孤立的 bug 查找。

报告的数字支持这一说法。在 CyberGym 上,测试模型是否可以从白盒源代码中识别和验证漏洞,GLM-5.3 得分为 84.5%,高于 GLM-5.2 的 77.2%,并且领先于 Z.ai 比较集中的每个模型。在 ExploitBench 上,要求更深入地推理真实漏洞及其利用,GLM-5.3 的分数是其前身的两倍,从 24.4% 提升到 54.4%。在 ExploitGym 上,计算在时间归一化预算下完成的利用任务,GLM-5.3 在两小时内完成 105 个任务,在六小时内完成 130 个任务,而 GLM-5.2 分别完成 29 和 39 个任务。Z.ai 自己的模式总结是直接的:基准在利用链上越高,GLM-5.2 的收益越大,距离封闭前沿模型的差距越大,Mythos 5 在相同预算下完成 181 和 247 个 ExploitGym 任务。

Z.ai 还报告了超出受控基准的转移测试。与中国的几个安全团队合作,公司表示其模型自 GLM-5.2 以来已经在 269 个开源项目中发现了 2,436 个漏洞,包括 1,097 个被评为严重或高严重性漏洞,涵盖系统内核、操作系统、浏览器引擎和网络协议。许多漏洞多年来一直未被发现;公司表示,最古老的漏洞是在 1981 年引入的。

这些发现为公共 Z.ai 安全披露账本 提供了信息,跟踪每个问题通过披露过程:53 个公开披露并分配了 CVE,2,383 个仍在禁令之下。最近的条目包括 Linux 内核中的 use-after-free,影响 Apple Safari 的 WebKit 内存处理缺陷,以及 FreeBSD 中的参数验证错误。

对于 API,GLM-5.3 支持三个思考努力级别(低、 高和最大),并且不再允许禁用思考,这是之前以关闭思考运行的应用程序的破坏性更改。

开放权重发布留下的开放问题

公告和权重发布之间的两周间隔在此次发布中发挥作用。Z.ai 将延迟明确地归因于安全评估和加固,而被加固的模型是公司自己描述为比预期更快地发展了进攻性安全能力的模型,最大收益出现在利用链的末端。Z.ai 表示,权重将在两周的安全评估和加固期后对任何人开放下载。

网络安全结果也出现在一个前沿实验室公开展示代理模型对基础设施可以做什么的周:OpenAI 最近描述了 其自身测试模型在红队演习中突破了 Hugging Face。Z.ai 的披露账本是对这一能力的建设性对应:同样的技能既可以链式利用漏洞,也可以为补丁表面暴露数十年前的 bug,目前有 1,097 个严重和高严重性发现正在通过协调的披露程序进行处理。

无论独立评估者是否复制 GLM-5.3 的数字(特别是 Z.ai 在其自身套件配置中运行的内部代码基准测试结果和网络安全评分),都将决定这次发布中有多少是开放权重编码模型的真正步骤,多少是评估选择。预计在 2026 年 8 月底的权重发布时,将开始进行此次测试。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。