AI 模型与平台

GLM-5.3 在 Artificial Analysis Intelligence Index 中得分 60,匹配 Kimi K3

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Z.ai 的 GLM-5.3 已经被 Artificial Analysis 评估 在其 Intelligence Index 上得分 60,独立评估机构于 2026 年 8 月 18 日报告称,这使得这家中国实验室最新的推理模型与 Moonshot AI 的 Kimi K3 同级,并比 Anthropic 的 Claude Opus 5(当前领跑者,得分 63)低三分。

该得分基于 GLM-5.3 在最大推理力度下的运行,这是 Z.ai 推荐用于编码工作的设置。得分 60 远高于其比较类别中 181 款模型的中位数 35,并在该类别整体排名第八。

该结果是首次对一款模型进行的独立评估,该模型 Z.ai 于 2026 年 8 月 14 日发布,其结构异常:GLM-5.3 使用与 GLM-5.2 相同的基础模型,所有能力提升均来自后训练,而非全新的预训练。

GLM-5.3 的来历

Z.ai 的发布文章描述了在长时程任务环境上进行为期一个月的强化学习规模化:更多环境、更多样化任务、更多算力,全部基于实验室为 GLM-5.2 构建的训练堆栈。公司报告称,该方法将 Terminal‑Bench 3.0 的得分从 4.6 提升至 28.3,DeepSWE v1.1 从 46.2 提升至 66.9;其自身的帖子记录了在编码、网络安全以及面向代理的基准测试中相对于 Kimi K3、Claude Opus 4.8、Claude Fable 5 和 GPT‑5.6 Sol 的一系列结果。Unite.AI 在 模型上周发布时 对其发布及新出现的网络安全成果进行了详细报道。

Artificial Analysis 的得分与供应商自行报告的表格权重不同,因为评估机构自行运行整套测试。其 Intelligence Index v4.1.1 汇总了九项评估,涵盖代理式真实工作任务、代理工具使用、终端编码、科学推理与知识、研究生水平的科学问题、物理推理、知识可靠性与幻觉以及长上下文推理。GLM-5.3 的 60 分是其在该套测试中的综合得分,总评估费用为 Z.ai API 上的 1,238.50 美元。

GLM-5.3 在排行榜上的位置

与 Kimi K3 的持平是本次对比的核心。Kimi K3(于 2026 年 7 月 16 日发布) 在指数上同样得分 60,仍是 Artificial Analysis 排行榜中得分最高的开源权重模型,GLM-5.3 目前在得分上与之相同,尽管许可方式不同。Moonshot 于 2026 年 7 月 在收入分层许可下开放了 Kimi K3 的权重;而 GLM-5.3 目前被列为专有模型,Artificial Analysis 记录其参数量为 7530 亿。

Claude Opus 5(于 2026 年 7 月 24 日发布) 仍以 63 分领跑指数。GLM-5.3 与领跑者之间的三分差距是一次快速后训练循环未能弥合的距离,而该前沿自春季以来已发生变化。

价格是这两款得分 60 的模型差异显著的地方。GLM-5.3 在 Z.ai API 上的费用为每百万输入代币 1.40 美元、每百万输出代币 4.40 美元,而 Moonshot 上的 Kimi K3 则分别为 3.00 美元和 15.00 美元。按 Intelligence Index 任务计算,GLM-5.3 的费用为 0.68 美元,Kimi K3 为 0.84 美元,Claude Opus 5 为 2.34 美元。GLM-5.3 以三者中每任务成本最低的方式达到其得分,尽管它也是该组中生成文本最丰富的模型,在评估套件中产生了 1.7 亿输出代币,而同类模型的中位数为 7200 万代币。

接下来会发布什么

GLM-5.3 已通过 Z.ai 的 API 提供,并已向所有 GLM Coding Plan 订阅者推送。该模型需要启用 “思考” 功能,提供三种努力级别,Z.ai 警告称,仍在关闭思考模式下调用模型的应用将在迁移前失败。

权重仍是最后的缺失部分。Z.ai 承诺将在 2026 年 8 月 14 日发布两周后,即完成安全评估和加固后,公开模型权重,这将使 GLM-5.3 与 Kimi K3 一同成为指数上得分 60 的开源权重选项,且每代币价格约为其一半。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。