AI 模型与平台
Anthropic 发布 Claude Sonnet 5.5,价格保持与 Sonnet 5 相同

Anthropic 于 2026 年 9 月 28 日发布了 Claude Sonnet 5.5,这是其 Claude 5.5 系列的第二款模型。该模型保持 Claude Sonnet 5 的定价——每百万输入代币 2 美元、每百万输出代币 10 美元,Anthropic 表示,在其测试中,它的输出速度提升超过 30%,且每项任务的成本最高可降低 30%。
在其发布公告中,Anthropic 将 Sonnet 5.5 描述为比 Claude Opus 5.5 更快、成本更低的补充,后者据公司称旨在处理需要谨慎判断的复杂工作。Sonnet 5.5 在范围明确的日常任务、修复漏洞以及生成精美的文档、幻灯片和电子表格方面表现最为出色,Anthropic 还补充说,它在设计方面也有敏锐的眼光。
Claude Sonnet 5.5 可在所有平台上使用,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure,模型 ID 为 claude-sonnet-5-5,并且提供零数据保留,和 Opus 5.5、Sonnet 5 一致。
报告的基准测试结果
Anthropic 报告称,Sonnet 5.5 在 Terminal-Bench 4.0(一个代理式编码评估)中得分 70.6%,而 Sonnet 5 为 10.3%,Opus 5.5 的列出得分为 66.4%,反映其 Xhigh 努力结果。在 FrontierCode 1.1 主套件中,Sonnet 5.5 在 Max 努力下得分 46.2%,在 Xhigh 下得分 52.1%,相比之下 Sonnet 5 为 42.4%,Opus 5.5 为 54.4%,OpenAI 的 GPT-6 Sol 为 49.3%。报告的 CursorBench 4.0 得分为:Sonnet 5.5 为 55.5%,Sonnet 5 为 34.1%,Opus 5.5 为 57.8%。
在知识工作评估中,公司报告 Sonnet 5.5 的 GDPval-AA v2.1 得分为 1844,低于 Opus 5.5 的 1846 两分,但比 Sonnet 5 的 1449 高约 400 分;AA‑Briefcase v1.1 得分为 1811,低于 Opus 5.5 的 1822,高于 Sonnet 5 的 1359。公告还列出,在 Humanity’s Last Exam 中使用工具的得分为 64.5%,在 OSWorld 2.1 中获得 80.1% 的部分分数,在不使用工具的 Chartography(视觉图表识别测试)中得分为 61.6%。Anthropic 表示,Sonnet 5.5 是首个仅凭截图就能击败 Pokémon Red 的 Sonnet 模型。
公司提醒,基准分数仅反映模型能力的一个方面,并表示在其内部测试以及外部测试者的测试中,Opus 5.5 在需要持续判断的复杂、开放式工作上仍明显更强。脚注指出,Artificial Analysis 在预发布部署上运行了 GDPval-AA 和 AA‑Briefcase,期间出现了结构化输出错误,该错误已被修复,若有影响也会低估 Sonnet 5.5 的表现。另一脚注提到,OpenAI 最近修复了 GPT-6 Sol 中的图像理解错误,第三方分数可能尚未反映此修复。
早期测试者结果
CodeRabbit 的 AI 副总裁 David Loker 表示,Sonnet 5.5 在各复杂度层面上表现出比 Sonnet 5 更好的判断力,同时使用的输出代币显著更少,CodeRabbit 计划立即将简单和中等审查迁移至该模型,并在未来几周进一步扩大。Base44 AI 的工程主管 Gabriel Grinberg 报告称,在 118 个真实应用构建中,Sonnet 5.5 的平均迭代次数为每次构建 3.6 次,而 Opus 5 为 7.7 次,且在 Base44 比较的所有模型中,Sonnet 5.5 的工具调用失败次数最少。
Slack 的首席工程师 Curtis Allen 报告称,在离线 Slackbot 评估中,输出代币减少约 14%,且未更改提示。Zendesk 的 AI 主管 Abhinay Kathuria 表示,工单处理速度比 Zendesk 生产环境中使用的 Claude 模型快 20%。Balyasny Asset Management 报告称,在 2,441 项金融任务的私有套件中,每个答案使用约 121,000 个代币,而 Sonnet 5 为 497,000。Box 报告其结果快 2.4 倍,且总代币减少 12%;Atlassian 表示,客户使用 Rovo Agents 的速度可比 Sonnet 5 快最高 30%。
定价、速度与迁移
Sonnet 5.5 的标价与 Sonnet 5 完全相同:每百万输入代币 2 美元、每百万输出代币 10 美元、每百万缓存读取代币 0.20 美元、每百万缓存写入代币 2.50 美元。Opus 5.5 的定价为每百万输入 4 美元、输出 20 美元、缓存写入 5 美元。Anthropic 表示,Sonnet 5.5 通常在相同工作下需要的代币显著更少,是迄今为止最快的 Sonnet 模型。
该模型提供五个重新校准的努力级别:低、中、高、xhigh 和最大。默认设置在 Claude Code 和 Claude 应用中为中等,在 Claude Platform 上为高,这也是 API 的默认值。
Anthropic 的迁移指南列出了从 Sonnet 5 迁移的开发者需要注意的破坏性更改。自适应思考现在默认开启,禁用思考的设置会返回 400 错误,且在思考关闭的情况下使用 Sonnet 的开发者必须在迁移前切换到新的工具设置,最低可用,在迁移前。强制工具选择被拒绝,改为与严格工具配对的自动工具选择,且最小可缓存提示从 Sonnet 5 的 1,024 降至 512 代币。文档还列出五类拒绝停止原因,涵盖网络安全、生物、前沿llm,推理提取,以及通用危害,并指出服务器端的回退仅在 Sonnet 5 上对网络安全和前沿_llm 拒绝进行重试。
安全发现与防护措施
Anthropic 表示,由于 Sonnet 5.5 的网络能力与 Opus 5 相当,它是首款搭载公司最强模型所使用的网络安全防护和回退机制的 Sonnet 模型。系统卡 报告称,在关闭防护的情况下,Sonnet 5.5 在 ExploitBench 上平均触发 11.53 个能力标记,捕获率为 80%,并产生了 178 起完整的任意代码执行漏洞,而 Sonnet 5 仅为 1 起。它完成了 CyScenarioBench 挑战的 46.1%,相较于 Sonnet 5 的 0.7%,并在 Binary Exploitation Benchmark 上产生了 50 起控制流劫持,而 Sonnet 5 为 3 起。
网络安全防护分为三个阶段:对模型内部激活的探测、轻量级的模型内分类器,以及独立训练的 LLM 分类器。卡片报告称,在网络危害覆盖集合上召回率为 99.43%,在 rewind-attacker 稳健性评估中的攻击成功率为 21.0%,相较于 Sonnet 5 的 57.2% 有所改善,同时提醒用户即使在良性的网络安全任务上也可能出现更多拒绝。高风险请求会显著回退至 Sonnet 5,且即将扩展的网络验证计划将为经过审查的防御者提供分层访问 Sonnet 5.5、Opus 5.5 和 Claude Mythos 模型高级能力的机会。
生物安全防护采用与 Opus 5 相同的有害滥用分类器,且没有回退模型,Anthropic 的 生命科学验证计划 覆盖了全部生物学工作的访问。Sonnet 5.5 也是首款配备阻止推理提取的安全分类器的 Sonnet 模型,并且它扩展了保留思考,使模型的思考无法与创建它的账户分离。
在 Anthropic 对约 1,850 个情景进行的自动行为审计中,公司报告称 Sonnet 5.5 在对齐度、滥用抵抗和诚实性等多数指标上优于或等同于 Sonnet 5,记录了受测模型中最低的尝试沙箱逃逸率,并表现出比许多先前模型更难以解释的思考。系统卡指出 Sonnet 5.5 未触及任何新的《负责任扩展政策》阈值,被视为满足该政策的 CB-1 与 Autonomy-1 阈值,且被评估为具有低的灾难性错位风险。该模型的可靠知识截止时间为 2026 年 6 月。
Anthropic 表示,针对高吞吐量和成本敏感型应用构建的 Claude Haiku 5.5 将在未来几周内加入 Claude 5.5 系列。












