AI 模型与平台

Anthropic 将 Claude Opus 5.5 的定价与更长的编码会话关联

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Anthropic 在 2026 年 9 月 24 日报告称,Claude Code 会话在过去六个月中变得更长且上下文更重,并在 Claude 博客上的文章 中详细说明 Claude Opus 5.5 的定价和缓存机制如何应对这一变化。该公司估计,Opus 5.5 的运行成本大约比 Opus 5 低 40%,以典型的按令牌计费工作负载为基准。

Claude Code 六个月使用数据

该文章由 Michael Segner 撰写,基于覆盖 2026 年 3 月至 9 月的整体使用数据。文章报告称,每个会话的提示数量保持稳定,而每个提示内部的工作量增长:模型现在在每个提示上工作时间是原来的 3.3 倍,且每个提示的模型调用次数增加了超过 40%,中断率下降了 68%。开发者现在连接工具服务器或使用技能的频率约为之前的两倍,而粘贴文本到提示中的频率则降低了三分之一。

在此期间,每个请求的上下文量增长了 2.6 倍,输入‑输出令牌比例从 189:1 上升至 324:1。Anthropic 将这些数据解读为开发者希望让模型在更大、更开放的任务中进行更长时间、信息更充分的工作,并表示在按令牌计费的情况下,Opus 5.5 的节省在这些更长、更高上下文的会话中最为显著。

该分析基于 Anthropic 发布的 Claude Opus 5.5,该版本的价格低于 Opus 5。发布时确定了价格后,9 月 24 日的文章以及 Addy Osmani 于 2026 年 9 月 22 日发布的配套分析,审视了这些价格对实际 Claude Code 工作负载的意义。

令牌价格与缓存读取折扣

对于按令牌计费的使用,Anthropic 将输入和输出令牌价格降低了 20%,并将读取缓存令牌的费用削减了 60%。公司表示,缓存读取的降价最为关键,因为缓存读取占据了代理和编码工作成本的主要部分,并称截至出版时,Opus 5.5 的缓存令牌费用仅为竞争模型的五分之一,并且表现优于它们。

Osmani 的配套分析列出 Opus 5.5 的 API 价格为每百万输入令牌 4 美元、每百万输出令牌 20 美元、每百万缓存读取 0.20 美元。按此价格计算,缓存读取的费用相当于新输入令牌的 5%,而写入缓存的费用在五分钟缓存下为输入价格的 1.25 倍,在一小时缓存下为输入价格的两倍,并且每次命中都会免费延长缓存寿命。对于 Pro、Max 或 Team 计划,较低的 Opus 5.5 价格会转嫁到计划额度上,使其比 Opus 5 多约 25%;额外的缓存读取折扣仅适用于 API 定价。

利用保护缓存的更改

文章报告称,即使每次请求的上下文量大约增长了 2.6 倍,未命中缓存的输入比例在六个月内下降了超过 50%。这归功于一系列 Claude Code 的更改,能够减少意外的缓存中断,涵盖了登录刷新等小规模中断以及对话中途添加指令或按需加载工具等更大规模的中断。在 Opus 5.5 和 Fable 5.1 上,开发者还可以在会话中途更改工作负荷级别而无需重置缓存。

官方 提示缓存文档 指明,工作负荷级别的行为仅在使用 API 密钥或 Claude 订阅时适用,而不适用于 Amazon Bedrock、Google Cloud 的 Agent Platform、Claude 应用网关,也不在设置了 CLAUDECODEDISABLEEXPERIMENTALBETAS 标志或组织拥有 HIPAA 配置时适用。

使用 API 密钥和云服务的开发者现在可以设置一小时的缓存生命周期,这一点订阅者此前已经拥有。文档显示默认设置为:在 Claude 订阅的计划使用范围内,主会话的缓存时长为一小时;在使用积分、API 密钥或云服务时为五分钟。promptCacheTtl 设置或 CLAUDECODEPROMPTCACHETTL 环境变量可选择更长的生命周期,且这两项控制均要求 Claude Code v2.1.242 或更高版本。

分叉的子代理现在直接从父会话的缓存开始,而无需重新处理相同的上下文。文档解释说,分叉会接管父级的系统提示、工具集以及完整的对话历史,因此其首次请求直接读取父级缓存。

每任务更少回合

Anthropic 报告称,Opus 5.5 能够在更少的回合内完成任务。文章指出,Zeta Labs 记录的每任务回合数和工具调用次数均少于 Opus 5,且成本接近一半,同时完成了两倍数量的最难任务。

文章提醒此模式并不适用于所有任务,并引用 Osmani 的分析:“在范围明确的任务中,两种模型的回合数大致相同,唯一得到的就是价格折扣。差距应在开放式任务中最大,因为模型可能在错误思路上花费大量回合。”

Anthropic 还报告称,Opus 5.5 的输出速度比 Opus 5 快了超过 30%。这一提升并未改变令牌使用量和缓存命中率;文章指出,它缩短了长时间运行的等待,因为 Claude 能够更长时间地无人值守工作。

文章最后提出了保护缓存读取的做法:在 Claude Code 中运行 /usage 以查看会话中有多少比例是从缓存提供的;在会话开始时选择模型,而不是在进行中切换;在离开之前而不是之后运行压缩;在使用 API 密钥或云服务商时,为长会话启用一小时的缓存生命周期。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。