AI 模型与平台
OpenAI 将其两款更便宜的 GPT-5.6 模型的 API 价格降低

OpenAI 于 2026 年 7 月 30 日降低了其两款更便宜的 GPT-5.6 模型的 API 价格,降低了最便宜的层的价格 80%,中档层的价格 20%,而其旗舰产品的价格保持不变。该变化记录在公司自己的 API 更新日志 中,并已在 发布的费率表 上生效。
每百万个输入和输出令牌,当前的标准费率为:
- GPT-5.6 Luna: 20 美分和 1.20 美元,较之前的 1 美元和 6 美元下降
- GPT-5.6 Terra: 2 美元和 12 美元,较之前的 2.50 美元和 15 美元下降
- GPT-5.6 Sol: 5 美元和 30 美元,保持不变,与其前身 GPT-5.5 的费率相同
这三种层级于 2026 年 7 月 9 日以更高的价格推出,这意味着重新定价发生在它们商业生命周期的三周内。
降价影响了费率表上的所有服务层级,不仅仅是头条费率。批处理和 Flex 处理的价格均为标准价格的一半,现在 Luna 的输入价格为 10 美分,输出价格为 60 美分。缓存输入读取的价格降低了 90%,现在 Luna 的价格为每百万令牌 2 美分,Terra 的价格为 20 美分。长上下文请求的价格为输入价格的两倍和输出价格的 1.5 倍,现在 Luna 的价格为 40 美分和 1.80 美元。通过 Amazon Bedrock 购买的客户由 AWS 计费,OpenAI 指出这些价格可能与其自己的价格不同。
更便宜的层级是高容量生产流量的所在地:分类、提取、请求路由、初步草稿和长代理循环,其中一个用户指令可以在返回答案之前触发数十个模型调用。五倍降低吸收该容量的层级的价格改变了哪些工作量值得自动化的算术。
Claude 中更便宜层级的位置
在 20 美分输入和 1.20 美元输出的价格下,Luna 的价格低于 Anthropic 最便宜的已发布模型 Haiku 4.5 的输入价格五倍和输出价格四倍,根据 Anthropic 的定价页面。Terra 的新价格低于 Claude Sonnet 5 的 3 美元和 15 美元,后者将在 2026 年 8 月 31 日其介绍性费率 2 美元和 10 美元到期后收取。在两家产品线的顶端,Sol 的输出价格仍高于 Opus 5,后者由 Anthropic 以 5 美元和 25 美元的价格出售。
优先处理变为快速模式
同一更新日志条目退役了优先处理并用快速模式取代了它。对于 Sol,OpenAI 表示快速模式的运行速度最高可达标准速度的 2.5 倍,价格为标准价格的两倍,且该更改是向后兼容的:已标记为优先处理的请求将自动路由到快速模式,无需代码更改。快速模式的费率为 Sol 的 10 美元和 60 美元,Terra 的 4 美元和 24 美元,Luna 的 40 美分和 2.40 美元。
Anthropic 以相同的产品名称和条款出售相同的产品:Opus 5 的快速模式,最高可达标准速度的 2.5 倍,价格为标准价格的两倍。两家公司的费率表现在也在区域固定推理上收敛。OpenAI 对于 2026 年 3 月 5 日或之后发布的模型,当客户需要数据驻留时,收取 10% 的上涨费;Anthropic 以 1.1 倍的标准费率计费美国仅限推理。
更便宜层级变得更便宜的原因
OpenAI 在降价的前一天发布了其会计报告。2026 年 7 月 29 日,在一篇 工程帖子 中,五名技术人员描述了推理和代理工具箱后面的优化,后者支持 Codex 和 ChatGPT Work。Sol 重写了公司的生产 GPU 内核;结合更广泛的内核工作,OpenAI 表示这降低了端到端服务成本 20%。Sol 还在数百个实验中重新设计了其推测解码草稿模型,该公司认为这提高了令牌生成效率 15% 以上。
这些是 OpenAI 自己的数字,适用于其自己的技术栈。该帖子以承诺“将内部改进以更广泛可用、更具成本效益的智能的形式传回给我们的用户和客户”结尾。费率表在一天后跟进。
工具箱工作指向与价格降低相同的成本中心。OpenAI 默认将工具输出限制为 10,000 个令牌,并保持模型可见的历史为追加模式,因此代理循环在每个步骤都重新发送其指令和工具定义时,会击中提示缓存而不是支付全额输入费率。在需要 30 个模型请求的任务中,有 30 次机会避免重新计算相同的前缀。
降价发生在买家审计推理支出并扩大哪些团队接触模型时:OpenAI 自己的研究发现员工使用 ChatGPT 超出了他们的职称。同一天,Amazon 的工程组织 在成本超支后移动以限制 AI 支出,OpenAI 于 2026 年 7 月 22 日为 API 组织和项目提供了硬性支出限制,允许管理员设置一个月度上限,一旦跟踪支出达到该上限,就会开始返回错误。
对于已经将批量工作路由到 Luna 的团队,相同的调用现在只需以前价格的五分之一,并且可以在仪表板中设置上限。由于 Sol 的价格保持不变,实时决策保持在 OpenAI 自家族发布以来一直保持的位置:每个请求需要哪个层级。












