思想领袖
为什么 Token 成本正在击穿 2026 年的 CFO 预算

不到一年,AI Token 成本就从一个次要的技术细节,变成了董事会层面的预算难题。12 个月前,“Token 成本”还不在大多数 CFO 的关注清单上;如今,它却出现在各种不该出现的地方:新闻报道、内部备忘录、预算冻结和财报电话会议。
2025 年末,Uber 向工程师开放了 Claude Code。到 2026 年 4 月,该公司只用四个月就耗尽了全年的 AI 编程预算。据 Bloomberg 最先报道,Uber 随后把每名员工使用每项工具的支出上限设为每月 1,500 美元。如果允许同时使用两种智能体编程工具,例如 Claude 和 Cursor,这一上限就会翻倍至每名工程师每月 3,000 美元,也就是一个人每年使用 AI 的成本达到 36,000 美元。据估计,Uber 约有 4,000 名工程师,这意味着 AI 支出可能达到 1.44 亿美元。
Meta 的支出可能更高。一份内部备忘录警告称,2026 年 AI Token 成本可能达到数十亿美元。原因在于智能体大规模运行时的工作机制。当 AI 智能体连接代码库以修复错误或编写软件时,每接收一次提示,它都会处理数千个用于背景上下文的 Token。把这种机制放到 Meta 这样规模的组织中,再加上公司推动工程团队使用 Claude,Token 用量就不只是增长,而是爆炸式上升。
根据 Ramp AI 指数的数据,该指数追踪了 70,000 多家企业向供应商支付的实际款项,在 AI 应用方面排名前 1% 的公司目前每名员工每月大约要花费 7,500 美元,而且这项支出正以每月 14.1% 的速度增长。AI 招聘初创公司 Mercor 的高管曾公开表示,在一些组织中,AI Token 成本已经开始接近甚至超过员工薪酬。
这里有一个值得吸取的教训。如果世界上最大的科技公司都会对这项支出感到意外,任何组织都可能遇到同样的问题。Token 消耗已经成为一种真正全新的支出类别,两年前任何损益表上都没有这一项。它的表现方式不同于财务团队几十年来一直在学习建模、并纳入传统投资回报率计算的软件成本。理解为什么 AI Token 成本与传统软件支出的表现如此不同,是控制这类成本的第一步。
为什么 AI Token 成本如此难以预测
传统软件预算建立在一个简单假设之上:成本随员工人数增加。新增 10 名员工,就需要以已知价格增加 10 个席位。当公司发展壮大或购买新的软件平台时,这很容易预测和规划。
AI Token 打破了这一假设。成本随使用量而不是员工人数增长,而使用量极不均衡、难以预测;对于自主智能体来说,它甚至不再与坐在键盘前的人相关。一名工程师运行一次智能体编程会话,就可能在没有任何预警的情况下于一个月内消耗数千美元,因为无论产出是否有用,计费器都在持续运行。许多模型还会生成数千个隐藏、不可见的 Token,只为在回答之前一步步“思考”,从而成倍增加每条提示的成本。
这正是大多数组织尚未纳入定价的问题:用于智能体 AI 的每一美元新增支出,都必须从其他地方获得。对大多数 CFO 来说,这并不是可以由创新基金吸收的四舍五入误差,而是数百万美元的新增支出,这些支出两年前根本不存在。因此,它会与员工数量、其他技术投资或企业其他领域的可自由支配预算形成真正的取舍。
企业 AI 支出风险的三个层级
观察各组织实际如何在 AI 上花钱,可以看到越来越清晰的规律。AI 成本风险并非均匀分布,而是集中在特定领域。在典型组织中,目前三个层级里可能只有一个处于受控状态。
销售、营销和运营领域的业务用户主要使用按席位定价的工具:每名用户每月固定 20 至 30 美元。财务部门已经知道如何为这一层级编制预算,因为它的行为方式与过去 20 年采购的其他任何 SaaS 项目完全相同。
使用智能体编程工具的开发人员正是 Uber 这类案例的来源,而整个类别刚刚从固定费用转向按量计费。2026 年 6 月,GitHub Copilot 转向基于 Token 的计费方式,开发人员预计月度账单可能从 29 美元跃升至 750 美元,而在高强度智能体会话中,则可能从每月 50 美元增至 3,000 美元。Uber 并非例外,而是提前展示了整个类别的发展方向。
自主智能体是几乎没有人进行过建模的层级。智能体不存在“席位”概念。它可以在无人值守的情况下运行、启动子智能体、失败后重试,并在整个过程中持续消耗 Token,无论它是否产生任何价值。这是成本数据最少、预算先例也最少的层级。
简而言之,CFO 最熟悉的层级同时也是财务风险最小的层级。真正导致预算失控的另外两个层级,恰好在使用量增长最快之时放弃了可预测的定价方式。
弥补 AI 成本管理缺口
Uber、Meta 和 Ramp 更广泛数据集的共同点是缺乏可见性。大多数组织在员工或智能体与其打开的工具之间没有控制层。像 Uber 这样的支出上限,是对一个其实需要在上游解决的问题所采取的粗略事后补救措施。
一种较新的工具类别正是为了解决这一缺口而出现,通常被称为智能体编排或智能体网关:把每项任务路由到能够处理它的最便宜模型;在支出超过限制之前强制执行限额;并为财务部门提供实时计量,而不是每月收到意外账单。
这一类别发展迅速,而且已经分化为几个不同层级。其中一层是成本控制网关,它位于组织的应用程序与模型供应商之间,增加按团队设置的支出上限、把简单任务自动路由到更便宜的模型,以及缓存响应等功能。这些正是 Uber 在设置上限时手动使用的手段。第二层是智能体编排,重点是协调多个智能体协同工作;成本可见性越来越多地从一开始就内置其中,而不是事后补装。还有一个较新的、面向财务部门的层级,开始以 FinOps 团队长期管理云支出的方式来管理 AI 支出:按照团队和功能归属成本,制定预算并进行月度审查,而不是事后才发现。
此外,还有一种架构方法,旨在通过减少对大型语言模型的依赖来限制支出。一些公司已经开始创建混合 SLM/LLM 架构,让小型语言模型针对一组范围有限的企业任务进行训练,例如内部政策、客户服务、贷款文件处理或解析运输舱单。其经济效益可能非常可观。
根据一项 2026 年企业 LLM 对比,在每月 100 万次对话的规模下,托管式前沿 LLM 的月成本为 15,000 至 75,000 美元,而在相同用量下,经过微调并在内部部署的小型语言模型每月仅需 150 至 800 美元。例如,Goldman Sachs 通过集中式模型网关大规模管理 AI 支出。该网关按任务类型对每个请求进行分类,并把请求路由到完成该工作成本效益最高的模型,从轻量级开源模型到前沿 LLM,全部都在公司自己的安全边界内运行。
共同点在于,当今大多数工具都是由工程师为工程师构建的,目的是通过使用智能体大幅提高生产力。大多数组织仍然缺少的,是能够直接回答 CFO 问题的那一层:哪个团队、哪个预算,如何预测支出,以及这些支出支持什么业务用例?随着智能体 AI 支出不断累积,这个缺口很可能会变得最为重要。
两年前,这一切都还不是单独的预算项目。如今,AI Token 成本已成为资产负债表中增长最快、也最不为人理解的项目之一,AI 成本管理正在迅速从附带项目转变为核心财务职能。云技术最初得到采用时,我们也见过类似情形:第一波应用让成本激增。计划部署智能体 AI 的组织,应当现在就让工程与财务部门展开这场讨论,并制定管理方案。Uber 和 Meta 已经展示了事后讨论而不是提前讨论会带来什么结果。












