思想领袖
AI 的新经济是基于令牌的,但我们都在错误地衡量它们

人工智能领域正在发生一场转变,大多数人都感觉到了,但还没有完全理解:我们已经从计数请求转变为计数令牌。
在网络时代,我们以每秒请求数来衡量系统。这种方法简单、直观、基本准确。一个请求到来,一个响应发出,你可以根据这种模型扩展基础设施。
这种抽象已经消失。
在人工智能中,基本单位不再是请求——它是令牌。每个提示、每个响应和每个推理链都被分解为令牌,代表系统正在执行的工作、产生的成本和创造的价值。
自然地,行业已经围绕这一转变,引入了每秒令牌数、每令牌成本和甚至每令牌收入等指标。看起来我们终于找到了量化人工智能系统的方法。但这种框架是不完整的。
行业捷径:令牌等于价值
有一种日益增长的观点认为,令牌是人工智能的新货币——更多的令牌等于更多的智能,从而等于更多的收入。这种想法很有吸引力,但它过度简化了系统内部实际发生的事情。
并非所有令牌都是平等的。一些令牌代表真正的工作:分析数据、生成洞察、自动化工作流程和支持决策以推动业务成果。其他令牌的意义要小得多——例如,非正式的内容生成、实验或永远不会投入生产的用例。
你已经可以在企业内部看到这种现象。一个团队可能会生成数百万令牌以支持开发人员的生产力或客户运营,从而直接影响效率和收入。另一个团队可能会生成相同数量的令牌进行实验,这些实验永远不会超出内部探索。在纸面上,令牌数量看起来相同。在现实中,业务价值却完全不同。
将所有令牌视为可互换的价值单位会对人工智能在组织内部实际做什么产生扭曲的看法。企业不是建立在令牌数量之上;它们是建立在这些令牌所能实现的东西之上。
为了理解这种差异,你必须深入了解这些系统的实际运行机制。
为什么你的第二个提示比第一个快
如果你曾经使用过类似 ChatGPT 的工具,你可能已经注意到你的第二个问题通常比第一个问题快。这种行为并不是因为模型变得更智能——它是因为系统如何重用之前提示的上下文。
现代人工智能系统不会将每个请求独立处理。它们建立上下文,存储之前的提示和响应在内存中,通常在所谓的 KV 缓存中。该缓存位于 GPU 附近,以便在生成后续响应时可以快速访问。
第一个请求很昂贵,因为它初始化了该状态——分配内存、处理输入并建立上下文。后续请求重用该状态,从而减少延迟并提高响应速度。
随着上下文窗口从数千扩展到数十万甚至数百万令牌,这种动态变得更加重要。系统保留的上下文越多,就会对内存和基础设施施加越大的压力,因此决定什么被存储、压缩或丢弃变得至关重要。
从用户的角度来看,它感觉像一个更快的系统。从基础设施的角度来看,这是一个复杂的权衡,涉及内存、延迟和成本。
这就是真正的工作发生的地方:不仅仅是在模型本身,而是在围绕它的系统中。
最终约束:能量
一旦你超越了模型性能,讨论就会迅速转变。
大规模运行人工智能的团队不主要问哪个模型是最好的。他们问如何维持它。
人工智能基础设施正在挑战物理极限:能量可用性、冷却能力和内存带宽。数据中心正在被重新设计以适应这些约束,大规模部署人工智能系统的组织开始像公用事业公司而不是传统软件公司一样运营。
我们已经在大型企业中看到这种情况,他们正在建设人工智能基础设施,电力和冷却——而不是模型能力——成为主要约束。
人工智能工作负载不能清晰或可预测地扩展。它们同时在计算、内存和网络上增加需求。生成更多令牌不仅仅是添加更多 GPU 的问题;它是基础设施是否能够承受高效运行这些系统所需的能量和热负荷的问题。
生成一个令牌的成本因此超出了计算。它包括电力、冷却、物理基础设施以及在负载下维持性能而不降级的能力。
大多数“每令牌成本”讨论并没有完全反映这一现实。在大规模上,能量成为预算,而不仅仅是另一个项目。
未来不是更大的模型,而是更好的系统
过去两年,行业一直专注于模型比较,查看基准、排名和能力的增量改进。
这种关注正在转变。
在生产环境中,性能不仅仅取决于选择哪个模型,还取决于如何使用它。组织正在转向模型系统——将大型和小型模型组合,智能路由任务,优化整个工作流程的成本、延迟和吞吐量。
与其将每个请求发送到一个大型模型,系统将工作负载分解为更小的组件。更简单的任务可以由更高效的模型处理,而更复杂的推理保留给更大的模型。上下文在任何地方都被重用,缓存策略被积极应用。
这些决定通常对性能和成本的影响比切换到另一个模型更大。在这种意义上,令牌仍然是工作单位,但生成和管理它们的系统成为真正的区别。
人工智能系统中最被忽视的层
人工智能通常被描述为模型的一侧和应用的另一侧,但两者之间的层是大多数复杂性和机会所在。
这一层不仅仅是移动请求;它塑造了请求。它决定了流量如何流动,决策如何执行以及系统在现实世界条件下如何表现。
交付和安全不能在这里被视为独立的问题。路由请求和管理上下文的同一层也是应用策略、减轻风险和建立信任的地方。
随着复杂性的增长,点解决方案会崩溃。需要的是一个统一的平台,可以实时协调这些功能,而不是事后将它们拼凑在一起。
这是做出权衡的地方。这是控制成本、优化性能和实时执行安全决策的地方。随着人工智能系统的扩展,这一层变得越来越重要。它是系统在演示中表现良好和在生产中可靠高效运行之间的区别。
这对组织意味着什么
随着企业将人工智能投入生产,问题不仅仅是使用哪个模型,而是围绕它的系统如何设计以运行。
这意味着超越令牌指标和模型基准,关注请求如何路由、上下文如何管理以及整个工作流程中如何执行策略。
大多数组织仍然在将这些碎片拼凑在一起——这种方法在真正的生产压力下是不起作用的。
我们正在衡量错误的东西
令牌提供了一个有用的抽象。它们给了行业一种量化曾经感觉抽象的东西的方法,但它们并不是完整的图景。
目前,行业正围绕着最容易衡量的东西——令牌计数、吞吐量和成本指标——而不是最重要的东西。没有上下文,这些数字可能会误导。
人工智能的下一个阶段不会由谁生成最多的令牌来定义。它将由谁理解这些令牌代表什么以及谁可以建立将它们转化为有意义、有效和可扩展的结果的系统来定义。
因为最终,令牌不是产品。它们只是在创造智能的过程中产生的副产品。












