思想领袖
克劳德“削弱”辩论并非关于克劳德,而是关于当您的运营依赖于他人决策时会发生什么

今年早些时候,AMD 人工智能高级总监斯泰拉·劳伦佐(Stella Laurenzo)发布了近 7,000 个克劳德代码会话的遥测数据,记录了工程师们一直感受到但难以表达的事情:从一月到三月,明显的推理深度下降了 73%,每项任务的 API 调用量增加了 80 倍,模型在进行编辑之前读取的文件也大大减少。这些数字迅速传播开来,解释也迅速传播开来。
Anthropic 辩称这些变化反映了故意的产品决策,包括新的自适应思维机制和将中等努力作为默认设置。独立分析师也对方法的某些部分提出了异议。辩论正在进行中,理性的人们对实际发生了什么存在分歧。
但这里是如果您正在使用这些系统运行业务时最重要的部分:无论这是退化还是故意调优,企业运营商都无法预测,也无法控制。有些人在生产中感觉到了这一点,甚至在他们理解发生了什么之前。 这才是真正的故事,它与 Anthropic 无关。
这是一种依赖问题,而不是模型问题。
我们所描述的现象有一个名称:模型脆弱性。这是指关键业务运营与单个模型的行为紧密耦合的状态,因此模型层的任何变化,无论是调优决策、新的默认值、容量驱动的路由转换还是安静的弃用,都会直接影响业务,没有缓冲区,也没有警告。
这不是一个新模式。GPT-4 在 2023 年经历了一次这样的事件。克劳德 3.5 在 2024 年经历了一次。克劳德 Opus 目前正在经历一次。下一个前沿模型和之后的模型也会经历一次。不因为任何供应商是出于不良意图,而是因为优化前沿模型以实现成本、延迟和规模的全球体积是前沿供应商必须做的事情。他们的激励和企业在其上运行生产运营的激励有关。它们是相关的,但不相同。它们永远不会相同。
我们于 2023 年创立了 Qurrent,并拥有历史知识,了解企业软件周期如何展开:一家公司投资人工智能。演示有效。试点有效。然后它上线了,模型层发生了变化,突然客户拥有了问题。他们是维护工作流程、追踪回归、吸收中断的人。对我来说,这从来不是一种可持续的企业运营模式。
企业版本的故事是运营性的,而不是技术性的。
对于开发人员来说,当前的情况是令人不便的。令牌预算燃烧得更快。编码会话停滞。基准测试令人失望。这是一个真正的问题,但这是一个可以恢复的问题。
对于运行财务运营、合规工作流、应收账款和应付账款以及复杂的后台流程的企业来说,风险是不同的。这些工作流程无法承受糟糕的一周。错误会累积。数量会累积。服务级别协议是对实际客户的承诺,而不是内部偏好。一旦模型开始在高风险流程中表现不佳,损害就会开始积累,无论是否有人注意到。
使其更加困难的是,大多数试图通过在单个模型上构建内部代理来领先人工智能的公司现在发现,他们的基础不够完整。第一个代理是容易的部分。没有建立的是周围的基础设施:可以在问题影响客户之前检测到行为漂移的评估框架;可以在模型开始表现不佳时自动将工作重定向的故障转移逻辑;以及能够跟上每个季度变化的土地的持续治理。这些三个缺口不会保持可控。它们会发展成为一个永久的工程职能,没人为此预算,也没人为此配备人员,他们的工作本质上是跟上他们无法影响的供应商的决策。
生产中的真正韧性是什么样的。
在 Qurrent,我们从一开始就将数字工作人员设计为模型无关的,不是作为营销立场,而是作为架构要求。每个任务都路由到该任务的最佳执行模型,持续评估。当更好的模型发布时,客户会自动获得它。当当前模型在特定工作流程上回归时,编排层会在几秒钟内无人干预地将工作重定向,也不会在 2 点醒来接收 Slack 线程。
在下面,自动模拟会在生产工作流程上全天候运行,测量输出是否与预期行为相匹配。漂移会在基础设施层被检测到,在运营团队感受到它之前很久,也在客户之前很久。每个数字工作者做出的每个决定都会被记录和审查,这是一个完整的透明盒,因为您无法治理您看不到的东西。
这些并不是高级功能。它们是以企业规模运行人工智能的入场费。大多数公司正在学习这一点,这是在新闻周期中的一种昂贵方式。
这个季度值得提出的问题。
如果您最依赖的模型下个季度有一个糟糕的周,多少个工作流程会受到影响?您将如何知道?您将如何快速地绕过它?
如果第二个问题的答案是“我们会从客户那里听到”,那么该运营并不是生产就绪的。它是一个在大规模运行的试点,这个区别对大多数领导者来说更重要,他们意识到这一点的时间比他们意识不到的时间要长。
当前的辩论以一种反直觉的方式是有用的。每个观看这一幕的 CFO 和 COO 都得到了对模型脆弱性在实际运营负载下的免费预览,而无需自己付费。正确的回应并不是切换模型。它是建立不依赖于单个模型的运营。
技术将继续变化。这是这个市场中唯一的确定性。在本十年中走出来的最强大的企业将不是那些选择了正确模型的企业。它们将是那些从来不需要关心其运营的企业。












