AI 模型与平台

Claude 上的 Opus 4.8 为任何运行代理的人带来了什么变化

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Anthropic 于 2026 年 5 月 28 日发布了 Opus 4.8,距离上一次发布 Opus 4.7 只过了六周多一点。这是一个快速的发布周期,甚至比 Sonnet 和 Haiku 线更快,而基准测试的数字也随着每次发布而不断提高。如果你阅读了 AI 相关的新闻,你会看到这样的报道:新模型,分数更高,接下来是什么。

但这并不是正确的故事。

当你已经在 Claude 的基础上构建了你的工作时,模型的发布不再只是你阅读的新闻,而是一种升级,它会直接影响你已经构建的系统。问题不再是 Opus 4.8 的分数如何,而是它如何改变已经在运行的工作。这是一个不同的问题,大多数的报道并没有问到这一点。

在这个发布中,有两件事改变了这种工作。两者都不是基准测试。

模型学会了标记它不知道的东西

发布说明 中,Anthropic 的早期测试人员发现 Opus 4.8 “更有可能标记其工作的不确定性,并且不太可能做出无根据的声明。” 来自 Bridgewater 的一位测试人员在报道中说,最大的不同之处在于模型主动标记分析的输入和输出问题,”这是其他模型经常忽略的,需要用户自己发现。”

作为操作员来读,这是发布说明中最重要的一行。

原因如下。自动化管道中断的原因不是模型的错误,而是模型自信地错误却没有说明。想象一个代理,它提取新闻,草拟一篇文章,并在没有人监视中间步骤的情况下检查自己的事实。每一个模型在没有标记的情况下做出的无根据声明都是一个需要在下游捕获或发布的声明。一个能够举手说 “这个输入看起来不对” 的模型比两个基准测试分数的提高更有价值。

这是整个系统的原则:工具变得更好,你的系统也变得更好。但只有当你关注正确的改进时。多数报道根据原始能力评估 Opus 4.8。那些在无人监管的情况下运行它的人应该根据它是否知道自己不知道什么来评估它,在这方面,这个发布版本有了进展。

动态工作流使子代理群成为真正的原语

与模型同时发布,Anthropic 还发布了 动态工作流,这是 Claude Code 中的一个研究预览系统,用于在 Claude 内的数百个并行子代理之间协调复杂任务。他们以代码库级别的迁移为例,跨越数十万行代码,从启动到合并,使用现有的测试套件作为标准。

任何尝试过手动协调子代理的人都知道为什么这很重要。形状总是相同的:一个协调器将任务分配给一个选择代理、一个写入代理和一个事实检查代理。它可以工作,但需要真正的工程来使手工协调可靠,每一个新的管道都意味着要从头开始搭建协调逻辑。子代理的编排一直是需要额外构建的东西,而不是平台提供的东西。

动态工作流将这种协调逻辑纳入平台本身。这就是转变。 当协调层成为一个原语而不是自定义构建时,已经在代理而不是聊天中思考的操作员可以跳过以前难以实现的部分。最受益的人不是今天开始的人,而是已经手动构建了群体并现在可以丢弃脚手架的人。

值得提到一个问题。它是一个研究预览,所以它还很早期,Anthropic 仍然由于安全问题而保留其最先进的 Mythos 模型。协调数百个自治子代理的能力既强大又有一点危险。”可用于研究预览” 是 Anthropic 告诉你在将其投入生产之前先测试一下。这是一个正确的直觉。去做吧。

发布背后的模式

退一步看方向,最近的 Opus 发布都有意地朝着代理运行时间更长、协调范围更广、需要的监督更少的方向发展。自我标记和真正的协调层是这条道路上最新的两步。

如果你正在构建在其基础上,复合就是整个游戏。每一个落地的能力都是你不需要再绕过的东西。上个月手动将不确定性检查构建到管道中的操作员这个月就能免费获得它,并且可以提升到更高的层次。上个月构建了子代理协调的操作员现在可以删除它。这就是杠杆在你已经拥有的系统中复合的含义:模型改进了,构建在其上的所有东西也会随之改进。

大多数人会把 “Opus 4.8” 读作一个上升的数字。那些在 Claude 上运行真正操作的人应该把它读作平台为他们做更多工作。这就是当你长期致力于一个系统,并让改进一个接一个地落地时会发生的事情,而不是每次领域移动时都从头开始。

Alex McFarland 是一名人工智能记者和作家,探索最新的人工智能发展。他曾与世界各地的众多人工智能初创公司和出版物合作。