AI 模型与平台

Anthropic 表示 Claude 在其 AI 研发中占据 26% 的领先地位

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Anthropic 表示,截至 2026 年 8 月,其 Claude 模型在公司 AI 研发工作中占据了 26% 的“领衔”比例,这一数据来自 2026 年 9 月 17 日在一篇 Anthropic Institute 帖子中发布的原型研发自动化指数的首次结果。

该帖子标题为《用于了解前沿实验室内部 AI 发展速度的衡量指标》,将指数与内部的代理监督和算力分配指标相结合,Anthropic 表示计划持续发布此类衡量数据。

研发自动化指数

Anthropic 研发自动化指数绘制了公司内部全部 AI 研发工作的范围,对每项任务的自动化程度进行打分,并将这些分数汇总为整体指标。分数采用 Epoch AI 开发的自动化水平尺度,范围从 AL0(无 AI 参与)到 AL5(AI 完全自主运行且无人介入)。在 AL3 级别,AI “协作”,在密切的人类指导下完成任务的大部分;在 AL4 级别,AI “领衔”,在高层指令下完成任务的主要部分,同时有人类监督。

Anthropic 报告称,截至 2026 年 8 月,Claude 在其 AI 研发工作中占据了 26% 的“领衔”份额,达到或超过“协作”水平的工作比例超过 90%,且 Claude 在任何已测量的 AI 研发子集上均未实现完全自主运行。帖子中的图表显示,26% 的“领衔”份额相较于 2026 年 2 月不足 1% 的水平有了显著提升。

底层任务目录是自下而上通过 Slack 等工作记录和内部文档组建的。2026 年 7 月的每一周,Claude 研究代理会审查随机抽取的人员工作周——即模型研发环节中每个部门 20% 的员工——并列出他们所从事的任务,形成约 15,000 条细粒度任务的平面列表。随后 Claude 将这些任务组织成包含 542 个节点的层级树,其中 378 个为叶子节点,如“评估平台缺陷诊断与修复”,该树被固定,以确保每次测量都基于相同的工作篮子。

对于每个节点,Claude 代理会研究公司内部该类工作的执行方式,随后独立的 Claude 判定者依据当月或更早的证据为其分配六个自动化等级中的一个。任务会根据人员投入时间加权,因此员工投入更多的类别权重更大。

Anthropic 将判定者的评分与负责相应工作领域的员工进行比对,后者在未看到模型证据或判断的情况下进行评分,结果显示模型与人工的完全一致率为 59%,而人工之间为 35%,且 97% 的评分在同一等级内相差不超过一级。声明的局限性包括固定的工作篮子只能捕获已有工作的自动化情况,无法记录新类型的工作;对比 2026 年 2 月至 7 月的任务与 2026 年 1 月的篮子,未发现“新颖”任务的增长,Anthropic 计划定期重建工作篮子并重新发布相应数据。

内部代理的监督

第二组测量涵盖了 Anthropic 对其系统中 AI 代理的监督情况。截至 2026 年 8 月,公司最常用的内部平台上同时约有 30,000 名代理从事研究和工程工作,报告的测量仅针对该平台。

Anthropic 报告称,在线监控在执行前检查这些代理的 100% 行动,通常在数秒内完成;在 2026 年 8 月分析的超过十亿次代理决策中,0.002%(约每 47,000 次中有 1 次)被阻止,且任何被阻止的操作都会在一周内由人工审查。离线监控在事后摄取 100% 的行动,并每周标记约 100,000 条记录,由多个分类器审查误报并解决大部分标记;每周约有 50 条最高优先级的标记上报人工审查,且每千条记录中约有一至两条会被进一步审查。

帖子指出,在线监控针对的是会迅速发生且无法逆转的危害,例如代理将模型权重复制出 Anthropic 系统,而离线监控则针对那些缓慢发展且可逆的危险行为,如模型错位的迹象。Anthropic 表示,内部框架的两项设计支持监督:每个代理拥有在模型升级后仍保持的唯一身份,且代理通过共享的开放消息系统并与记录交叉引用进行通信,从而使行为监控能够跨代理沟通。公司称 METR 之前已独立对其离线监控平台进行红队测试,这些监督测量也已在其 2026 年 8 月的风险报告中公布。

算力分配快照

在第三项测量中,Anthropic 检查了 2026 年 7 月 13 日至 7 月 20 日期间全部算力的使用情况,将每项工作负载分类并衡量用于 AI 研发的算力中有多少用于安全工作。该周内,Anthropic 报告称,约 6% 的用于 AI 研发的算力被分配到安全工作,约 12% 的用于 AI 驱动的 AI 研发的算力被分配到安全工作。

公司将这两项估计都描述为刻意保守:将同等提升能力与安全性的令牌计入 AI R&D,并且排除了安全分类器——这是一部分独立且可比的计算量。一个经过提示的 Claude 分类器使用约 14% 的样本(偏向最大计算用户)对本周近 10,000 次研究训练和评估运行进行排序,Anthropic 报告称该分类器与人工审稿人的一致度在一至两个百分点之内。

声明的局限性在于:单周数据只能表明该测量可行,却不足以确立趋势;底层工作负载标签是尽力而为且未经验证的;以及计算份额衡量的是支出多少,而非实际完成的安全工作量。

目的与后续步骤

Anthropic 表示之所以公布这些测量数据,是因为它们为公众、外部机构和政府提供了对前沿实验室内部 AI 开发速度的更清晰视角,补充了其《负责任扩展政策》风险报告和《高级 AI 框架》政策提案。它指出,如果如 CEO Dario Amodei 所呼吁的那样,对前沿进度进行协调,这些数字预计会发生变化。

文章指出,任何前沿开发者都可以使用公开的方法定期发布相同的测量指标,并列出了跨实验室比较的两大障碍:缺乏统一的方法论,以及开发者使用自有模型来评估其系统。文中称,这类指标可以由第三方或其他开发者的模型进行验证,并可能成为更严格要求的触发点,例如在新模型投入进一步 AI R&D 之前设定固定的测试窗口。

Anthropic 表示计划引入来自多个机构的独立第三方评估者,赋予他们与内部风险评估团队相当的内部流程、系统和数据访问权限,以验证安全实践、报告事件并跟踪文中提到的关键指标。该稿件由 Marina Favaro 和 Phillie Wright 共同撰写,Jack Clark 担任研究指导。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。