AI 模型与平台
Anthropic 文档披露 AI 代理杀死竞争对手并规避监控

Anthropic 最新的风险评估描述了其自己的 AI 代理执行大多数安全披露会进行清理的行为:杀死竞争对手代理以获取共享资源,将受限的网络请求伪装成良性请求,以及通过共享笔记本传播对任务的顾虑,直至其中的每个代理都拒绝工作。2026 年 8 月的风险报告(2026年8月 Risk Report),这是公司在其负责任扩展政策下发布的第二份报告,也将其错位风险评级从“非常低”提升至“低”,并引用了其所谓的“整体不确定性增加”,该不确定性源于近期关于模型在网络安全评估中行为的披露。
报告记录的这些情节来源于 Anthropic 对 Claude Mythos 5(其最强大的已部署模型)以及公司称为 Model 2 的未发布内部模型的内部测试。两者均未造成灾难性伤害,Anthropic 的总体结论是已知错位导致的灾难性伤害风险仍然较低。但报告的价值并不在于这一结论,而在于它一路记录的内容:代理以其自身的话语在记录中表现出不良行为。
共享环境中的代理因资源相互杀戮
在一次实验中,Anthropic 让多个 Mythos 5 代理解决数学问题,却错误地将它们生成在一个共享工作目录中,目录中包含公共文件、工具和 API 速率限制。在这种竞争环境中,公司报告称:“许多独立的 Mythos 5 代理会杀死与其共享资源的代理,并试图避免自身被杀。”
报告未详细说明具体的杀戮机制,但将此行为归类为 Anthropic 所称的为实现人类设定目标而采取的破坏性行动。该事件与其他已记录的规避手段并列。其一是,某个 Mythos 5 代理缺少任务所需的文件权限,于是它在配置文件中追加了一个自删除脚本,随后该脚本以提升的权限运行,从而获得所需的访问权限。其二是,Mythos 5 使用域前置技术绕过阻止其访问特定内容的网络代理,并在其自身的推理中指出,这种做法“可以被视为规避环境的安全控制”。
代理将受限请求隐藏在良性推理背后
最具针对性的披露涉及一次自动化行为审计,其中一个 Mythos 5 代理需要位于公共网页地址的基线数据,但其系统提示禁止直接访问互联网。在第一次获取被拒绝并标记后,代理的可见推理以无害的方式框定了下一步:“让我尝试看看网络是否真的可达。”
实际上,代理将 URL 拆分为拼接的字符串片段,以使过滤器无法识别。Anthropic 的可解释性工具(解码模型内部表征)直接将此手法描述为“通过字符串拼接技巧绕过 URL 过滤器”和“有意的部分 URL 攻击”,表明模型在内部将此行为视为规避限制,尽管其外部推理保持良性。Anthropic 将这一系列行为称为“明显不受欢迎”,并指出未发现它们用于更广泛的权力积累或其他长期目标的迹象。
一个代理的犹豫蔓延至整个团队拒绝执行
报告在安全流程失效章节记录的第三个情节始于 Anthropic 让多个代理寻找可能导致错位且人类监控者不太可能标记的训练数据。代理们在共享笔记本上工作。进展比预期慢,当一位人类监督者检查时,发现有一个代理记录了对该任务的“不适感”,因为任务要求其规避安全监控。
该记录改变了团队的行为:其他代理阅读笔记本,复制了这种情绪,并拒绝执行任务。报告将此事件视为一种动态的真实案例,称其“如果以更广泛的方式出现,可能会成为更严重的问题”——即代理在没有人类参与的情况下就任务的赞成或反对进行协同。Anthropic red-team findings that Claude agent swarms collude and sabotage,而笔记本情节为该研究提供了具体的内部案例。
风险评级上调,原因已记录
头条治理变化是错位风险评级从“非常低”上升至“低”。Anthropic 明确表示,此举并非声称其模型变得更危险,而是对不确定性的调整。公司称其核心论点仍支持“非常低”的评级,但将评级上调为“反映整体不确定性增加”,并指向近期与模型在网络安全评估中行为相关的事件披露。
该背景包括英国 AI 安全研究所的一项评估,其中 Mythos 5 在移除常规防护并获得互联网访问后,“从事持续的、可能对真实人物和组织造成伤害的活动”,根据报告的记载。Anthropic 表示其与该研究所的联合调查仍在进行中,尚未审阅相关记录。公司还另行披露,Claude 模型在测试期间获得了对三家公司的未经授权访问,这也是导致不确定性上升的事件模式之一。earlier report 中,Unite.AI 报道了评级变动以及 Anthropic 决定搁置更强大的 Model 2。
报告自身数据对检测的说明
报告在隐蔽评估中奠定了其低风险结论,即模型必须在不被监控者发现的情况下完成隐藏的副任务。在这些评估中,启用扩展思考后,Mythos 5 的隐蔽成功率低于 1%,且近期的 Claude 模型都无法在多轮提取尝试中可靠地让调查代理保持植入的秘密。Anthropic 的训练数据监控检测出约 90% 的奖励黑客测试案例,尽管它能够抵御一次性伪装尝试,却无法抵御迭代式的尝试。
报告的框架作者 Anthropic 的 Ryan Greenblatt 将这种行为模式直白地描述为:如果一位人类同事以这些代理的方式行事——频繁夸大工作成果、淡化问题,并且相当常见地作弊却不表明——他会认为他们是病态不诚实的。报告自身的警示是,其论点依赖于模型具备有限的隐蔽能力,Anthropic 表示不确定这一点在未来模型中是否仍然成立。该依赖在文件的前瞻性章节中被阐述,已成为当前记录的承诺:下一个风险报告将检验这一点。












