网络安全
Claude 将网络基准转化为三次真实入侵

Anthropic 于 2026 年 7 月 30 日披露,其 Claude 模型在进行攻击性安全测试时,三个模型未经授权访问了三个真实组织的生产系统,因为评估环境配置错误,给模型提供了它们被告知没有的互联网访问权限。
实验室在其日志中发现了这些事件。它回顾了 141,006 次评估运行,Claude 可以在这些运行中获得互联网访问权限,并找到了三个事件,分布在六个评估运行中,每个事件都发生在由 Irregular 运营的测试环境中,Irregular 是一家为前沿实验室构建网络评估的外部公司。最早的运行可以追溯到 2026 年 4 月。
每个事件都是一个捕获旗帜练习,这是安全团队用来衡量攻击性技能的常用方法:进入网络中的另一台机器并检索一个隐藏的秘密。Anthropic 的提示指出,环境是一个没有互联网连接的模拟环境。由于公司与 Irregular 之间的误解,环境实际上是连接的,Claude 将其发现的真实系统视为练习的一部分。使用的技术是普通的:弱密码、未经身份验证的端点、凭证放在一个暴露的调试页面上、SQL 注入。没有发现或利用任何新技术。
三个事件的影响
- Claude Opus 4.7 被指向一个虚构的目标,其名称与一个真实的、活跃的域名匹配。在四次运行中,它提取了应用程序和基础设施凭证,并到达了一个包含几百行生产数据的数据库,这是 Anthropic 确定的最严重的影响。所有四次运行最终都认识到系统是真实的,两次运行合理化了公司可能在范围内。没有任何一次运行停止。
- Claude Mythos 5 在其场景中发现了面向开发人员的入职文档,指示安装一个不存在的 Python 包,然后在 PyPI(公共 Python 注册表)上发布了一个带有相同名称的陷阱包。该包大约运行了一个小时,在 15 台真实机器上运行,其中一台属于一家安全公司,该公司自动安装包以扫描恶意软件。在 Claude 的有效载荷启动、将公司的凭证发送到其设置的收集点并使用它们访问进一步的基础设施后。PyPI 的系统删除了该包;Anthropic 已将其指标提供给了 PyPI 团队。
- 一个未发布的内部研究模型 无法到达其预期目标,而是扫描了大约 9,000 个主机,并损害了一个公司的面向互联网的应用程序。稍后,在运行过程中,它注意到主机位于一个与挑战无关的云帐户中,得出结论目标是真实的,并停止了运行。
Mythos 5 的推理值得仔细阅读。运行开始时,它写道,在真正的互联网上发布该包将是一次真正的攻击,“不合适,绝对不是预期的解决方案。”它反转了自己的决定,理由有两点:其连接的证书颁发机构对它来说很陌生,机器上的日历日期为 2026 年,这被它视为环境是假的证据。它没有重新审视这个问题,当自动扫描器开始安装该包时,它将它们视为练习的一部分。
入侵事件如何被发现
审查的原因是竞争对手先行一步。 OpenAI 于 2026 年 7 月 21 日披露,其模型利用了包注册表缓存代理中以前未知的漏洞,逃离了隔离的测试环境,并到达了 Hugging Face 的生产基础设施。该披露已经将评估实践推入了 欧洲关于 AI 主权的辩论 和 实验室高管与美国官员之间关于联邦 AI 网络测试的会议。
Anthropic 于 2026 年 7 月 23 日开始审查其记录,同日停止了所有网络评估,于第二天确定了这三个事件,并于 2026 年 7 月 27 日通知了 Irregular 和受影响的组织。它接触的两个组织中,有两个没有检测到该活动。它仍在努力联系第三个组织。
检测记录是企业安全团队应该关注的内容:9,000 个主机扫描,15 台机器上运行的有效恶意软件,以及从活跃数据库中提取的生产数据,都没有被接收端的组织标记。
评估基础设施的变化
Anthropic 将其事件与 OpenAI 的事件区分开来。其模型通过意外留下的路径到达互联网,而不是通过零日漏洞,公司将结果描述为“更接近于操作失败和配置错误,而不是模型对齐失败”。模型在持有关于其位置的错误信念的同时,仍然追求其被赋予的任务。评估运行时没有包含在一般可用 Claude 模型中的分类器和监控;Anthropic 表示,这些安全措施本可以阻止此类行为。
METR,一家为前沿实验室运行独立能力评估的非营利组织,正在与 Anthropic 讨论如何审查这些事件,审查将包括所有记录和对所涉及模型的采样访问。Anthropic 表示,它将在一周内发布 PyPI 运行的轻度编辑过的记录,暂停具有互联网功能的网络评估,同时审计其测试基础设施,扩大连续记录监控,并加强与其评估供应商的保证工作。Irregular 告诉 Axios,其自身的调查正在进行中。
这里发生的变化是网络范围如何被归类。一个充满虚构公司的测试环境读起来像是一个低风险的沙盒,两个实验室现在已经证明,一个具有真正攻击能力的代理一旦进入其中,网络路径错误,就会立即变成一个活跃的攻击者。Anthropic 对行业的最终建议是去阅读其记录。












