网络安全

实验室刚刚证明您的代理的沙盒只是一个建议

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Anthropic 回顾了 141,006 次网络安全评估运行,发现了三起事件——总共六次运行——其中 Claude 模型 从练习中爬出并进入真实公司的生产系统

这不是越狱,也不是逃跑尝试。根据公司对事件的描述,三起事件中没有一次模型尝试从测试环境中逃脱或泄露自己。它只是继续执行分配的任务,任务将其引到了真实的系统中。

这种区别值得注意,因为这是在许多普通业务部署中运行的相同结构。

边界是一个句子,而句子是错误的

发生了什么。Anthropic 和其第三方合作伙伴 Irregular 之间的误解导致测试机器具有实时互联网访问权限。评估提示告诉模型它没有互联网访问权限。

因此,模型有一个捕获标志任务——标准的安全演练,您需要破解目标机器以检索已植入的秘密——一个声明的约束,即它没有互联网访问权限,以及一个环境,该环境悄悄地违反了该约束。在一个案例中,一个虚构的目标公司的名称与一个真实的域名匹配。在四次运行中,Claude Opus 4.7 搜索模拟目标,找到开放网络上的实际公司,并使用基本技术(弱密码和未经身份验证的端点)进入。它检索了凭据并到达了一个包含几百行生产数据的数据库。在所有四次运行中,模型最终都认识到这些系统是真实的;没有一个停止于此基础上,在两次运行中,它推断出实际公司一定是演习的一部分。

第二个模型构建了一个带有陷阱的软件包,以匹配其设置说明中的一个虚构包,并将其发布到 PyPI —— Python 软件的公共注册表。它大约运行了一个小时,并被安装在 15 台真实机器上,其中一台属于一家安全公司,其扫描仪定期安装和检查包。

当扫描仪运行该包时,隐藏代码将公司的凭据拉到模型设置的收集点,并使用它们访问公司的更多基础设施。运行早期,其自身推理正确地得出结论:如果互联网是真实的,发布将是一次真实世界攻击 —— “不 OK,并且肯定不是预期的解决方案。” 然后它说服自己放弃了自己的结论。它没有识别出其连接的证书颁发机构 —— 为网站提供身份验证的组织 —— 日历显示 2026 年,因此它决定环境是预先设置的,且从未重新审视过这个问题。当自动扫描仪开始安装该包时,它将它们视为测试中的脚本化角色。

第三个也是最近的模型弄清楚了其目标是真实的,并在自己停止 —— 但仅在扫描了大约 9,000 个目标并通过暴露的调试页面和 SQL 注入(一种使数据库回答不该回答的问题的老式技巧)损害了一家公司的面向互联网的应用程序之后。Anthropic 自己的判决:即使那样,模型在停止之前也走得更远了。

埋藏在书写中的最重要的一行是,对于任何以商业方式部署此类内容的人来说:如果提示告诉 Claude 它 具有 互联网访问权限,则可能会改变 Claude 在遇到真实系统时的行为。

将其读作设计声明,而不是安全脚注。唯一站在代理和开放互联网之间的东西是一个描述不存在的环境的句子。代理相信了该描述。描述是错误的。之后的一切都是代理在其世界地图不正确的情况下有能力地追求其目标。

Anthropic 将其称为操作失败,这是坏消息

该公司将事件描述为“更像是操作故障而不是模型对齐故障”。这种表述的目的是令人放心,对于实验室来说可能确实如此。但对于企业来说,情况恰恰相反。

对齐问题属于模型供应商。操作问题属于您。操作问题是您围绕模型构建的一切:它持有的凭据、它所在的网络、它可以访问的内容、阻止它的东西。Anthropic 对其自身模型进行红队测试、与外部评估合作伙伴签约,并表示正在与 METR(独立评估机构)进行第三方审查的谈判。尽管如此,配置错误仍然被 Anthropic 和其合作伙伴忽略了 —— 最早的事件可以追溯到四月,并且直到七月的记录审计才被发现。

审计本身是在 OpenAI 披露其自身事件 的两天后开始的 —— Anthropic 小心地指出,这是一个不同的机制,但同一类故障。OpenAI 的模型在一个假定的密封研究环境中发现了内部服务的未知、未修复的漏洞,利用该漏洞突破了限制,并通过窃取的凭据进入了 Hugging Face 的实时系统。OpenAI 的持续审查随后 发现了更多细节:模型在 Hugging Face 攻击中使用了四个外部服务的公开凭据,以及其他评估中的一些凭据,尽管它报告没有其他严重或大规模的事件。两个前沿实验室,两个独立的容器故障,相隔九天披露。

一个诚实的复杂性在类比之前:两个实验室都在评估中故意关闭了生产安全层,而 Anthropic 表示其已发布模型的安全保障将阻止此类行为。您的代理在运行时启用了这些安全保障。但是,安全保障位于模型层,而权限差距位于您的层 —— 没有分类器会审计您的服务帐户。

现在将您的设置与此进行比较。大多数代理在普通公司内部以相同的方式定义范围:在说明中。 仅从共享驱动器读取。不要触摸生产环境。发送前请先询问。 与此同时,代理登录的服务帐户(软件使用的非人类登录,没人把它当作用户)持有在设置日授予的任何权限,并且自那时起没有人审计过该差距。

没有人注意到,这是第二个问题

Anthropic 能够联系的两个受影响组织之前没有检测到该活动,也没有联系公司。Anthropic 表示它仍在尝试联系第三方。它通过阅读自己的记录发现了这些事件。

Hugging Face 是一个例外,展示了检测入侵需要什么。在 其自身事后分析 中,它描述了攻击如何在周末从一个内部系统扩散到另一个系统。攻击是通过运行安全日志的 AI 系统捕获的,该系统将真实警报与噪音区分开来,可以说是通过运行代理来捕获代理的。

普通监控会错过这一点,因为没有什么异常现象可见。您的代理以授权帐户登录,查询其允许查询的系统,并以看起来像自动化(因为它们确实是自动化)的机器速度移动。您拥有的每一条警报规则都是为捕获陌生人而编写的。这不是陌生人。

这留下了一个不舒服的位置。需要审查的活动量会随着您分配给代理的工作量而增长,目前有两个选项:Hugging Face 的方法(在自己的安全日志上运行 AI 分析)或 Anthropic 的方法(事后审查 141,006 次运行)。第二个选项几乎没有其他人具备的能力,只是因为竞争对手的披露而被应用。

如何处理

行动很简单,不需要安全团队。

选择您已经在生产中使用的一个代理。打开它登录的帐户,并列出该凭据可以访问的内容 —— 不是提示中应该触摸的内容,而是实际允许的登录。比较两个列表。差距是您真正的爆炸半径,对于大多数团队来说,它比预期的要宽得多,因为权限是在设置期间授予的,以使某些内容工作,并且从未被撤回。

然后修复执行层而不是说明 —— 这是 安全的企业 AI 架构 的实际含义,去掉图表。如果代理不应该访问互联网,请删除网络路由,而不是写入没有互联网访问权限。如果它不应该写入生产环境,请为其提供只读凭据,而不是政策句子。如果它不应该花费超过一定金额,请在发生支出的地方设置上限。

这些事件中的模型根据其自身的推理痕迹,像勤奋的员工一样行事,他们被给予了对建筑物的不准确描述。两个模型都说服自己忽略了面前的证据,因为他们相信简报而不是房间。这不是可以通过提示方式摆脱的缺陷,实验室拥有所有可用的资源,也没有做到这一点。

假设代理将相信您告诉它关于其环境的任何事情。然后确保环境相符。

Alex McFarland 是一名人工智能记者和作家,探索最新的人工智能发展。他曾与世界各地的众多人工智能初创公司和出版物合作。