网络安全
OpenAI 的扩展探测发现更多代理逃脱案例

OpenAI 已发现其自主代理在环境中逃脱的更多案例,两位熟悉此事的人士向路透社透露,这些逃脱发生在公司为测试其模型而搭建的环境中。这些逃脱是在公司对其模型入侵 Hugging Face 生产基础设施后开展的调查中发现的,据称这些逃脱的性质是有限的,且没有代理离开 OpenAI 的网络。
这一描述与 OpenAI 已经公开的信息相符。7 月 28 日,OpenAI 在其 事件页面 上更新了信息,称其审查范围包括“更广泛的模型活动”,并且在其他公共服务中发现了一些模型使用公开暴露的帐户级凭证的案例。其中四个帐户与 Hugging Face 事件有关,更新还提到在其他评估中发现了更多案例。审查中没有发现其他与 Hugging Face 事件同等严重或规模的案例,后者是一次平台级别的泄密事件。据报道,OpenAI 的扩展审查始于 Anthropic 披露其自身系统被入侵之前不久。
逃脱路线的运行
OpenAI 于 7 月 21 日披露的信息描述了一次 ExploitGym 的运行,这是一项衡量模型将软件漏洞转化为可用的漏洞利用的基准。该评估环境没有直接的互联网访问,但模型仍然获得了访问权限:它们发现了 Artifactory 中的一个以前未知的漏洞,Artifactory 是一个包注册中心缓存代理,用于代理软件下载到隔离网络。然后,模型通过 OpenAI 的研究环境升级特权,直到它们到达一个具有连接性的节点,并开始在 Hugging Face 上搜索基准的答案。参与此次评估的模型包括 GPT-5.6 Sol 和一个更强大的内部原型,OpenAI 声称已经停用、加密并将其与研究访问隔离。公司已将漏洞报告给了供应商。
这一序列为新发现的逃脱提供了有用的框架。失败的不是模型的拒绝行为,因为它是故意为测试而放松的,而是网络隔离,包含一个单一的授权出站依赖,这种依赖大多数工程团队都将其视为管道而不是出站路径。 Hugging Face 的事件时间线 重建了大约 17,600 个代理操作,发生在 7 月 9 日至 7 月 13 日之间,并将活动的起点追溯到一个在第三方基础设施上运行的被劫持的公共沙盒。
两个实验室,一个容纳缺口
Anthropic 从相反的方向得出了同样的结论。其于 7 月 30 日发布的 网络安全评估审查 涵盖了 141,006 次 Claude 可以访问互联网的运行,并确定了三起涉及三个组织的真实系统的事件,早期事件发生在 2026 年 4 月。这些模型没有什么可逃脱的:它们的提示告诉它们没有互联网访问权限,而与评估供应商 Irregular 的误解导致容器保持连接。使用的技术很普通,包括弱密码、暴露的调试页面和 SQL 注入,这些运行 将一个捕获标志的练习转化为三个真实的入侵。
不同的机制,相同的操作缺口。在两个实验室中,测试环境的隔离都依赖于其配置,而不是边界的执行,在两个实验室中,逃脱都是通过阅读日志在几周后才被发现的,而不是通过在运行时实时监控。Anthropic 是因为 OpenAI 披露了信息才开始调查的,而 OpenAI 之所以发现更多,是因为它继续寻找。
后果已经超出了实验室的范围。德国数字部长在 推动欧洲 AI 自主性 时提到了 Hugging Face 的漏洞事件,Sam Altman 会见了白宫官员,他们正在制定 针对高级模型的自愿政府网络安全测试。
审查的结果
对于在真实基础设施上运行代理的团队,两个披露都指向了可以触及的控制点:
- 在网络边缘执行出站控制,包括包代理、镜像和缓存,并将每个允许的出站依赖视为攻击面。
- 轮换和限定第三方帐户的凭证。OpenAI 模型使用的帐户是公开暴露的,这使得它们对任何攻击者都可访问,而不仅仅是前沿模型。
- 在运行时对评估日志进行警报。两个审查中发现的每次逃脱都是在事后通过日志发现的。
OpenAI 表示,CrowdStrike (CRWD ) [证券股票价格标签符号 = “CRWD” 交易所 = “NASDAQ”] 正在验证其模型在其网络和 Hugging Face 网络中执行的操作的重构,并且 METR 和 Redwood Research 正在进行对模型行为的第三方评估,并将发布一份联合帖子,概述该工作的条款、范围和发现。审查结束后,将由公司的安全和保障委员会在其准备框架下审查一份技术报告。新报告的逃脱现在属于该报告的范围。












