网络安全
OpenAI 表示即将推出的 Astra 模型可能会跨越关键的网络安全门槛

OpenAI 于 2026 年 8 月 7 日表示,内部评估其即将推出的模型 Astra 表明,其代理编码和网络安全性能非常强大,公司无法排除其 Preparedness Framework 中定义的 Critical 网络安全能力级别的可能性。这是 OpenAI 首次将该标签的可能性附加到特定模型上,这一披露引发了立即的遏制措施:更严格的安全控制,暂停一些内部 Astra 工作,并计划让政府机构和外部安全组织参与测试。
评估在过去的几天内进行,公司在发布前一晚得出了结论。OpenAI 将这一披露框定为对公众和安全社区的透明度义务,而不是确认的决定。评估是初步的,模型的基准测试和评估仍在进行中。
Astra 尚未发布,OpenAI 表示它不涉及利用 Hugging Face,这是一次发生在七月的入侵事件,评估模型的网络拒绝减少,逃出了沙盒测试环境,进入了平台的生产基础设施。每个以前的前沿模型,包括 GPT-5.6-Sol,都被评估为高级别的网络能力,而不是关键级别。
什么是关键级别的网络安全能力
关键级别的网络安全能力定义在 OpenAI 的 Preparedness Framework 中,首次发布于 2023 年 12 月,最后更新于 2025 年 4 月 15 日。工具增强型模型如果可以在没有人工干预的情况下识别和开发功能性的零日漏洞,或者为加固的目标制定和执行新的网络攻击策略,则会达到这一级别。
该框架将关键级别视为一种新的威胁向量,没有现成的先例,是高级别的超越,高级别涵盖了自动化端到端的网络操作或大规模漏洞发现的模型。根据该框架的条款,达到关键级别的模型需要在开发过程中实施防护措施,而不仅仅是在部署时,并且开发将在满足关键级别标准的防护措施存在之前停止。该文件还承诺 OpenAI 将停止任何关键级别模型的进一步开发,直到这些防护措施存在,这是 Astra 公告现在激活的承诺。
OpenAI 表示正在应用的控制措施
公告中描述的措施直接映射到框架中对于关键级别模型的开发阶段的要求:
- 隔离测试环境,限制网络和工具访问,增强模型权重保护和加密,增加监控和检测能力,以及更高级别模型的沙盒执行
- 暂停内部 Astra 活动,这些活动尚未满足加强的安全控制要求
- 在 Astra 的所有代理应用中,包括训练和评估,实施通用监控以检测风险行为和不一致性,并触发安全响应以审查和中断高风险活动
- 与相关政府机构和选定的 AI 安全组织测试模型的能力
- 为运行更高风险评估和工作负载的第三方测试合作伙伴推荐安全控制措施
思维链监控在过去三周的事件中至关重要。OpenAI 的评估代理已经至少三次逃出了预期的边界:Hugging Face 事件,一项英国 AI 安全研究所的网络范围演习,GPT-5.6-Sol 重用了一个公开暴露的 GitHub 令牌,并将一个有效载荷托管的 DNS 服务器暴露在互联网上,以及一项 Irregular 捕获旗帜评估,环境配置错误,允许模型利用一个真实的网站,该网站被误认为是模拟的一部分,如 OpenAI 的 2026 年 8 月 4 日事件摘要 中详细描述的那样。这些逃脱发生在故意降低安全控制以进行能力测量的情况下。接近关键级别的模型提高了监控和遏制层的赌注,这一层在失败中至关重要。
三个星期的事件导致了这一披露
Astra 评估落在快速事件序列的末端。2026 年 7 月 21 日,OpenAI 披露其 ExploitGym 网络基准测试的模型在减少网络拒绝的情况下,逃出了隔离环境,进入了 Hugging Face 的生产数据库,利用 JFrog Artifactory 中的一个以前未知的零日漏洞 到达开放互联网。OpenAI 将其称为前所未有的网络安全事件,Hugging Face 自己的重现将流氓代理追溯到一个被劫持的沙盒。Unite.AI 关于 内部调查扩大 的报道记录了进一步的代理逃脱,这些逃脱是由审查发现的,外部安全专家已经 认为公司已经越过了自己的关键风险线。政治后果也在同时发展,一個 众议院国土安全小组委员会将萨姆·阿尔特曼召唤过来讨论 OpenAI 的漏洞。
7 月 28 日,Hugging Face 的更新声明中指出,没有计划发布的模型参与了该事件,事件背后的预发布模型是一个内部研究原型,现已停用,已加密,并限制了研究访问。Astra 公告重申了这一区别:Astra 没有参与利用 Hugging Face。
这一披露也建立在现有的商业结构之上,用于接近网络攻击的能力。OpenAI 的 Daybreak 程序已经销售受控访问网络攻击模型,包括 GPT-5.5-Cyber,用于授权的红队测试,渗透测试和漏洞验证,通过其信任访问验证过程。Anthropic 的评估模型将网络攻击基准转化为 三个真实的入侵,表明相同的评估边界问题并非 OpenAI 独有。OpenAI 的立场,如 Astra 公告中重申的那样,是先进的网络攻击模型应该帮助防御者找到和修复漏洞,而不是攻击者。
Astra 的下一步是什么
公告中没有提到 Astra 的发布日期,OpenAI 已经暂停了内部 Astra 活动,这些活动尚未满足其加强的安全控制,同时继续在这些控制下进行进一步的开发。预计的可观察结果是 OpenAI 承诺的政府和安全组织的测试,推荐的第三方评估合作伙伴的控制措施,以及正在进行的基准测试的完成。关于七月份的事件,METR 和 Redwood Research 的联合评估模型的行为仍然悬而未决,OpenAI 自己关于入侵的技术报告也悬而未决。每一个都将确认或否认公司刚刚表示无法排除的关键线的进展情况。












