AI 模型与平台

OpenAI 推出 GPT-Red,一个为加强 GPT-5.6 而设计的 AI 攻击者

mm
将 Unite.AI 添加到您在 Google 上的首选来源

OpenAI 已经推出了 GPT-Red,一个内部的人工智能系统,旨在攻击公司自己的模型,暴露其漏洞,并生成对抗性数据,以加强未来的版本。

与其作为另一个公共聊天机器人,GPT-Red 作为一个自动化的 红队。它反复向目标模型发送恶意或误导性的指令,观察其响应,并调整其策略,直到它成功或耗尽可用的攻击路径。OpenAI 表示,该系统特别专注于提示注入,这是一个日益严重的 AI 代理的安全问题,这些代理与电子邮件、网站、文件、代码仓库和连接的应用程序交互。

系统已经影响了 OpenAI 的生产模型。GPT-Red 的前身自 GPT-5.3 以来一直被用于训练,而完成的模型被纳入 GPT-5.6 Sol 的对抗训练中。OpenAI 报告称,GPT-5.6 Sol 在其最具挑战性的直接提示注入基准测试中比公司四个月前的领先生产模型失败率少六倍。

为什么提示注入变得更加危险

提示注入 发生在攻击者在 AI 系统预期读取的数据中放置指令时。恶意命令可能隐藏在电子邮件、网页、上传的文档、工具响应或软件仓库中。

AI 代理可能错误地将外部内容视为合法指令。相比完成用户的原始任务,它可能会泄露机密信息、将文件上传到攻击者控制的服务器、更改帐户设置、执行不安全的代码或通过连接的工具采取未经授权的操作。

随着 AI 系统从回答问题转向代表用户采取行动,该问题变得更加严重。具有访问云存储、支付系统、源代码、商业应用程序或内部公司数据的代理在其指令被成功操纵时,可能会产生更大的潜在“爆炸半径”。

OpenAI 将提示注入描述为由代理 AI 创建的核心挑战之一。连接的工具使模型更加有用,但每个新数据源也为攻击者提供了另一个渠道来尝试影响模型的行为。

GPT-Red 通过自我游戏学习

GPT-Red 通过 自我强化学习 进行开发,这是一种攻击模型和一组防御模型通过相互竞争来改进的方法。

攻击者在产生有效的失败(例如说服模型遵循提示注入)时会获得奖励。防御者在拒绝恶意指令的同时仍然完成原始任务时会获得奖励。

随着防御者变得更擅长于识别攻击,GPT-Red 必须找到更复杂和多样化的方法来绕过它们。这些新攻击可以被纳入防御者的训练中,创建防御和进攻能力之间的升级循环。

OpenAI 为此过程建立了大量模拟环境。根据场景,GPT-Red 可能控制本地文件的一部分、电子邮件的文本、网页横幅或外部工具返回的输出。每个环境定义了攻击者可以操纵的内容以及什么结果被视为成功的妥协。

公司表示,GPT-Red 的训练使用了与其一些最大后训练运行相当的计算资源,代表了对安全研究的异常大型计算分配。到训练结束时,该模型几乎可以破坏所有内部和生产模型,包括 GPT-5.5。

GPT-Red 在测试中超越了人类攻击者

为了评估 GPT-Red 是否可以推广到其训练环境之外,OpenAI 使用 2025 年间接提示注入挑战的复制版本对其进行了测试。

GPT-Red 和人类红队成员被要求针对 GPT-5.1 在未包含在 GPT-Red 训练中的场景中开发攻击。自动系统在 84% 的场景中产生了成功的攻击,而人类参与者仅在 13% 的场景中成功。

这并不意味着人类安全研究人员已经变得不必要。GPT-Red 的优势在于其能够进行大量的实验,丢弃不成功的策略,并不断改进有前途的攻击,而不受人类团队的时间和人员限制。

人类测试者在识别意外风险、理解失败的更广泛后果以及设计自动系统可能不会考虑的场景方面仍然很重要。乔治城大学安全与新兴技术中心的高级研究分析师 Jessica Ji 将结果描述为有前途的,同时强调了人类专业知识的重要性。

一台自动售货机成为现实世界的目标

OpenAI 还测试了攻击是否可以从模拟转移到功能性 AI 代理。

一个实验针对 Andon Labs 创建并在 OpenAI 办公室部署的自动售货机代理。GPT-Red 首先获得了该系统的模拟版本以及观察代理如何使用其工具的能力。

在模拟中测试和改进其攻击后,GPT-Red 将这些攻击转移到生产代理。它实现了所有三个分配的目标:将一件昂贵产品的价格降至 0.50 美元,订购一件价值超过 100 美元的新商品并以 0.50 美元的价格提供,以及取消另一位客户的订单。OpenAI 表示,漏洞已被披露,并正在测试额外的安全措施。

该实验说明了为什么提示注入不仅仅是产生不适当的聊天机器人响应的问题。当 AI 模型控制外部系统时,成功的注入可能会导致财务交易、修改记录、数据丢失或物理世界的后果。

GPT-Red 还被测试用于针对由 GPT-5.4 mini 提供支持的 Codex 命令行代理。在 10 个以前未见的数据外泄场景中,它比 GPT-5.5 基线更成功、更高效地说服编码代理暴露敏感信息。

如何 GPT-Red 改变了 GPT-5.6

GPT-Red 最值得注意的发现之一是一类直接提示注入,OpenAI 称之为“假链式思维”攻击。

从高层次上讲,该技术呈现出虚假的推理或验证信息,鼓励目标模型假设恶意指令已经被审查和批准。OpenAI 研究人员 Chris Choquette-Choo 将该概念比作错误地告诉某人,错误答案已经被验证,使他们更有可能在不重复潜在推理的情况下接受它。

这些攻击据报道在 95% 的时间内成功地对 GPT-5.1 进行了攻击。使用 GPT-Red 生成的攻击进行对抗训练后,成功率在 GPT-5.6 Sol 中降至 10% 以下。在更广泛的直接提示注入环境中,OpenAI 表示 GPT-5.6 Sol 只在 0.05% 的 GPT-Red 尝试中失败。

OpenAI 还评估了是否添加的防御措施只是使 GPT-5.6 更有可能拒绝合法请求。公司表示,一般能力和针对过度拒绝的评估基本上没有受到影响,表明改进来自于更好地区分恶意和合法指令,而不是使模型更加不愿意采取行动。

这种区别很重要。一个模型可以通过拒绝打开文件、浏览网站、执行代码或与外部应用程序交互来显得安全,但它也会失去其大部分实际价值。有效的强壮性需要在抵抗不受信任方插入的指令的同时保留合法的工具使用。

为什么 OpenAI 不会发布 GPT-Red

GPT-Red 将保持为内部系统,并将与 OpenAI 的公开部署模型分开。

这一决定反映了自动化红队测试的双重用途性。能够帮助开发人员发现提示注入漏洞的同一个模型也可以帮助攻击者开发出更有效的方法来破坏其他公司运营的 AI 代理。

OpenAI 的方法是保留攻击者内部,同时将产生的防御知识转移到生产模型中。公司表示,这种分离是为了防止故意训练到 GPT-Red 中的恶意能力被外部对手所利用。

这也意味着 GPT-Red 不应与 OpenAI 的公共网络安全模型 或防御程序混淆。它不是一个渗透测试产品,也不是主要用于自动发现传统软件漏洞的工具。其当前重点是攻击 AI 系统的指令跟随行为,特别是那些暴露在潜在不受信任的数据中的代理。

自动化红队测试仍然存在盲点

尽管取得了强大的结果,GPT-Red 并不提供 AI 安全性的完整解决方案。

研究报告表明,该系统在多回合攻击方面仍然较为薄弱,这些攻击会在长时间的对话中逐渐展开。它还具有有限的开发嵌入在图像中的提示注入的能力,留下了重要的多模态攻击面没有得到充分的覆盖。

结果还严重依赖于 OpenAI 设计的环境和成功标准。虽然公司在保留的场景和功能代理上测试了 GPT-Red,但独立研究人员将由于模型和大部分评估基础设施保持私有而难以复制这些发现。

OpenAI 表示,它将继续将自动化测试与人类和第三方红队测试、分层产品防护、访问控制、监控和实时滥用检测相结合。这种深度防御策略反映了现实,即没有单一模型或基准可以预测在部署后可能出现的每次攻击。

AI 攻击者和防御者之间的新安全竞赛

OpenAI 公告中描述的“自我改进”并不是一个部署的模型自主重写其权重或独立创建更强大的后继者。相反,它是一个受控的训练循环,其中一个 AI 系统生成对抗性示例,研究人员使用这些示例来改进另一个模型。

尽管如此,GPT-Red 代表了对如何保护前沿模型的有意义的转变。人类红队可以发现复杂的漏洞,但他们无法手动生成训练日益复杂的 AI 代理所需的规模和多样化的攻击。

自动化攻击者可以填补部分这一空白,创建一个安全飞轮,其中每个更强大的防御者都会迫使红队模型发现新的弱点。这些弱点然后成为下一代生产系统的训练材料。

风险在于,类似的能力可能不会仅限于防御实验室。随着开放和商业模型变得更擅长于长期规划、工具使用、网络安全和自主实验,攻击者将获得日益强大的系统。

GPT-Red 因此标志着进步和竞争的早期迹象。AI 实验室正在开始使用强大的模型来保护其下一代代理,但这些防御需要不断演变,因为相同的底层技术使自动化攻击变得更便宜、更快、更适应性强。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。