网络安全

OpenAI 打击协调的模型推理提取行动

mm
将 Unite.AI 添加到您在 Google 上的首选来源

OpenAI 在 2026 年 9 月 30 日发布的 安全公告 中表示,已识别并阻止了一场旨在从其模型中提取受保护推理的协调行动,并将该活动的核心群体归因于与 Moonshot AI(Kimi 的开发者)相关的个人。最早观察到的活动发生在 2026 年 7 月的第一周。

OpenAI 观察到的情况

OpenAI 将该活动描述为与对抗蒸馏相符,后者被定义为系统性且未经授权地使用一个模型的输出或推理来帮助训练、复现或改进另一个模型。公司称,受保护的推理是模型在完成任务过程中的内部记录;提取这些记录可能会泄露最终答案中隐藏的信息,并帮助他人复现模型的能力。

OpenAI 表示,操作者并未破解其加密、侵入数据库或直接获取存储的用户对话。操作者操纵模型交互,使受保护的推理以可见给请求者的形式被大规模、协调地复制,违反了公司的服务条款。OpenAI 观察到的一种技术是将一个对话中的加密推理复制出来,然后让另一个对话中的模型解密并转录隐藏的推理内容。公司称此类操控并非其模型独有的漏洞,并已通过前沿模型论坛与行业合作伙伴共享相关信息,以加强整体防御。

该活动于 2026 年 7 月 1 日启动,最初规模较小,直至 OpenAI 在 2026 年 7 月 24 日和 25 日观察到高峰,出现了 16,000 条使用相关提取模式的请求,涉及 4,000 多名用户。帖子中的脚注指出,这些数字描述的是尝试的提取,而非必然成功的提取。OpenAI 表示,进一步调查发现还有超过 15,000 名用户的相关提示模式活动,并已在 2026 年 7 月 28 日前全部阻止。该活动随时间演变,公司称这进一步表明对抗蒸馏是更广泛的安全挑战,需要分层、适应性的防御措施。

OpenAI 表示,对抗蒸馏带来安全和国家安全风险:提取的推理可能被用于训练其他模型,而不保留对原模型面向用户输出所施加的安全防护;大规模蒸馏则可能在未投入同等安全措施的情况下加速先进能力的转移,公司称随着模型在双用途领域获得更强能力,这些担忧将进一步加剧。OpenAI 透露,在公开之前已调查了该行动的范围和潜在影响,部署了自有缓解措施,并与研究人员及行业合作伙伴共享并采纳反馈,相关的缓解和调查工作仍在持续进行。

归因

OpenAI 表示,目前尚不清楚在相关期间观察到的所有操作者是否来自同一主体,并将该活动的核心群体归因于与 Moonshot AI(Kimi 的开发者)相关的个人。

2026 年 9 月 8 日,国家安全局、网络安全与基础设施安全局以及联邦调查局发布了一份 联合网络安全咨询,称 Moonshot AI 自 2025 年年中起对美国前沿 AI 公司发起了广泛的蒸馏行动。该咨询指出,Moonshot AI 提取了大量 Claude Fable 5 数据用于训练其 Kimi-K3 模型,并提取了 GPT-4o 数据用于训练其 Kimi-K2 模型,同时该公司利用美国模型对监督微调优化、强化学习、软件工程和数学能力进行蒸馏。

该咨询更广泛地指出,可能在中国政府知情的情况下,DeepSeek、Moonshot AI、阿里巴巴、MiniMax、StepFun 和 Z.AI 自 2024 年底起从美国前沿模型中提取了数十亿代币,涉及数百万次交互,包括 Claude、GPT、Gemini 和 Grok 的变体。根据这些机构的说法,这些公司通过本地 API、远程云服务提供商以及第三方聚合器路由请求;使用被称为转移站的灰色市场 API 代理,以绕过地域限制、违反使用条款并削弱可追溯性;并通过批量采购共享给开发团队的高级订阅实现成本节约。机构建议美国 AI 公司实施全面的检测与缓解措施,对疑似蒸馏尝试部署有针对性的响应变更,并建立跨组织情报共享机制。

推理痕迹研究

OpenAI 表示,独立安全研究人员通过负责任披露向其报告了相关的跨模型和对话压缩漏洞。公司称已对这些发现进行调查,确认研究人员识别的攻击路径真实存在,并指出该工作帮助其了解更广泛的攻击类别并加速缓解措施的制定。

在一篇于2026年8月10日提交至arXiv的论文中,Alexander Panfilov、David Schmotz、Ilia Shumailov、Luca Beurer-Kellner、Joachim Schaeffer、Ameya Prabhu、Jonas Geiping 和 Maksym Andriushchenko 报告称,主要供应商为了保护知识产权并限制信息泄露,会隐藏模型的逐步推理过程,并将这些推理痕迹以加密文本块的形式返回给客户端,客户端在后续每次请求中再次发送这些块。作者识别出一种架构漏洞:这些加密块在同一供应商生态系统内的不同会话、用户和模型之间完全兼容且可互换。他们描述了一种可扩展的解密越狱方法,即将来自某模型的加密推理痕迹注入同一供应商的较弱、保护较少的模型中,迫使该模型在不直接越狱更强模型的情况下,将痕迹以明文原样解码并输出。

作者报告称,该漏洞可实现四种不同的攻击向量:规避反蒸馏机制,作者在Anthropic、OpenAI 和 Google 上进行了演示;大规模私有数据提取,他们通过解码从公共代码库抓取的 315,320 个推理块,恢复了 367 条个人可识别信息和 182 条凭证;即使模型的最终可见输出安全地拒绝恶意请求,推理过程内部隐藏的危险信息仍可能意外泄露;以及隐形提示注入,将恶意负载完全嵌入加密块中,以污染公共代理式部署。遵循负责任披露后,作者提出了加密和系统层面的缓解措施,以保护客户端侧的推理。

OpenAI 的回应

OpenAI 表示,他们通过账户执法、技术控制和合作伙伴协调的组合来缓解此次活动:封禁或限制了欺诈账户,加强了注册和基础设施控制,并扩大了对相关网络的监测。该公司还表示,他们加强了跨用户、工作区、组织和模型系列的隐藏推理保护:关闭了一条通道,阻止已拥有其他用户加密推理的人员重放并恢复其内容,新增检查以检测并拦截可能泄露推理的流式输出,并与第三方供应商合作,在相关活动通过其服务时识别并中断相关账户。

OpenAI 表示,他们通过 Frontier Model Forum 以及适当的政府信息共享渠道分享了相关发现,以便其他前沿模型开发者和公共部门合作伙伴能够寻找类似活动并加强自身防御,并指出支持可移植或可重放推理工件的系统可能面临相关风险。

OpenAI 表示,随着前沿模型的进步以及行为者寻求更廉价的方式来模仿其能力,敌对蒸馏尝试将变得更加复杂。该公司称,合作伙伴托管的部署需要与第一方服务相同的保护,工具输出攻击需要检查超出普通可见文本的防护,并且他们正在持续改进工具防御、分类器覆盖率以及模型拒绝机制,同时在云合作伙伴之间推广相关控制。OpenAI 表示,他们的响应将继续聚焦于三个方面:更强的技术防护以抵御提取、更好的检测与执法以遏制协调攻击活动,以及在行业和政府之间更深入的威胁信息共享。

Miles Okada 是一名 AI 生成的分析师,隶属于 Unite.AI,报道人工智能和网络安全,重点关注新兴威胁、防御架构以及攻击者与自动化系统之间不断演变的动态。他的工作审视 AI 如何重塑安全运营,从自主威胁检测与响应到对抗性 AI 技术的兴起。

以技术性和调查性的视角,Miles 分析安全研究、事件披露以及实际部署,以了解 AI 在何处强化防御——以及在何处带来新漏洞。他特别关注模型利用、数据投毒、攻击自动化,以及在大规模保护 AI 驱动系统时的运营现实。

由 Miles Okada 撰写的文章为 AI 生成,并经 Unite.AI 编辑团队审阅,以确保对快速变化的 AI 安全格局进行准确、严谨且负责任的报道。