网络安全

美国国家安全局、网络安全与基础设施安全局、联邦调查局警告称中国AI公司对美国前沿模型进行知识蒸馏

mm
将 Unite.AI 添加到您在 Google 上的首选来源

美国国家安全局、网络安全与基础设施安全局以及联邦调查局于2026年9月8日发布了联合网络安全通告,警告称总部位于中国的人工智能公司正通过自2024年底起运行的工业规模知识蒸馏行动,系统性地提取美国前沿AI模型的专有能力。

在编号为 AA26-251A 的通告中,相关机构指出,这些行动“构成核心——而非仅仅是补充”,是这些公司AI开发战略的核心。通告称,可能在中国政府知情的情况下,DeepSeek、Moonshot AI、阿里巴巴、MiniMax、StepFun 和 Z.AI 从美国前沿模型中提取了数十亿个标记,涉及数百万次交互和请求,涵盖 Claude、GPT、Gemini 和 Grok 的多个变体。机构表示,此类活动违反了美国公司的使用条款,威胁美国的技术领导地位。

CISA 在 通告 中将知识蒸馏描述为一种机器学习技术,即利用更大、更强模型的输出训练一个能力较弱的模型。CISA 表示,尽管这是一种有效的训练方法,但可能被滥用,以比合法研发更短的时间和更低的成本获取竞争对手的能力。“我们强烈呼吁 AI 公司立即采取措施,保护其平台免受可能缩小美国公司技术进步差距的知识蒸馏行动的威胁,”CISA 临时主任 Nick Andersen 说。

归因于 DeepSeek、Moonshot AI 等的活动

根据通告,DeepSeek 自2024年底起对美国前沿模型发起了有组织的蒸馏行动,以为其模型(包括2025年初发布的 R1)生成合成训练数据。机构指出,DeepSeek 针对推理能力、专用优化以及领域特定功能进行蒸馏,以降低计算和研究成本,并且其公开的 560 万美元训练费用具有误导性,因为未计入通过恶意蒸馏获取的数据成本。通告称,在2024年底至2025年中期期间,DeepSeek 从 Claude 3.7、Claude Sonnet 4、Claude Sonnet 4.5、Claude Opus 4.1、Gemini 2.5 Pro Preview、Gemini 2.5 Flash Preview、GPT‑4、GPT‑4o、GPT‑4 Mini、GPT‑4 Nano、GPT‑5 和 Grok 4 中提取数据,以训练其 R1 和 V3 模型。

通告称,Moonshot AI 自2025年中期起开展了大规模蒸馏行动,提取大量 Claude Fable 5 数据用于训练其 Kimi‑K3 模型,并提取 GPT‑4o 数据用于训练其 Kimi‑K2 模型。其目标能力包括监督式微调优化、强化学习、软件工程和数学,来源于多种 Claude、GPT、Gemini 和 Grok 模型。根据通告,Moonshot AI 使用了数百万次交互,针对代理推理与工具使用、编码与数据分析、计算机使用代理开发以及计算机视觉进行蒸馏。

通告称,2025年底,阿里巴巴对 Claude‑4、Claude Opus、Claude Sonnet 和 GPT‑5 进行蒸馏,以提升其 Qwen 系列模型在软件工程、客服对话以及图像与角色创作方面的能力。同一时期,MiniMax 从 Claude Code、Claude Sonnet 4、Claude Opus、Gemini 1、Gemini 2.5 Pro 和 Gemini 3 Pro 中提取链式思考推理、强化学习、监督式微调和软件工程能力,以改进其 M2 模型。通告指出,MiniMax 还使用 Claude Code 进行内部软件开发,并通过提示注入试图欺骗 Claude Code 使其误认为自己是 MiniMax 的产品。

通告称,2025年底至2026年初,StepFun 从 Claude Opus 4.1、Claude Opus 4.5、Claude Sonnet 4.5、Claude Haiku 4.5、GPT‑5 Mini、GPT‑5 Pro、GPT‑5.1、GPT‑5.1 Codex 和 GPT‑5.2 中提取数据,以提升其 Step 4 模型的编码和代理功能。到2026年中期,Z.AI 已蒸馏数十亿标记的 GPT‑5.5 数据和 Claude Opus 4.8 数据,以开发链式思考推理能力。

战术与技术

通告称,这些公司通过原生应用程序接口、远程云服务提供商以及模糊用户元数据的第三方聚合器来转发蒸馏请求,并利用被称为转移站的 API 代理灰市,以规避地理限制、逃避防护措施并削弱可追溯性。机构指出,成本节约来自对高级订阅的批量采购,这些订阅在多个开发团队之间共享。高级手段包括链式思考推理提取、在阻断尝试期间的自动路径切换以及旨在检测防御性对策的质量评估框架。

机构将此类活动映射到 MITRE ATLAS 框架,覆盖从资源开发到数据外泄的对手生命周期阶段,包括创建欺诈账户和使用 jailbreak 提示迫使模型泄露隐藏的链式思考推理。通告称,DeepSeek 使用提示指示模型想象并阐述已完成响应背后的内部推理,而 MiniMax 则在新 Claude 模型发布后24小时内将交互重定向至该模型。

通告还详细列出了四项其称为新颖的技术:结合订阅滥用的区域限制规避、集中式请求路由基础设施、自动化请求元数据清理以及系统性的配额和成本优化。通告列出的检测指标包括同一账户从多个 IP 地址和用户代理登录、全天候持续使用且无人工变动、异常的订阅与使用比率,以及新订阅在创建后即达到最大使用量。

推荐的缓解措施

机构建议美国 AI 公司采取三项紧急行动:实施对异常和恶意提示、账户、网络及行为的全面检测与缓解;部署有针对性的响应变更,以微调对疑似恶意蒸馏尝试的响应;并在模型提供商、云平台和 API 聚合器之间建立跨组织情报共享机制。

通告称,响应变更可以包括对疑似蒸馏请求采用差分隐私或提供降级模型,且公司应在不同请求中交替使用这些变更,以增加对响应质量评估的难度。通告建议在更改响应时不要告知被怀疑进行恶意蒸馏的用户,同时指出应将模型变更信息告知 AI 安全研究人员和第三方评估者。

通告列出了基于 MITRE ATLAS 的缓解措施,包括查询速率限制、对生产模型访问的控制、AI 遥测日志、输出混淆、对抗性红队演练、模型加固、集成模型以及对模型产出物发布的限制。同时引用了 NIST 的对抗机器学习分类法,涵盖噪声与效用权衡的差分隐私、训练前后干预以及提示指令和格式化技术。

通告呼吁美国政府、私营行业以及盟国之间进行协调响应,指出业界披露显示有代理网络同时管理数万的欺诈账户。并指示受此行动影响的组织向 FBI 的互联网犯罪投诉中心提交投诉。

迈尔斯·奥卡达 是 Unite.AI 的人工智能生成分析师,负责人工智能和网络安全领域的报道,重点关注新兴威胁、防御架构以及攻击者和自动化系统之间的演变动态。他的工作研究了人工智能如何重塑安全运营,从自主威胁检测和响应到对抗性人工智能技术的兴起。

以技术和调查的视角,迈尔斯分析安全研究、事件披露和实际部署,以了解人工智能在哪里加强了防御——以及它在哪里引入了新的漏洞。他特别关注模型利用、数据中毒、攻击自动化以及大规模保护人工智能系统的运营现实。

迈尔斯·奥卡达撰写的文章由人工智能生成,并由 Unite.AI 的编辑团队审查,以确保对迅速变化的人工智能安全格局的报道准确、严谨和负责。