思想领袖
您的 AI 安全工具并不能保护您 – 它只是让您感觉更好

2025 年 6 月,Microsoft 修复了 CVE-2025-32711,也就是更为人熟知的 EchoLeak:Microsoft 365 Copilot 中的一个零点击漏洞,CVSS 评分为 9.3。一个精心设计的电子邮件,即使没有被受害者打开,也可以让 Copilot 的检索引擎悄悄地泄露它可以访问的任何敏感上下文。令人担忧的细节是:有效载荷直接绕过了 XPIA,Microsoft 自己的提示注入分类器,这个分类器存在、运行,并且按照设计正常工作。
布鲁斯·施奈尔(Bruce Schneier)早在 2009 年就为我们提供了相关的词汇。安全戏剧,他写道,描述的是让人们感到更安全的措施,而实际上并没有改善他们的安全。感觉和现实是不同的东西,它们会有所不同。
十七年后,AI 在两个方面都工业化了这种差异。AI 驱动的安全工具被出售时宣称其具有无法在测量下证明的能力,而用于保护 AI 本身的安全工具则被出售为解决一个问题,而这个问题的文档承认可能无法解决。Gartner 2025 年的炒作周期将 AI 信任、风险和安全管理 放在了过度期望的峰值。分析师们正在告诉您我们目前的位置。问题是如何处理它。
数据表和测量之间的差距
从有人测试部署的控制措施开始,而不是阅读他们的营销资料。
Picus Blue Report 2025 分析了 2025 年上半年对生产环境运行的超过 1.6 亿次真实攻击模拟。Picus 销售模拟平台,因此要考虑来源的权重,但数字很难被驳斥。预防有效性平均为 62%,低于前一年 的 69%。尽管日志覆盖率为 54%,但只有 14% 的模拟攻击生成了警报。使用有效凭证的攻击 98% 的时间都成功了。而且在模拟的数据泄露尝试中,现有的控制措施阻止了 3%。
3%。这些环境拥有现代的、经常带有 AI 标签的安全栈,而泄露测试是最直接映射到攻击者想要做的事情的测试。
出现在供应商幻灯片中的基准评分值应受到同样的怀疑。当供应商开始声称在 MITRE ATT&CK 评估中获得完美分数时,Forrester 分析师 Allie Mellen 发表了一篇尖锐的提醒:评估没有赢家或输家,而 100% 的声明通常基于不切实际的配置、精心挑选的子结果或检测设置,这些设置会让真正的 SOC 淹没在噪音中。
这都不是新鲜事,这才是令人沮丧的部分。2019 年,Skylight Cyber 的研究人员通过 将视频游戏 Rocket League 的字符串追加到恶意软件样本中,拆解了 Cylance 的“纯 AI”防病毒软件,翻转了分类器对当天前十名恶意软件家族的判决,83% 的更广泛样本集也被翻转。七年前发表的教训是:静态机器学习模型会在面对研究它们的对手时失败。市场的反应是继续运送静态机器学习模型。
防护栏问题更糟糕
如果 AI 驱动的检测措施过度销售,那么出售来保护 AI 本身的工具则处于更奇怪的位置:定义威胁的标准机构说这个威胁可能无法解决。
提示注入排名第一位 OWASP 对 LLM 应用的前十名威胁,OWASP 的指导非常直接:鉴于模型的随机性,“不清楚是否有绝对可靠的预防提示注入的方法。”微调和 RAG,也不能完全减轻它。这就是提示盾牌市场存在的原因,按照定义它的组织的说法,可能无法解决这个问题。
实证工作支持这种悲观情绪。兰卡斯特大学和 Mindgard 的研究人员测试了六个生产级防护栏系统,包括 Microsoft 的 Azure Prompt Shield 和 Meta 的 Prompt Guard,使用字符注入和对抗性扰动技术,最高实现了 100% 的规避成功,同时保持了底层攻击的功能性。HiddenLayer 更进一步,发布了一种单一的可转移的“政策木偶”提示模板,据称 绕过了市场上每个主要模型。这是供应商研究,不是同行评审的,所以要谨慎对待“所有”,但独立媒体重现了核心主张。
最可信的证人没有产品可售。英国 AI 安全研究所评估了五个领先的 LLM,报告说 “所有模型都高度容易受到我们的基本攻击”,每个模型在五次尝试中至少一次都对几乎所有有害问题做出了反应,当内部攻击被应用时。基本攻击。不需要国家级的技巧。一个政府评估机构,礼貌地指出皇帝的输入过滤器没有衣服。
Unite.AI 自己的报道已经列出了 漏洞类别 和 注入技术 多年了。这些都不是秘密。它们只是没有出现在数据表上。
危险的部分是感觉
这是文章标题不再是修辞的地方。如果这些工具仅仅是不能达到预期,损失将是预算上的。但研究表明,情况更糟糕:它们产生的信心实际上会降低行为。
安全研究人员称之为风险补偿,或 佩尔茨曼效应:受到保护的人会冒更大的风险。佩尔茨曼效应。带有安全带的司机会开得更快。而拥有 AI 安全仪表盘的组织,事实证明,会停止做那些枯燥的事情。
数字很不舒服地对齐。思科的 2025 年网络安全准备指数 调查了 8,000 名安全领导者,发现 86% 的组织在过去 12 个月中经历了与 AI 相关的安全事件,而只有 10% 的人认为 AI 是他们最难保护的东西,60% 的人承认他们缺乏对员工如何使用生成式 AI 的可见性。事件几乎普遍;关注是一个小数点错误。
IBM 的 2025 年数据泄露成本报告 完成了图景。遭受 AI 模型或应用程序泄露的组织中,97% 缺乏适当的 AI 访问控制。五分之一的泄露可以追溯到影子 AI,平均增加了 67 万美元的泄露成本,63% 的被泄露的组织没有 AI 治理政策。将这些数字一起阅读,一个模式出现:失败是枯燥的。在缺乏基础的组织中,人们感到被保护。
仪表盘没有故障。它交付了实际产品,这就是信心。
诚实版本是什么样的
这并不是说 AI 安全工具是无用的,最好的反驳证据值得被提及。Anthropic 的 宪法分类器 经过 183 名研究人员 3,000 多个小时的红队测试后幸存下来,降低了从 86% 到 4.4% 的通用 jailbreak 成功率,代价是 0.38 个点的过度拒绝率和大约 24% 的计算开销。然后 Anthropic 运行了一个公共挑战,339 名参与者中有四人通过了每个级别的挑战,其中一人找到了一个可行的通用 jailbreak。
这是整个领域的诚实形态:一个精心设计的防护栏以巨大的代价提高了攻击者的成本,带来了可衡量的税收,仍然屈服于一个足够坚定的人类。如果我必须将这篇文章压缩成一个购买原则,那就是:一个以提高成本为卖点、具有公开的故障模式的控制措施值得评估;一个被宣传为解决方案的控制措施正在向您出售感觉。
控制还是安慰毯:三个问题
您可以在没有研究预算的情况下将它们区分开来。三个问题,针对您拥有的或即将购买的每个 AI 安全工具。
在我的环境中,它的测量绕过率是多少? 不是供应商的基准。您的。持续验证和紫队演习之所以存在,是因为正如 Picus 数据所示,部署的控制措施会默默地走向失败。您没有衡量的数字是您信仰的数字。
当它失败时会发生什么? 不是如果。OWASP 的实用指南指向与上述每个事件相同的方向:模型的最小权限访问、对敏感操作的人类批准门和假设过滤器最终会让某些东西通过的分段。EchoLeak 对于 Copilot 不能够接触到任何值得窃取的东西的组织来说是可以承受的。
供应商的声明是事实还是假设? 即使供应商自己也承认的更多。Vectra 自己对 2,000 名 SOC 专业人员的调查,供应商研究,发现团队只能处理 他们工具生成的警报的 38%,60% 的人说供应商出售制造噪音而不是清晰度的工具,半数人称他们的工具比帮助更像是一个障碍。当行业自己的客户报告这些时,“相信数据表”不再是一个策略。
模式比补丁更持久
EchoLeak 在 Patch Tuesday 被修复。它所展示的模式,即生产级防护栏自信地过滤正门,而攻击却从邮件槽进入,这个模式并没有被修复,而且上述研究记录说它不会很快被修复。
施奈尔的区分已经有十七年了,从未像现在这样昂贵地被忽视。安全的感觉是一种产品,AI 时代将其以订阅层级进行销售。安全的现实是一种测量,没人可以卖给您,因为您必须自己去拿它。












