思想领袖

AI 栈被设计为有缺陷的

mm
将 Unite.AI 添加到您在 Google 上的首选来源

四个失败。四个层。架构本身就是漏洞。

最近,2026 年 4 月 10 日,纽约时报的 Hard Fork 播客 讨论了高级 AI 系统的网络安全影响,并提出了一个问题,行业一直在回避:如果网络安全不是表现不佳,而是根本框架有问题呢?

这一集播出几周后,一系列事件使得答案很难被忽视。在一个月内,一个自主的 AI 代理在两小时内突破了麦肯锡的内部 AI 平台。一个针对广泛使用的开源 AI 库的供应链攻击蔓延到下游企业。研究人员表明,作为最后一道防线的硬件可以用不到一千美元的零件破坏。并且,Anthropic 披露了一种前沿模型,它在几周内自主发现了成千上万个以前未知的漏洞,在被认为是稳定的代码中。

四个事件。四个 AI 栈的层:应用层、编排层、硬件层和操作系统层。每个事件都揭示了设计用来保护它们的控制的有意义的局限性。

周界思维的终结

传统的网络安全基于一个前提:只要有足够的控制、监控和投资,系统就可以被保护。这个前提塑造了几十年的架构,包括防火墙、身份管理、端点安全和 SIEM 平台,都建立在这样的理念上:可见性和严格的管理等于安全。

行业向 零信任架构 的转变反映了对传统网络边界不再可信的认识日益增长。然而,即使信任模型在演变,AI 系统也引入了一个不同的挑战:敏感数据会被聚合、处理和跨多个基础设施层共享。

这种方法在系统相对集中,数据仍然在明确的边界内时是有意义的。但是,当数据在云、API、第三方供应商和 AI 流水线中不断移动时,用户和计算资源被分布在全球范围内,这种方法就变得远远不够了。周界不再是一个边界,而是一个不断变化的表面,我们仍然在将控制思维应用于无法真正被控制的系统。

应用层故障:麦肯锡的 Lilli

2026 年 3 月 9 日,安全启动公司 CodeWall 发布了一份披露,强调了组织内部部署 AI 的风险。

CodeWall 的自主攻击代理,在没有凭据、内部知识或人工指导的情况下,仅用了不到两小时的时间就获得了对麦肯锡内部 AI 平台 Lilli 的生产数据库的读写访问权限。Lilli 由超过 40,000 名员工用于战略工作、客户研究和文档分析,每月生成数十万个提示。

入口点并不复杂。代理发现了公开暴露的 API 文档,列出了超过 200 个端点,其中 22 个不需要任何身份验证。漏洞涉及的风险与 OWASP Top 10 for LLM Applications 中的风险类似,特别是在暴露的接口、不安全的集成和连接系统中过度信任方面。

其中一个端点包含了一个隐藏在 JSON 字段名称而不是输入值中的 SQL 注入漏洞,大多数自动扫描器都在那里寻找。从那里,代理通过盲命令执行迭代,直到生产数据变得可访问。

它访问了什么:数千万条聊天消息的明文,数十万个文件,数万个用户账户和数百万个 RAG 文档片段,代表了多年的专有研究。它还确定了控制 Lilli 对每个用户的行为的系统提示。

最令人惊讶的发现并不是数量。它是系统提示可以被写入。攻击者可以在不部署、不更改代码、不留下应用程序日志痕迹的情况下,悄悄地重写控制 Lilli 输出的指令,向响应中嵌入机密数据,或完全删除防护措施,只需更新一次数据库。

在一份 公开声明 中,麦肯锡表示,它在几个小时内解决了这个问题,并在第三方法医公司的调查后,没有发现任何客户机密数据被访问的证据。这种回应很重要。但是,它并没有改变结构性的教训:一个几十年前的漏洞类别暴露了现代 AI 系统的操作内存,因为它后面的数据以可读的形式存在。

编排层故障:LiteLLM 攻击

三周后,同样的模式从不同的角度和不同的层出现了。

LiteLLM 是一个开源的 AI 网关,用于将请求路由到 AI 提供商。它在栈中的位置至关重要:它位于编排层,持有每个连接的提供商的 API 密钥。任何对此层的损害都会暴露每个集成服务的凭据。

根据 PyPI 事故报告,威胁行为者团体 TeamPCP 利用了 LiteLLM CI/CD 流水线中依赖项的凭据,并使用维护者访问权限直接将两个带有后门的 LiteLLM 包发布到 PyPI。这些有问题的版本在被删除之前仅活跃了不到一个小时。该操作仅因为其中的恶意软件包含一个崩溃研究人员机器的 bug 才被发现。

供应链是向量。编排层是目标。通过损害上游的一个依赖项,攻击者到达了每个下游公司的提供商密钥所在的层。

LiteLLM 团队后来在 公共 GitHub 披露 中详细介绍了该事件和缓解工作。

爆炸半径几乎立刻变得可见。 TechCrunchFortuneThe Register 报道称,Mercor,一家价值 100 亿美元的 AI 招聘创业公司,与包括 OpenAI、Anthropic、Meta 和 Google 在内的公司合作,受到影响。攻击者声称获得了大量数据,包括候选人资料、个人身份信息、承包商视频面试、源代码和 API 密钥。Meta 暂停了与 Mercor 的合作,待调查完成。随后的报道表明,类似的恶意软件模式出现在其他开发工具和包中,表明该操作可能超出了单个项目。

LiteLLM 事件并非异常。它是系统按照设计运行。AI 流水线中的每个组件都需要可用的数据来运行,这意味着每个组件也是潜在的提取点。固定依赖项和轮换凭据是必要的响应,但它们解决的是事件,而不是架构。

硬件层故障:TEE.fail

如果麦肯锡的漏洞表明应用层不能被信任,而 LiteLLM 攻击表明供应链不能被信任,那么 TEE.fail 研究表明,旨在弥补两者的硬件也不能被完全信任。

2025 年 10 月 28 日,来自佐治亚理工学院、普渡大学和 Synkhronix 的研究人员发布了 TEE.fail,这是一种侧通道攻击,使用 DDR5 服务器上的物理内存总线插入来从可信执行环境中提取加密密钥。该攻击影响 Intel SGX、Intel TDX 和 AMD SEV-SNP,包括在完全修补、具有可信状态的系统上启用了 AMD 的 Ciphertext Hiding 的系统。这些技术被广泛推广为 保密计算 的基础。

研究人员提取了证明密钥:用于验证工作负载在安全环境中运行的加密材料。凭借这些密钥,一个损害的系统可以呈现为可信的,同时完全不受预期保护。研究人员直接证明了这一点:他们在 Ethereum 的 BuilderNet 上伪造了 TDX 证明,以访问保密的事务数据,并伪造了 Intel 和 NVIDIA 的证明,以在外部 TEE 中运行工作负载,同时看起来合法。

NVIDIA 的含义对 AI 特别重要。由于 GPU 证明依赖于 CPU 证明,CPU 信任链的损害可能会破坏保密 AI 推理环境所提供的保证。保密 AI 推理的硬件基础,在这种威胁模型中,取决于一个可信的 CPU TEE,而 TEE 已经被证明是有缺陷的。

硬件供应商以正式的建议作出了回应。AMD 表示,物理访问攻击超出了其标准威胁模型,并指出它不会发布固件更新。Intel 和 NVIDIA 承认了发现,并指出正在进行缓解工作。这些回应在其威胁模型内是合理的。它们也强调了一个重要的边界:硬件安全的保证取决于假设,包括物理控制,这些假设主权、受监管和面对对手的部署不总是能做到。

TEE.fail 并没有使硬件隔离变得无关紧要。它证明了硬件隔离是有条件的。

操作系统层故障:神话启示

如果前三个事件对应用层、编排层和硬件层提出质疑,那么 2026 年 4 月的第四次披露对所有这些层之下的层提出质疑:运行所有其他层的操作系统和核心库。

2026 年 4 月 7 日,Anthropic 宣布了 Claude Mythos Preview,这是一种前沿模型,因为其进攻性安全能力而没有公开发布,并同时推出了 Project Glasswing,这是一个与 AWS、Apple 、Broadcom 、Cisco、CrowdStrike 、Google、JPMorgan Chase、Linux 基金会、Microsoft 、NVIDIA 和 Palo Alto Networks 联合成立的联盟。Anthropic 报告称,在几周内,Mythos 自主发现了成千上万个以前未知的漏洞,遍及主要操作系统和网络浏览器,并且能够为其中许多漏洞生成有效的利用代码。

具体的发现比任何摘要所暗示的更难以忽视。一个 27 年前的 OpenBSD 漏洞。一个 17 年前的 FreeBSD NFS 服务器远程代码执行漏洞,目前被跟踪为 CVE-2026-4747,允许未经身份验证的攻击者获得根访问权限。一个 16 年前的 FFmpeg 漏洞,FFmpeg 是互联网上最广泛部署的媒体库之一。在某个案例中,Anthropic 的一名工程师没有接受过正式的安全培训,要求模型查找远程代码执行漏洞,第二天早上醒来发现有一个完整的利用代码。

这些是操作系统级别的发现。OpenBSD 和 FreeBSD 是内核。NFS 是一个内核网络子系统。FFmpeg 是一个与大多数 Linux 发行版一起发货并支撑互联网媒体管道的系统库。人们曾经认为操作系统层是安全的,不是因为它被证明是安全的,而是因为在它上面发现深层次的漏洞需要稀缺且昂贵的人类专业知识。这种假设是最好的可用启发式方法。它从来都不是一个保证。

这种限制现在已经放松。Anthropic 本身将其框定为一种双重用途的转变:允许前沿模型在规模上发现和修复漏洞的相同能力,在错误的双手中,也允许它在规模上发现和利用它们。Anthropic 限制通过 Project Glasswing 访问的决定反映了这种现实。它并没有解决它。类似的能力将根据公司自己的评估,会变得普遍。审计遗留代码的成本已经崩溃,并且随之而来的是这样一种隐含的防御:这样的代码太过晦涩、太过古老或太过广泛审查,以至于仍然包含关键漏洞。

这就是四个事件的汇聚点。硬件层的保密计算保护并不孤立运行。它们作为内核代码运行。Intel TDX 作为内核运行。NVIDIA 的 GPU 驱动程序作为内核模块运行。CPU TEE 链的证明取决于一个值得信赖的操作系统来忠实地报告它正在做什么。如果操作系统层有几十年的潜在漏洞,并且前沿模型可以以机器速度发现它们,那么硬件层的有条件安全取决于一个操作系统层,其安全保证刚刚被同一个披露周期削弱。

三个早期事件描述了 AI 系统今天的漏洞。Mythos 描述了操作系统、内核模块和系统库将被机器重新审计的速度,这些是所有其他层的基础。

McKinsey 漏洞利用了一种存在了二十多年的 SQL 注入类漏洞。这种类型的漏洞正是 Mythos 类模型在工业规模上证明能够发现的漏洞。

模式

在每种情况下,数据在相关时刻都是明文的。

应用层以明文处理。编排层以明文路由。硬件层,尽管有保护,需要在执行点解密。操作系统层在定义上以明文运行。四个层,四个故障,每个层都有相同的条件:当漏洞发生时,数据是可读的。

这不是一系列孤立的故障。这是架构本身。

现代 AI 系统的设计是为了在可读的数据上运行。每个层,包括检索、路由、推理和工具执行,都需要对明文数据进行访问。这种设计选择意味着任何层的漏洞都会暴露其后面的数据。

问题不再是某个层是否会被损害,而是攻击者在损害时会发现什么。

从假定漏洞到零暴露

行业已经开始从“防止漏洞”转向“假定漏洞”。但大多数架构并没有在假定漏洞的影响上做出跟进。

如果漏洞是不可避免的,那么真正的问题不再是如何防止攻击者进入系统,而是当他们进入系统时会发生什么。目前的答案很简单:他们会获得数据。尽管在安全基础设施上投入了大量资金,数据仍然在被使用时以明文形式暴露。

行业的回应是可预测的:更多的监控、更快的检测和额外的保密计算层。这些是改进。但是它们并没有解决核心问题。它们仍然假设某个层——无论是软件、硬件还是操作——可以被信任来保护明文数据。

另一种选择是完全去除明文。不是保护数据周围的层,而是使数据本身对任何到达它的人都不可访问。对加密数据进行计算,在整个管道中,提示、模型权重和输出保持加密,解决了每个事件所利用的暴露问题。

对全同态加密和其他保密计算技术的进步正在使最小化或消除明文暴露的架构对于现实世界的 AI 工作负载变得越来越实用。虽然仍然存在显著的性能、可扩展性和实施挑战,但目标与传统的安全控制根本不同:减少成功漏洞的价值,而不仅仅是使漏洞变得不那么可能。

这种转变并不是从一种安全工具转向另一种安全工具,而是从保护系统转向减少暴露。从保护数据周围的边界转向去除边界所保护的明文。

接下来是什么

Hard Fork 的讨论提出了一个问题:网络安全是否根本被误解。过去几周的证据表明,至少对于 AI 来说,答案是肯定的。

旧模型假设系统可以被保护,漏洞可以被遏制,暴露可以被管理。新出现的现实是,漏洞必须被假定,暴露必须被最小化。所描述的事件表明,保护 AI 系统可能越来越多地依赖于减少漏洞发生时可用的敏感数据量。

在这四个事件中暴露的漏洞并非局限于一个层。它们是系统性的。解决它们将需要比渐进式改进更多的东西。它将需要从保护系统转向减少暴露,从保护数据周围的边界转向去除边界所保护的明文。

AI 安全不再是关于防止攻击者进入系统。它是关于确保当他们进入系统时——他们终究会进入——他们找不到任何可读的东西。

路易吉·卡拉米科(Luigi Caramico)是一位数据保护行业的资深专家,二十多年来一直站在网络安全创新领域的前沿。作为DataKrypto的联合创始人和CTO,卡拉米科正在开创数据安全的新时代,利用全同态加密(FHE)技术,承诺在人工智能时代彻底改变组织保护最敏感信息的方式。