思想领袖
最棘手的 AI 安全问题已超出模型本身

The 2026 OWASP 大语言模型应用十大安全风险 为生产 AI 的成熟度提供了关键视角。它捕捉到一次重要转变:行业正从沙盒阶段迈向应对真实世界集成的复杂性。
当将大语言模型连接到企业工具和工作流时,威胁面会根本性改变。与权限和资源利用相关的风险变得更加难以遏制。同时,诸如输出处理不当等漏洞不再位于前沿,并非因为已解决,而是因为其他问题已跃居前列。
OWASP Top 10 排名反映了这一演变。“Excessive Agency”(过度代理)已从第六位上升至第三位,而 “Unbounded Consumption”(无限消费)攀升至第六位。相反,“Improper Output Handling”(输出处理不当)则跌至第十位。
这并不降低输出处理的风险。如果大语言模型的响应在未经严格验证的情况下直接进入 shell 或数据库,传统的注入缺陷仍然存在。然而,范式已发生转变。在代理系统中,模型的响应不是终点,而是携带权限的输入。当模型持有凭证或与 API 交互时,其输出充当可在不同系统间触发操作的向量。
安全挑战不再仅仅是评估模型本身,而是要界定推理之后的行为边界。你的架构决定了幻觉是停留在文本层面,还是演变为未授权的数据库变更。
排名反映危害程度
OWASP 利用了 7,714 起事件,其中 75% 由社区共识驱动,25% 由实证事件数据驱动。这些证据迫使优先级进行真正的重新排序。
“Excessive Agency”上升是因为生产环境的现实赶上了理论。组织在部署自主能力的速度超过了建立必要控制平面的进度。关键的漏洞不在于模型提供的答案本身,而在于执行该答案的授权上下文。
虽然 “Improper Output Handling” 仍然是一个关注点,但 DevOps 团队在通过模式验证和参数化查询来保护下游接收端方面已趋于成熟。这些已成为成熟的应用安全实践。
然而,代理问题属于另一类难题。工具调用在结构上可能是合法的,却在上下文中不合规。模型可能为不适当的任务调用已批准的函数,或针对错误的资源。静态消毒无法判断意图。这需要复杂的、上下文感知的授权,而模型绝不应单独执行此类授权。
将每个工具视为可暴露的能力
许多团队把工具定义仅视为集成管道。这是一个相当可笑且根本性的错误。每个工具、连接器或 API 端点都在扩展 AI 应用的影响范围。
设想一个用于汇总邮箱的代理。如果实现使用了包含写入或删除功能的宽泛连接器,那么在首次提示处理之前,你就已经引入了过度的功能。
必须遵循最小特权原则:
- 收窄接口:为代理提供只读工具,而非通用连接器。
- 范围化上下文:在用户的 OAuth 范围身份下执行请求。
- 策略执行点(PEP):在模型与下游系统之间实现强制性的中间件授权逻辑。每个操作在执行前都必须依据策略进行验证。
- 人工在环(HITL):对难以逆转或具有重大影响的操作要求明确批准。
这种做法需要在交付流水线中进行转变。你的审查过程必须超越模型本身,涵盖工具模式、服务身份和权限范围的变更。模型更新可能看似无害,但连接器的授权上下文变化可能导致灾难性漏洞。
可视性不可妥协。必须记录具体的工具执行、授权身份以及对目标系统产生的更改。这条责任链对事件响应至关重要,能够在中断活跃进程的同时,在事后重建审计轨迹。
每次自主运行都需要硬性停止
“Unbounded Consumption”(无限消费)激增是因为请求量并非衡量资源风险的充分指标。一次简短的提示可能触发递归的、资源密集型的工具调用链。计量器一直运行到代理完成为止。
当执行速度超出人工响应时,单纯的告警已不足以应对。需要确定性的硬性限制,置于代理控制之外。对令牌使用量、耗时、递归深度以及累计运营成本设定严格上限。如果执行超出这些参数,系统必须终止或限流运行。
运营范围同样需要严格把控。确定代理可以修改的记录最大数量,并界定任务传播的边界。如果你的架构缺乏确定性的“停止”机制,就相当于在未划定范围的情况下委托了权限。
为错误答案而构建
系统工程长期依赖弹性架构来保障本质上不可靠的组件安全。我们预见组件故障和网络不稳定;安全正是基于这一假设,而非完美的幻象。大型语言模型同样需要这种架构纪律。
不要把安全策略建立在模型完美对齐的假设上。应假设会出现失败,无论是良性误解还是恶意利用。将代理的能力限制在绝对必要的最小范围,并对所有下游调用保持严格的用户授权上下文。关键是,策略执行必须位于模型之外,以防止提示注入或推理错误绕过你的控制。
我们现在把提示注入视为一种物理定律,而非单纯的漏洞。它始终潜伏存在。事实是,模型本身无法有效决定安全关键问题。在我正在构建的真实代理项目中,我们约有 100 项自动化“红队”测试,并确保全部通过。但我们是通过在模型外构建硬性控制来实现的。我们可以关闭这些控制,观察仅模型本身的通过率。最老、最弱的模型测试失败率为 17%。最新、最大模型的失败率为 2%。进展显著,对吧?但在每一次失败都意味着敏感数据泄露的情况下,98% 的成功率够吗?远远不够。
高影响力的操作必须可观察、可审计,且理想情况下可逆。每一次自主执行都需要不可变的防护措施,这些措施必须超出模型的控制范围。
2026 年的排名清晰展示了 AI 失误何时转化为实质性后果。模型可能触发错误,但架构决定了冲击范围。对于生产环境中的 AI,最关键的安全工作发生在推理后的流水线阶段。












