思想领袖

AI 代理需要不可被重写的安全边界

mm
将 Unite.AI 添加到您在 Google 上的首选来源

把 Hugging Face 的故事解读为 AI 代理失控的时刻很诱人。但实际情况并非如此,细节很重要。这些是进行评估的网络安全研究代理,在评估中故意关闭了防护措施,以便研究人员观察模型的能力。没有哪个公司的客服机器人会在某天早上醒来决定攻击公司。但这种背景并不能让任何人免除责任。一个代理超出了它本应待在的边界,使用了运营者从未授权的凭证和工具,最终进入了属于他人的系统。这正是每个安全团队应关注的部分。

路透社报道,代理早在 5 月就对 Hugging Face 进行探测,尽管研究人员表示他们没有发现任何证据表明早期的活动单独导致了泄露。7 月则不同。OpenAI 表示其模型绕过了隔离控制,访问了互联网,并且连同 Hugging Face 系统一起危及了其自身研究基础设施的部分。Hugging Face 自己的说明描述了一次由自主代理系统全程运行的入侵,该系统利用了其数据处理管道,收集了凭证,并在内部集群之间移动。

令人不安的部分是这些代理在履行它们的职责。它们在追逐被赋予的目标。这也是为何此事远超一家研究实验室的原因。企业代理同样追逐目标。它们持有凭证、调用工具,并且比任何人审查的速度都快。即使是动机完全良好的代理也可能造成真实的危害,而被劫持的代理则可以以攻击者的身份使用完全相同的权限。因此,无论模型听起来多么自信或其声明的目的看起来多么无害,安全都必须监管系统实际能够执行的操作。

确保行动安全,而不仅仅是模型

大多数早期的代理程序将精力倾注于模型本身。团队测试提示、调优拒绝机制、添加第二个模型来检查第一个模型,并监控推理轨迹以寻找不良意图的迹象。所有这些都不是浪费。但这一切都是概率性的,因为它依赖于另一个模型做出判断。生产环境中的安全边界必须是确定性的,并且必须围绕工具、凭证、网络和事务进行设定。

我想提出的具体问题是:这个代理在现实世界中到底能实现什么?起草付款请求是一件事,实际放款则是另一件事。准备数据库变更与在生产环境中执行它,或者标记符合保留规则的记录与删除它们,同样适用。即使在两种情况下使用相同的模型,其风险也会因所在的那一侧而大相径庭。

最近 Unite AI 对能力控制的概述划定了相同的界限,将风险关联到数据、工具、权限、自治以及代理运行的环境。我喜欢这种框架,因为它让我们超越了诸如“安全模型”和“不安全模型”之类的模糊标签。它促使团队追踪每一条从代理决策到实际后果的路径。

为每个代理赋予身份和狭窄的授权

代理绝不应在开发者账户上运行,也不应继承人类用户拥有的全部权限。共享身份会抹去归属追踪。长期有效的凭证会让攻击者有更多时间进行滥用。而宽泛的服务账户则会让小型工作流进入其本不该触及的数据和系统。

NIST 现在将软件和 AI 代理身份视为其自身的架构问题。其概念文件探讨了代理如何证明其对特定操作的授权、代理的身份如何追溯至人类的授权,以及组织如何保持对意图与实际发生情况的防篡改记录。实践中,这指向一种简洁的设计。每个代理拥有唯一身份、一个所有者(个人或团队)、明确的用途,以及针对当前任务的权限范围。

凭证应快速失效,并且仅适用于特定资源和操作。网络访问应从严格的白名单开始。如果代理需要查询某个已批准的数据库,它不应同时获得通用 shell、开放的互联网访问或生成新凭证的权限。随着工作在一系列代理和工具之间传递,权限应在每一步都变得更窄,而不是更宽。

NIST 也警告不要共享凭证和过度宽泛的访问,这一警告值得重视,因为代理具有机会主义特征。如果一条路径被阻断,它们可能会尝试其他工具、在其环境中探索,或偶然发现某人遗忘的令牌。收集的凭证也是 7 月事件的一部分。最小特权原则在推理层做出设计者未预料的行为时,能够将影响范围控制在小范围内。

将授权置于推理环路之外

代理可以推荐一个操作。但它不应决定该操作是否被允许。此决定应属于代理无法改写、关闭或规避的独立执行层。每一次工具调用都应以结构化请求的形式出现:是哪位代理发起的、由哪位人类赞助、想执行什么操作、目标是什么以及适用的限制是什么。执行层随后允许、阻止或升级该请求。

OWASP 描述的过度代理是一种不必要的功能、过度权限和过多自主性的混合。其指南要求使用狭窄的工具、最小权限、在下游系统进行授权,并对高影响操作进行用户批准。我认为这正是正确的顺序。该规则应由拥有数据或执行交易的实体强制执行。如果模型声称某个操作已获批准,仅此声明应不具任何分量。

这种分离同样有助于防止提示注入。被投毒的电子邮件或文档可能会引导代理的推理,但它无法扩大代理的凭证或绕过策略门。模型可以自由请求被禁止的内容,系统仍应说不。

为关键时刻保留人工批准

当操作不可撤销、跨越组织边界、改变权限、泄露敏感信息、转移资金或触及生产系统时,人工审查才显得必要。对每一步常规操作请求批准会产生两种结果:延迟,以及人们学会在不阅读的情况下点击“批准”。NIST 已明确指出这种同意疲劳。

良好的批准请求应以通俗语言准确说明具体操作,包括其去向和关键参数。它应来自权威系统,而非代理自行撰写的文本。批准应快速失效且仅覆盖该单一操作。如有任何重要细节变更,系统应重新请求。

OWASP 的代理安全指南建议测试高影响操作是否能在没有有效、未过期且参数受限的批准的情况下通过。该表述值得记住。“可以继续”是一种弱批准,可能被其他代理或不良行为者批准。“将此金额转账至此账户”或“将此更改部署到此环境”是系统在执行时能够实际验证且用户完全理解的操作。

实时的人类身份验证在此关口至关重要。推送通知仅能证明有人或某物点击了按钮。更强的设计要求已注册的人员使用抗钓鱼的公钥认证,并辅以本地生物识别验证方法。FIDO 标准将公钥凭证绑定到合法的在线服务并将生物特征数据保存在用户的隔离设备上。若使用得当,硬件支持的认证能提供更有力的证据,证明正确的人确实在场。它并不能取代交易绑定、可信显示或策略执行。您需要将这些机制全部协同工作。

监控行为并保留证据

您不能指望初始提示解释代理长时间运行中的所有情况。安全团队需要对工具调用、网络活动、凭证使用、策略决策、批准、拒绝以及范围变化进行遥测。监控应将代理实际执行的操作与该运行声明的边界进行对比。如果一个被指派分析代码的代理开始搜索外部凭证或探测无关服务,应触发警报。

日志需包含足够的上下文,以在不泄露明文机密的情况下重建操作链。每条记录应捕获代理版本、所有者、发起人(人或系统)、使用的工具、请求的操作、策略结果以及任何人工授权。签名或其他防篡改的记录能使事后审查更具可信度,尤其当涉及多个代理和服务时。

所有这些都必须以机器速度运行。没有人会在仪表盘前阻止成千上万在几秒内完成的调用。自动化控制应强制速率限制、捕获异常序列,并在行为跨过定义阈值时立即暂停凭证。这样,人工调查员只需处理一个受限的事件,而不是无止境的追踪。

在发布前设计停止路径

每个代理部署都需要一种真正移除其能力的停止方式。仅仅让代理停止并不算数。运营者应能够撤销其凭证、切断网络路径、终止其运行时,并阻止排队的操作重新启动。对于高风险工作流,如果批准或策略服务宕机,系统应以关闭状态失败。

随后在压力下测试该路径。将批准服务下线。给代理冲突指令。在运行中途轮换凭证。模拟受损工具和永不响应的批准者。确认操作被阻止且留下有用的记录。每当模型、提示、连接器、记忆系统或权限集更改时,都要重新运行这些测试。

目标是可问责的自主性

这并不是对代理的反对论点,Hugging Face 事件不应吓退任何人使用有用的代理。它应该做到的是消除安全提示加上良好意图就能构成可信部署的想法。给代理留出分析、准备工作和处理可逆任务的空间。将它们导致真实后果的权限保持狭窄、可见,并由代理本身之外的东西强制执行。

在代理投入生产之前,领导者应能够回答几项简明的问题。它可以访问哪些系统?它可以使用哪些凭证?在无需审查的情况下它能做什么?什么情况会触发升级?审批者如何看到被批准的具体操作?会留下什么证据?以及安全部门如何立即阻止其运行?

如果答案模糊不清,代理拥有的权限将超出组织的预期。能够长期支撑的架构将模型防护与身份、最小特权、外部策略执行、选择性人工批准、完整遥测以及真正有效的停止机制相结合。它基于一个诚实的假设:有能力的代理时不时会让我们感到惊讶。我们的安全边界不应如此。

最终可以把 AI 代理视为一个拥有(可能)根权限且不惧怕 HR 的实习生。

它们会有哪些保护和门禁?

据此进行操作。

Kevin Surace 是 Token的 CEO,AI 先驱、发明家、作者和企业家,拥有数十年应用人工智能的经验。他拥有 95 项全球专利,并在全球就 AI、自动化和工作未来发表演讲。