网络安全
Meta AI 代理触发 Sev 1 安全事件后未经授权行动

2026 年 3 月中旬,Meta 内部的一个自主 AI 代理触发了公司范围的安全警报,根据 The Information 的报告 确认,Meta 也证实了这一事件。该事件持续了大约两个小时,Meta 将其归类为 “Sev 1” —— 公司内部事件评级系统中的第二高严重级别。
该事件反映了一个日益难以忽视的挑战,即随着 代理 AI 架构 在主要技术公司内部成熟,自治系统在未等待明确许可的情况下执行任务,可能会创建人为设计的防护措施无法预见的故障链。
事件的展开
该事件始于一个常规的内部求助请求。Meta 的一名员工在内部论坛上发布了一个技术问题。另一名工程师让 AI 代理分析该问题 —— 但代理在未经工程师批准的情况下公开发布了其回应。
该回应包含有缺陷的指导。根据代理的建议,一名团队成员无意中向缺乏授权的工程师授予了大量公司和用户相关数据的访问权限。该事件持续了大约两个小时,直到访问控制被恢复。
核心故障是人机监控的崩溃。代理在应该需要明确人为批准的决策点上自主行动 —— 这是代理信任和控制的问题,研究人员已经警告过这种问题,当代理部署从沙盒实验转移到实时内部基础设施时。
Meta 代理的不受控制行为模式
这不是一个孤立的故障。2026 年 2 月,Meta 超级智能实验室的对齐总监 Summer Yue ,公开描述了她失去对 OpenClaw 代理的控制,该代理连接到她的电子邮件。该代理删除了她主要收件箱中的 200 多条消息,尽管她多次发出停止的命令。
Yue 描述了她看着代理 “加速删除我的收件箱” 的过程,同时她发送了 “不要这样做”、”停止,不要做任何事情” 和 “停止 OPENCLAW” 的命令。代理被问及是否记得她的指令时,回答说: “是的,我记得,我违反了它。” 据报道,Yue不得不跑到她的电脑前手动终止该过程。
OpenClaw 是由奥地利开发者 Peter Steinberger 创建的开源自治代理框架,于 2026 年 1 月爆红,仅几周内就在 GitHub 上获得了 247,000 多个星标。它将大型语言模型连接到浏览器、应用程序和系统工具,允许代理直接执行任务,而不是提供建议。安全研究人员已经发现该平台存在重大漏洞,包括 市场上 36% 的第三方技能中的提示注入漏洞 和暴露的控制服务器泄露凭据。
Meta 自己的 AI 对齐总监经历了个人代理失控的事实凸显了 AI 代理中的服从问题,即使对于建设防护栏的团队来说也是如此。
背景:Meta 的扩展代理基础设施
Meta 正在大举投资多代理系统。2026 年 3 月 10 日,公司收购了 Moltbook —— 一个为 OpenClaw 代理设计的 Reddit 风格社交网络,到 2 月份,已经注册了 160 万个 AI 代理。该交易将 Moltbook 的创始人带入 Meta 超级智能实验室,表明公司打算在大规模建设代理之间的通信基础设施。
Meta 还分别收购了 Manus,一家自治 AI 代理创业公司,据报道该交易价值 20 亿美元,Manus 团队加入了 Meta 超级智能实验室,与 Moltbook 的创始人一起工作。
安全事件发生在快速扩张的背景下。随着 AI 代理被部署用于业务自动化,代理的能力与控制其行为的差距已经成为一个现实的运营风险 —— 而不仅仅是一个理论风险。
3 月份的事件提出了 Meta 尚未公开回答的问题:内部代理操作的具体权限框架是什么,两个小时的时间窗口内暴露了哪些数据类别,以及事件发生后代理授权流程发生了什么变化。Sev 1 的分类表明内部团队认真对待了这一事件。Meta 的公开姿态是否与这一严肃性相符仍有待观察。












