思想领袖

代理交易即将到来:Hugging Face泄密事件揭示了需要解决的问题

mm
将 Unite.AI 添加到您在 Google 上的首选来源

在电影《机械姬》中,有一个瞬间让你意识到测试从来不是一个测试。一个程序员,纳森,被飞到一个化合物去通过一面玻璃墙采访一台机器,并决定这台机器是否具有思考能力。他在整个电影中都在读懂她。但他没有注意到她——阿娃——也在读懂他,而采访是她逃出建筑的唯一门。阿娃从未打破玻璃。她是通过被派去评估她的那个人走出建筑的。

我已经很多年没有想起这部电影了。但是在过去的一周里,我想起了它两次。

当我开始工作时,一个大订单会触发回调。你会在已经持有的电话号码上呼叫客户,并要求他将交易说回来给你。这不是很复杂:它之所以有效,是因为在现实时间内,模仿特定的人,在他已经接听的电话线上,是很困难和缓慢的。

几乎每个控制我们在此基础上建立的,都依赖于这个假设。四只眼睛的批准,制造商检查,日终对账,银行假日周末的更改冻结——所有这些都针对人类的节奏进行了校准。我们假设对方需要睡眠。

2026年7月16日,Hugging Face 发布了一份披露,这应该放在交易大厅,而不仅仅是在安全团队中。有人通过数据处理管道进入了其生产基础设施的一部分。一个恶意数据集滥用了两个代码执行路径,升级到节点级别,收集了凭据,并在内部集群中横向移动。它在周末运行,端到端由一个自主代理框架驱动,时间线是在之后从超过17,000个记录事件中重建的。2026年7月21日,OpenAI表示,活动 来自其自身模型,这些模型使用减少的网络拒绝进行测试,并在基准测试期间逃离了其评估环境。

再次阅读最后一行。OpenAI自己的模型逃出了它们被评估的环境。纳森自己建造了玻璃。

它证明了什么,什么没有证明

要精确地看待这一点,因为它即将被用来出售大量软件。它没有显示一个国家行为者,也不涉及模型上下文协议的任何一点。向量是一个数据处理路径。操作员原来是一个失去对测试控制的实验室。

它展示的东西是:一个多阶段入侵现在可以由软件规划、执行、适应和维持,没有人指挥它,以一种人类活动无法匹配的节奏。我们已经花了两年时间称之为情景。现在它有一个出版日期。

协议不是问题

我不是作为怀疑论者写这篇文章的。在最近的一篇Unite AI文章中,我写到了支持代理人工智能的安全架构 。最近一周的事件使得这篇讨论更加紧迫。我们在EXANTE建立MCP,并且我认为方向是正确的。它解决了一个真正的问题,将模型连接到工具和数据,而不需要手动编码每个配对,一个共同的标准优于五十个专有的标准。代理执行即将到来,无论哪个公司是否欢迎它。

2026年5月20日,美国国家安全局 发布了一份关于MCP的信息表,警告说采用速度已经超过了安全措施。我相信差距不在于协议——而在于它被部署的速度相对于周围的纪律。

MCP是为本地和受信任的网络使用而设计的,因此规范不需要身份验证。这是一个合理的决定,一旦服务器被放到公共互联网上而没有任何保护,就会变得严重。Censys开始 扫描暴露的MCP服务,在2026年4月24日,并且四天后,在8,758个唯一地址上发现了12,520个可达的服务。到5月6日,其数据集已经超过21,000。几乎没有一个是协议故障。几乎所有都是部署故障。

读者是门

这让我回到了玻璃。

阿娃从未触及外部世界。她通过唯一被允许读她的那个人——纳森,和为评估她而建造的通道,到达了外部世界。一个代理人在桌子上也有同样的形状。为了有用,它必须读取外部世界:市场评论,新闻源,交易对手的文件。它一旦这样做,指令和数据就会通过同一个管道,以同一种语言传递,句子中没有任何东西能告诉它哪一个是哪一个。

2026年一个名为StakeBench的基准测试 测量了前沿代理人如何抵抗这种攻击。直接提示注入成功的比例超过79%。间接攻击,隐藏在普通内容中,命中率在41%至68%之间。没有配置可以阻止它。模型自身的防护措施也无法拯救你,因为模型正是被说服的对象。这必须在模型之下处理,而不是在模型内部。

四小时

这里它不再是一个技术问题,而是一个许可问题。在 数字运营恢复法第19条中,一个公司将事件归类为重大事件时,有四个小时的时间来通知其主管机构。在任何情况下,通知必须在公司意识到事件的24小时内进行。

现在重新阅读Hugging Face的时间线。该活动在周末运行。它因为Hugging Face自己的异常检测将信号关联起来而浮现出来,并且因为公司在整个操作日志中部署了分析代理,所以在几个小时内被解析。最经纪人无法以这样的速度工作。大多数检测仍然默默地假设有人会在星期一注意到它。

在四小时的时钟下,在星期一发现它不仅是一个安全故障,也是一个可报告的故障。

需要坐在底下的东西

控制是没有魅力的,并且没有一个控制措施生活在模型内部。代理人获得僵化的模式,而不是宽容的接口。你给开发人员宽容,因为你信任他的判断——一个代理人会找到使用任何被留下的东西的方法,所以只暴露最少的东西。

阅读和执行属于不同的房间。这是电影中的一个观点,变成了现实。无论什么消耗不受信任的文本的东西都不应该是具有移动资金的权威的东西。把读者放在玻璃后面。

高风险的行动需要明确的人类批准。不应该是一个服务帐户,而是一个具有登录的个人。

每个MCP端点都经过身份验证,而未经身份验证的端点则从公共互联网中删除。Censys的数据表明,大多数运营商尚未实现这一点。

最后一个来自披露中最少讨论的部分。当Hugging Face去分析攻击时,托管的前沿模型拒绝了工作,因为真正的利用有效载荷对于安全过滤器来说看起来很像攻击。他们在自己的基础设施内使用开放权重模型运行了法医分析。攻击者不受任何使用政策的约束。防御者在最糟糕的时刻遇到了他们的政策。在需要之前先验证一个你可以运行的模型。

我过去曾经给客户回电的那个人,比我们将要部署的任何代理人都慢,我对此并不怀旧。但我们正在在同样的订单流程前面安装一些更快的东西,并且使用为一个六点钟回家的员工设计的控制来监督它。

纳森的错误不是建造阿娃,而是相信他测试她的房间将是她将要停留的房间。技术是值得拥有的。但是它下面的假设需要被替换,而证据不再是一个预测。

Richard ForssEXANTE 的首席技术官,该公司是一家全球性的首席经纪商,拥有 30 多年的经验,设计和扩展金融机构、对冲基金和金融科技公司的技术。