思想领袖

AI 监督存在三个盲点——大多数公司都没有关注这些盲点

mm
将 Unite.AI 添加到您在 Google 上的首选来源

大多数公司内部关于 AI 安全性的讨论都是针对错误的目标。团队花费数周时间争论哪种模型应该使用,然后将该模型集成到他们的电子邮件、支付系统、客户数据库和代码中,没有停下来问一个更简单的问题:当这个东西做某事时,谁在监视它,谁能阻止它?

数字表明,这将很快变得昂贵。Gartner 预计,到 2028 年,至少 15% 的常规工作决策将由 AI 自主做出,高于 2024 年的几乎为零。在同一研究中,它警告说,超过 40% 的具有代理能力的 AI 项目将在 2027 年底被取消,其中一个原因是风险控制不力。再读一遍。这些项目并不是因为模型不良而失败的,它们是因为没有人建立了管理它们的方法。

我以建立 AI 治理系统为生,所以我一次又一次地看到相同的缺口。有三个缺口。大多数公司都没有正确地监视这些缺口,其中很多公司根本没有监视它们。

代理是响亮的那个

每个人都担心自主代理,他们有理由担心。但大多数人担心的部分是错误的。代理令人不安的方面不是它的推理能力,而是它的行动能力。它不仅仅是提出退款申请;它实际上会支付退款。它不仅仅是草拟电子邮件;它实际上会发送电子邮件。给模型一套工具,你就给了它改变现实系统的能力。

如果做错了,失败的后果不是一个笨拙的句子,而是钱白白浪费掉,或者数据库中的一张表被悄悄删除。还有一个更尖锐的方面:提示注入正是 OWASP 列出的 LLM 应用程序风险清单中的首要风险;因为如果你把错误的文本喂给模型,它可以被说服去做没有人要求它做的事情。当模型只能说话时,这只是一个麻烦;当模型可以调用工具时,这就相当于攻击者持有你的 API 密钥。

标准答案是记录代理做的一切事情,然后查看记录。好吧。但记录只是已经发生的事情的描述。它就像盗窃发生后查看 CCTV 监控录像,对调查很有用,但无法阻止盗窃。

没有人提到的安静的那个

第二个盲点从来没有出现在幻灯片上,因为它很枯燥。这只是一个普通的 API 调用。不是代理,也不是框架,只是一段代码在某个服务中组装提示并将其发送给模型。

生产环境中的大多数 AI 都是这样的,因为它太普通了,所以它是整个堆栈中管理最差的部分。它是服务中三层深处的一个 HTTP 请求,由一位从未听说过你 AI 政策的工程师编写的,他不知道在哪里找到它。这个调用可能会将客户数据发送给第三方模型,或者触发下游操作,但没有人检查它是否应该这样做,也没有独立的记录表明它实际上发生了什么。

人是最混乱的

第三个盲点是人,这也是最糟糕的。你的员工几个月前就发现,将任务粘贴到 ChatGPT 或 Claude 中可以更快地完成任务,所以他们整天都这样做,通常使用你无法看到的个人账户。这不是假设的。Cyberhaven 对真实工作场景的调查发现,真正有一部分员工将机密公司数据粘贴到 ChatGPT 中,很多都是通过公司无法监控的账户。

如果你想要一个警示故事,那就是三星。2023 年,三星内部禁止使用生成式 AI,因为工程师将专有源代码粘贴到 ChatGPT 中,三次发生在不到一个月的时间内。这些人不是恶意行为者,他们是试图更快地调试的好工程师。这就是陷阱:泄露看起来与提高生产力一模一样。你的旧数据丢失工具无法捕获它,因为它是复制粘贴到浏览器标签中,而不是文件离开大楼。

真正有效的方法

将这三个问题排列起来,解决方案就不再是针对代理,而是一个单一的想法:在 AI 做任何事情之前进行管理,而不是之后。以下是一些真正重要的经验,主要是通过艰难的方式学到的。

在行动之前进行监管。 这是整个游戏的关键,也是我一直坚持认为可观察性和治理不是同一个词的原因。一个告诉你代理昨天转移了 40,000 英镑的仪表板是一个损失报告。一个可以在转账离开之前让人审查的东西是一个控制。 如果你的设置只能告诉你已经发生了什么,你就没有监督。你只有事后诸葛亮。

使用一个检查点,而不是每个工具一个检查点。 代理、API 调用和员工将内容粘贴到聊天机器人中感觉像三个独立的问题,所以公司购买三个独立的工具,最终得到三个工具之间的空白。坏事就发生在这些空白中。无论 AI 的行为来自哪里,都应该通过相同的门槛。

保持一个 AI 无法篡改的日志。 如果执行操作的系统也是唯一记录该操作的系统,你就没有记录。你只有它被允许编辑的日记。这正是规则的走向。EU 的 AI 法案中有一个记录保存要求,第 12 条,目的是为了让人能够通过其他方式重现高风险系统的行为。在实践中,这意味着在被记录的系统之外保存一个日志,一个不能在事后悄悄修改的日志。

在重要的不可逆转的调用中添加人工审查。 并不是所有事情都需要这样做,如果这样做,人们会被审批淹没,直到他们对所有事情都点头。然而,无法逆转的调用,比如转移资金、导出数据、删除记录,应该停止并等待。EU 的 AI 法案已经要求高风险系统必须有人工监督,第 14 条。需要记住的陷阱是,监督只有在人有时间和背景来实际说不时才有效。没有人阅读的批准只是表演。

诚实的自我检查

这三个问题都不是边缘情况。它们是大多数公司当前运行 AI 的普通方式,悄悄地,没有多少保障。未来几年没有发生丑陋事件的团队不会是那些拥有最漂亮图表的团队。他们将是那些早早决定一切 AI 操作,无论是代理、API 调用还是粘贴的段落,都应该在发生之前经过一个门槛,而不是之后。

如果你想快速测试自己的设置,诚实地回答两个问题。三个表面中,你能看到多少个?你能看到的表面中,又有多少个你能阻止?对于很多公司来说,第二个问题的诚实答案是零。那才是需要先解决的数字。

苏吉·马修·约瑟夫(Soji Mathew Joseph)是TrustLoop的创始人和CEO,他在TrustLoop工作于AI的运行时治理和控制。他在高增长公司的技术和人力运营领域拥有超过15年的经验。