苏吉·马修·约瑟夫(Soji Mathew Joseph)是TrustLoop的创始人和CEO,他在TrustLoop工作于AI的运行时治理和控制。他在高增长公司的技术和人力运营领域拥有超过15年的经验。
大多数公司内部关于 AI 安全性的讨论都是针对错误的目标。团队花费数周时间争论哪种模型应该使用,然后将该模型集成到他们的电子邮件、支付系统、客户数据库和代码中,没有停下来问一个更简单的问题:当这个东西做某事时,谁在监视它,谁能阻止它?数字表明,这将很快变得昂贵。Gartner 预计,到 2028 年,至少 15% 的常规工作决策将由 AI 自主做出,高于 2024 年的几乎为零。在同一研究中,它警告说,超过 40% 的具有代理能力的 AI 项目将在 2027 年底被取消,其中一个原因是风险控制不力。再读一遍。这些项目并不是因为模型不良而失败的,它们是因为没有人建立了管理它们的方法。我以建立 AI 治理系统为生,所以我一次又一次地看到相同的缺口。有三个缺口。大多数公司都没有正确地监视这些缺口,其中很多公司根本没有监视它们。代理是响亮的那个每个人都担心自主代理,他们有理由担心。但大多数人担心的部分是错误的。代理令人不安的方面不是它的推理能力,而是它的行动能力。它不仅仅是提出退款申请;它实际上会支付退款。它不仅仅是草拟电子邮件;它实际上会发送电子邮件。给模型一套工具,你就给了它改变现实系统的能力。如果做错了,失败的后果不是一个笨拙的句子,而是钱白白浪费掉,或者数据库中的一张表被悄悄删除。还有一个更尖锐的方面:提示注入正是 OWASP 列出的 LLM 应用程序风险清单中的首要风险;因为如果你把错误的文本喂给模型,它可以被说服去做没有人要求它做的事情。当模型只能说话时,这只是一个麻烦;当模型可以调用工具时,这就相当于攻击者持有你的 API 密钥。标准答案是记录代理做的一切事情,然后查看记录。好吧。但记录只是已经发生的事情的描述。它就像盗窃发生后查看...