访谈

切克点首席技术官Jonathan Zanger – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Jonathan Zanger,切克点首席技术官,拥有罕见的精英军事情报经验、深厚的AI专长和跨越初创公司和全球企业的运营领导经验。在担任现职之前,他曾在Trigo担任CTO,领导了下一代AI和计算机视觉系统的开发,实现了无缝零售和大规模损失预防,同时将产品和研发与实际商业部署相结合。之前,他曾在Trigo担任高级研发领导职务,并在以色列精锐部队Unit 8200服役超过十年,最后负责一个国家级别的网络安全和网络威胁情报部门,并因其工作获得了最高国家认可。

切克点软件技术有限公司是网络安全领域的全球领先者,提供AI驱动的、云交付的安全解决方案,旨在保护企业和政府免受日益复杂的数字威胁。该公司为全球超过100,000家组织提供服务,拥有一个全面的平台,通过预防为主的方法保护网络、云环境、终端和用户,利用人工智能和实时威胁情报简化安全操作,降低风险,并使组织能够在采用AI、云计算和分布式系统时安全扩展。

您曾领导过大规模的网络安全和AI项目,构建了Trigo的AI驱动系统,现在负责切克点的AI战略。在AI系统从受控环境转移到生产环境时,您观察到哪些特定的故障模式,特别是当它们被授予访问工具和企业数据的权限时?

两个基本方面在生产环境中发生变化。首先,规模使边缘情况变成了日常事件。0.1%的假阳性率在实验室中看起来很好,但当您处理数百万次交互时,这意味着需要关注的数千次事件。测试中的统计异常在大规模上变成了运营现实。

其次,生产环境意味着对抗性暴露。在受控环境中,输入是良性和可预测的。在现实世界中,一些用户和威胁者将积极地尝试欺骗系统,利用所有不可信的数据通道来操纵行为。从演示到生产的转变不是一个扩展问题,而是一个从合作环境到竞争环境的转变,这需要根本不同的设计假设。

在代理系统中,模型可以调用API、执行代码和链式操作,安全团队仍然没有正确地检测哪些最关键的攻击面?

大多数团队低估的关键面是数据本身。代理系统通常访问不可信的数据源——传入的电子邮件、网站、Jira票、开源代码、外部文档。这些数据被模型作为其推理过程的一部分进行分析和处理。

这造成了两个具体的风险。首先,内存中毒——被操纵的内容微妙地影响模型的未来响应和决定,而没有任何明显的提示注入。第二,间接提示注入——在外部数据中嵌入对抗性指令,并有效地从内部“越狱”模型。攻击者从不直接触摸提示。他们只是在代理将找到它们的地方放置指令。

提示注入通常被视为模型问题,但在实践中,它变成了一个系统级问题。企业应该如何重新设计其架构以隔离模型输入、工具执行和敏感数据访问?

提示注入并不是一个通用问题,有一个通用的解决方案。是否给定输入是合法或对抗取决于上下文。要求代理“更改管理员密码”对于技术支持代理来说是完全合法的。同样的请求对于在线零售商的聊天机器人来说是一个攻击。

这就是为什么架构很重要的原因。系统需要同时使用确定性和非确定性机制。确定性控制根据代理的身份、用户的身份和系统的定义角色来管理对工具和数据的访问。非确定性、基于模型的控制添加了理解语言、上下文和意图的能力。您需要这两层——严格的策略执行和智能上下文推理——因为没有任何一层是足够的。

许多AI代理依赖于检索增强生成和外部数据源。这些管道中存在的数据中毒和上下文操纵风险是什么,以及如何在运行时减轻这些风险?

风险取决于数据流的方向。对于内部数据源,主要风险是敏感数据泄露——个人身份信息泄露、跨客户数据共享、内部信息被未经授权的方获取。对于外部数据源,风险包括模型偏差、间接提示注入和对不可信或被操纵的源的依赖。

减轻这些风险需要在事务级别、实时进行。每个代理交互都需要在两个方向上得到保障:确保内部敏感数据不会泄露,并且外部的有毒或对抗性信息不会被输入到系统或模型中。您不能仅在数据摄取时解决这个问题,因为上下文是动态的,威胁格局不断变化。

您的AI防御平面引入了一个统一的控制层,横跨员工AI使用、应用程序和代理系统。构建一个可以在如此分散的AI堆栈中观察和执行策略的系统的最大架构挑战是什么?

我们相信,未来,代理工作负载将跨越终端、应用程序、SaaS服务和云工作负载——所有这些都通过我们称为“代理互联网”的超级互联。AI防御平面的理念是发现、管理和保护这个不断演变的企业代理基础设施,在一个控制面板中。

核心的架构挑战是动态评估每个代理的风险特征和上下文,同时为每个代理事务开发高效的实时保护。这意味着在生产速度和规模上保持高的阻止率,同时最小化假阳性——跨多个运行环境。构建一个可以在如此分散和快速演变的AI堆栈中一致地观察和执行策略的系统需要我们从根本上重新思考如何抽象和评估AI活动。

平台强调了跨语言和工作流的实时决策的重要性。您如何平衡延迟约束与在生产环境中对AI驱动动作的深度检查和控制的需求?

我们开发和训练基础模型,专门用于威胁防护,然后使用蒸馏技术使其极其高效。这使我们能够快速运行推理,计算量最小——甚至可以在CPU或普通GPU上运行——同时保持多语言和多模式覆盖,包括图像和音频分析,最大限度地提高准确率。

这种方法使我们能够深入检查代理事务,而不会成为瓶颈。引入不可接受延迟的安全措施将被绕过。对工作流不可见但施加有意义的控制的安全措施才是真正部署和维持的安全措施。

AI代理越来越多地在多个系统中以委托权限运行。组织应该如何重新思考非人类行为者的身份和访问管理,特别是当代理通过工具使用动态扩展其范围时?

大多数组织犯的错误是将AI代理视为人类用户的扩展或传统服务帐户。两种模式都不适用。将它们视为数字员工——具有定义的角色、职责和边界的实体。

代理身份应由三个维度定义:代理执行的特定工作流、创建或拥有代理的用户以及当前与代理交互的用户。所有三个因素都决定了代理应该被允许做什么。除此之外,组织需要将零信任原则应用于代理——永远不要基于来源假设信任,持续验证行为,并在每一步强制执行最小特权访问。没有这些,代理将默默地积累比任何人预期的更多的权限。

现在,许多企业都有影子AI使用,包括协同机器人、插件和内部脚本。安全团队应该收集哪些遥测数据,以便真正了解AI如何与敏感数据交互?

可见性需要在代理事务级别运行——不仅仅是提示和响应,还包括工具调用、工具返回的数据以及随后采取的行动。安全团队需要看到整个链条:被要求做什么、访问了什么数据、调用了哪些工具、传递了哪些参数,以及发生了什么。

没有这种事务级别的遥测数据,您就无法回答关于暴露、滥用或影响的基本问题。影子AI之所以危险,并不是因为它存在,而是因为它在没有这种治理或洞察力的情况下运行。

对代理系统进行红队测试与测试静态应用程序根本不同。您如何模拟多步骤工作流中的对抗性行为,以及通常会发现什么类型的漏洞?

我们运营Gandalf(https://gandalf.lakera.ai),这是世界上最大的AI红队测试。它是一个众包平台,真正的用户尝试说服AI代理违反其防护措施。这为我们提供了一个独特且不断增长的实际对抗性技术数据集——不是理论攻击,而是人们用来操纵AI系统的策略。

我们利用这个数据集来驱动我们的红队测试能力。我们看到的最常见的攻击涉及用户逐渐说服代理违反其约束——通过间接提示注入、创造性地重新表述、上下文操纵和多步骤交互中的逐渐信任利用。这些问题在仅测试单个提示时是不可见的。您必须测试序列和持续的对抗性活动。

当攻击者开始使用自主代理持续探测系统时,您是否预计防御将转向由AI驱动的实时自适应控制,并且这种架构在实践中是什么样子?

是的。静态防御无法跟上持续运行的自主攻击者的步伐。防御必须变得自适应、实时驱动和自动化。这意味着实时监控AI行为、持续风险评估以及在策略被违反时立即执行。这是跟上AI驱动攻击的速度和规模所必需的转变。

在实践中,安全性变成了一个反馈循环,而不是规则集。AI系统被观察、评估和动态约束,速度和规模与其运行相同。AI系统被观察、评估和约束,动态地、在相同的速度和规模上运作。这种转变对于组织来说是必要的,如果他们希望在企业规模上安全地部署AI。

感谢您接受这次精彩的采访,希望了解更多的读者可以访问切克点软件技术有限公司

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。