访谈

李博,Virtue AI 首席执行官 – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

李博,Virtue AI 首席执行官,是一位著名的安全和人工智能系统安全研究人员和企业家。她同时也是伊利诺伊大学厄巴纳-香槟分校的教授,她的研究重点是机器学习安全、可信任人工智能和对抗性鲁棒性。她的职业生涯跨越了学术和工业界,使她能够将先进的人工智能研究转化为实用的应用,以帮助组织建立更安全和更具弹性的人工智能技术。

Virtue AI是一家专注于保护和管理企业环境中使用的人工智能系统的公司。其平台提供自动化红队测试、实时防护和持续监控等功能,以识别诸如提示注入、幻觉和数据泄露等漏洞。通过直接集成到人工智能开发和部署工作流中,该公司帮助组织安全地扩大大型语言模型和人工智能应用的使用,同时保持强大的安全性和治理标准。

是什么激发了您从纯粹的学术生涯转变为创立和领导 Virtue AI,并且您认为行业在什么方面未能解决大规模问题?

传统的安全工具是为可预测的应用程序和固定路径而设计的。它们从来没有为能够推理、适应和自主行动的系统而设计。我的联合创始人和我看到了一条连接基础人工智能安全研究和企业实际可用工具之间的差距。研究已经存在,但生产现实并非如此。这就是我们想要改变的。

Virtue AI 专注于大型语言模型和自主代理的安全、安全和合规。您认为企业今天最低估的领域是什么?

企业在某种程度上理解所有这些领域,特别是安全,但仍然存在很大的差距。

企业已经开始认真对待模型安全,至少在表面上如此。但是代理是一个不同的问题。他们被授予访问企业基础设施最敏感部分的权限:执行代码、调用 API、浏览网页,并做出涉及数据、财务和运营的连锁决策。大多数安全团队不具备推理这种系统的能力。他们拥有的工具不是为此而设计的。

风险并非理论上的。没有专门为代理系统设计的安全性,微小的故障会迅速累积。一个意外的工具调用、一个模糊的指令、一个绕过防护的提示——任何这些都可能在有人注意到问题之前升级为未经授权的操作或数据泄露。

持续红队测试是 Virtue AI 方法的核心。什么类型的故障或风险通常只在系统上线后才会出现?

大多数严重的问题。

在受控环境中,您正在测试模型和代理。在生产中,您正在测试系统——而这两者是不同的。在模型连接到工具、检索管道、用户输入和其他代理后,其行为空间会以预部署测试无法捕捉的方式扩展。一个“安全配置”的代理在连接到真实数据库、新的 MCP 服务器或其他代理时可能会表现出非常不同的行为。系统变得非确定性。它开始根据在评估期间不存在的上下文做出决策。

这就是你会发现真正重要的故障的地方。

您如何看待在实践中衡量“人工智能安全”,特别是在系统通过微调、检索和工具使用而不断演化的情况下?

在实践中,人工智能安全不能通过单个静态基准来衡量,因为现代人工智能系统会通过微调、检索增强和工具或代理交互而不断演化。相反,安全性需要被评估为整个人工智能应用生命周期中的一个系统级属性。这包括使用多样化的红队测试攻击来进行压力测试模型和代理,监控实时行为(例如提示、工具调用和操作),并根据定义的风险策略(例如滥用、幻觉、数据泄露或未经授权的操作)来评估结果。

例如,我们的获奖论文(国家安全局和 NeurIPS 最佳论文),DecodingTrust,为基础模型提供了全面安全和安全性测试。我们的 DecodingTrust-Agent 平台建立了一个现实的代理模拟器,托管了多样化的环境和本地红队代理,以执行动态、适应性和持续的红队测试。

重要的是,安全性测量必须是连续和适应性的,因为对提示、检索源或工具的更新可能会引入新的漏洞。在实践中,这意味着将自动化红队测试、运行时防护和可观察性相结合,以测量不仅模型响应,还有实际运行的端到端人工智能系统的安全性。

您的研究背景跨越了鲁棒性、隐私和对抗性攻击。哪一个领域被证明是将其转化为实际防御最困难的?

将鲁棒性、隐私和对抗性攻击的研究转化为实际防御实际上是可行的。事实上,我们小组的许多研究方向都是直接由部署人工智能系统中观察到的实际安全挑战所启发的。真正的困难不在于构建防御,而在于在动态的现实世界环境中提供可靠的安全保证。

在学术研究中,我们的团队在认证鲁棒性和隐私保证方面取得了显著进展,但这些结果通常依赖于可能不完全适用于复杂生产系统的假设。现代人工智能应用程序会通过新数据、微调、检索管道和工具集成不断演化,这可能会随着时间的推移引入新的漏洞。

什么使得保护自主人工智能代理与保护传统软件或甚至聊天机器人根本不同?

代理不是静态程序。它们不遵循可预测的路径,也不会在部署时保持在您为它们绘制的范围内。

传统安全性假设固定执行路径、稳定的 API 和确定性行为。自主代理违反了所有这些假设。它们推理下一步该做什么,根据上下文选择工具,并在单次运行中跨多个系统产生影响。

您不能扫描一个提示、加固一个模型或监控一个 API 调用并认为工作已经完成。您必须作为一个完整的系统来保护代理:其推理、其工具使用、其环境和其下游发生的事情。

现有的安全工具在代理可以同时跨多个系统、工具和数据源进行操作时,存在哪些不足?

它们让您对代理实际的端到端操作视而不见。

大多数工具都是为具有明确边界和稳定行为的应用程序而设计的。它们可以告诉您单个 API 调用的情况。但它们无法告诉您代理如何推理其方式通过五个工具调用来产生预期结果。

实时防护如何与仅监控或日志记录相比,减少风险?

日志记录会告诉您在损害已经造成之后发生了什么。它对法医和合规性有用,但它不会阻止任何事情。

对于自主代理,操作和检测之间的延迟可能会真正产生代价。已经执行了一个坏的 API 调用或泄露了数据的代理不会等待您的日志记录管道跟上。

实时防护在执行之前拦截操作。如果代理尝试执行不符合策略的操作,它会在运行之前被阻止或标记,而不是在运行之后。

Virtue AI 由深入的技术研究人员创立。这种背景如何影响产品决策与更商业驱动的 AI 初创公司相比?

人工智能安全和治理本质上是一个深层次的技术问题。我们要保护的系统——例如大型语言模型、多模态模型和代理系统——本身就是建立在先进研究之上的。没有强大的基础人工智能专业知识,几乎不可能为它们设计出有效的安全解决方案。

企业在首次接触 Virtue AI 时对人工智能安全最常见的误解是什么?

企业在首次接触 Virtue AI 时最常见的误解之一是,人工智能安全可以仅通过应用传统的网络安全工具或基本的内容过滤器来解决。

最后,“负责任的人工智能部署”对您来说在实践中意味着什么——不仅仅是理论,而是在今天交付产品的企业中?

更快和更安全并不是相互对立的,尽管大多数企业都这样对待它们。假设是严格的安全会减慢速度——更多的审查周期、更多的门槛、在产品发布之前的更多摩擦。

在实践中,能够自信地部署代理的企业是那些将安全性融入流程而不是在最后添加的企业:部署前自动化红队测试、代理上线后的实时控制以及整个代理生命周期的集中可见性。

这不是一个合规性练习。这是真正让您能够快速移动的东西,因为您不会在生产中发现应该早些时候就捕获的东西。

负责任的部署,从具体来说,就是您知道代理可以做什么,您可以看到它们正在做什么,并且可以在出现问题时停止它们。

负责任的人工智能开发使得大规模人工智能系统的部署可以带来信心,而不是减慢人工智能创新。

感谢这次精彩的采访,希望了解更多的读者可以访问 Virtue AI。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。