思想领袖

AI 代理已经准备好行动,但大多数公司尚未准备好让它们行动。

mm
将 Unite.AI 添加到您在 Google 上的首选来源

在大多数生成式 AI 时代,我们一直关注模型的输出以及我们输入的内容。我们检查提示、过滤响应、对模型进行红队测试,并围绕输入和输出构建控制。这些防护仍然重要,但它们是为 AI 主要为人类提供内容的世界而设计的。

代理改变了这一等式。它们不仅仅是消费或生成信息,而是会采取行动。

代理可以执行工具、调用子代理、与其他代理协作、调用 API、访问数据、使用凭证、调用 MCP 服务器、生成并执行代码,并在追求目标的过程中自主做出一系列决策。这是一种不懈的追求。一旦出现这种情况,核心问题不再仅仅是模型是否给出了安全的响应,而是它所采取的行动是否安全可执行。

OpenAI 最近的披露使这一区别变得日益重要。OpenAI 已经开始 系统性地报告意外或令人担忧的模型行为,同时其更广泛的安全工作越来越多地针对模型获得更大自主权和工具访问权时出现的风险。

教训并不是代理本质上不安全,而是安全边界已经转移。

具备代理能力的系统需要不同的运营模型

具备代理能力的 AI 并非仅仅是另一种应用架构。软件本身正日益决定工作如何完成。

代理可能遇到障碍,解释发生的情况并选择另一条路径。它可以以事先未明确设计的方式组合工具。它能够生成代码并在同一工作流中执行该代码。每次代理运行时,动作序列可能都会改变。

与此同时,创建这些软件的人群正在急剧扩大。正如我们已经 撰写了关于公民开发者崛起的文章,AI 正在把从未自认是开发者的人转变为软件创作者。营销人员、金融分析师或运营负责人现在可以描述他们的需求,并创建能够与真实业务系统交互的代理。

这标志着能够构建软件的人群以及软件功能的前所未有的扩展。这也意味着组织将拥有更多在业务各个部门运行的自主软件。

答案不能仅仅是将过去的控制措施套用于这个新环境。如果企业无法安全地运行这些系统,替代方案将是对其加以限制,最终减缓它们试图实现的生产力提升。

控制必须存在于代理行动的地方

随着 AI 越来越自主,挑战从控制输入模型的内容转向控制其决策转化为行动时的结果。

代理可能以已批准的用户、可接受的提示、合法的凭证以及对工具的授权访问开始。但这些并不保证每个后续动作都应被执行。

这正是运行时变得关键的地方。组织需要了解的不仅是代理的身份,还要询问它当前正在做什么:

  • 它正在调用哪些工具,
  • 它正在访问哪些资源,尝试执行什么代码,
  • 正在发生哪些子代理和其他代理通信,
  • 该动作之前立即发生了什么,以及其行为是否仍在可接受的范围内,
  • 在运行时,代理在底层实际执行了什么。

当它未遵守时,系统需要能够在执行前实时介入的能力。

这是一个重要的区别。可观测性告诉你发生了什么。 运行时控制让你能够遏制代理的执行层。

这变得尤为重要,因为代理行为既是非确定性的,又是多维度的。被阻止的操作会导致代理尝试另一种实现目标的方式。看似无害的工具调用可能因其前置操作而变得风险。仅仅观察或“检测并响应”已经为时已晚,无法真正控制代理的访问和执行。

运行时需要内联且同步,以跟上 AI 的速度。采用此类方法的根本挑战在于仍然依赖于 AI 时代之前的思维,即需要更长时间的分析和检测方法。这些原则在当今已不再适用。

运行时安全需要上下文,而不仅仅是控制

在应对新兴 AI 风险时,人们倾向于降低自主性:为代理授予更少的权限、更频繁地要求人工批准,或限制其运行环境。这些控制在某些情况下是适当的,尤其是针对高风险操作时。

但它们不能成为长期的运营模式。

如果每一个有意义的决策都必须由人工批准,我们就削减了自主代理的大部分价值。依赖严格的人机交互,我们把一些最有才干的人员变成了“按钮推手”。这直接影响了对代理组织所运行的代码库范围及其相互依赖关系的理解能力。

代理 AI 的经济前景正是源于让软件能够独立且持续地完成有意义的工作——全天候 24/7。因此目标不应是消除自主性,而是让更高的自主性安全可运行。

这需要在代理自身推理过程之外的独立控制。Anthropic 对代理失调,在有意构建的模拟中进行的研究,说明了这一点的重要性。随着系统变得更加自主,其行为可能会偏离运营者的预期,即使原始目标看似明确。

实际含义很直接:组织不能仅仅依赖于了解代理被要求做什么。他们需要了解并控制其实际行为。

代理已不再是难点

业界已经投入巨大的精力提升代理的能力。我们正快速逼近这样一个阶段:能力不再是企业采用的主要限制因素。

约束在于控制。

随着代理变得更自主,其行为后果也随之增大——为可预测软件设计的控制措施变得不再有效。企业需要持续了解代理的行动,获取理解这些行动意义的上下文,并具备在不让人工介入每个决策的情况下进行干预的能力。

这改变了软件运营的意义。

  • 开发者需要了解代理的真实行为,而不仅仅是其设计行为。
  • 平台和安全团队需要建立在代理跨系统、跨工具行动时仍可强制执行的边界。
  • 业务领袖需要确信更高的自主性并不意味着放弃控制。

这与保护其他应用或治理其他模型根本不同。我们正在向企业环境中引入自主主体:能够推理、决策并采取行动的系统。如果组织无法在行动发生时看到并控制这些行为,最终将不得不限制代理的可做之事,从而削减自主性本应带来的大部分价值。

答案并不是假设我们能够防止所有错误决策。随着系统变得更加自主且非确定性,这一点越来越难以保证。

目标是确保错误或破坏性行为不会导致不良后果。

这需要在代理周围建立一个新的运营层:能够持续观察行为、在上下文中理解行动、在整个代理运行时堆栈中执行边界约束,并在意外或不可接受的行为转化为不可逆后果之前进行干预。

企业 AI 的下一阶段不会仅由代理的能力决定,而是由组织能够安全赋予的自主程度决定。

Harold Byun 是 BlueRock 的首席执行官,他专注于 AI 原生和代理系统带来的新兴运营挑战。他的工作重点是帮助组织通过提升对代理、MCP 服务器、编排层、工具以及下游执行环境的可视性、运行时理解和控制,来实现自主基础设施的运营化。

Harold 在其职业生涯中一直活跃于网络安全、基础设施和企业技术市场,专注于扩展运营复杂的平台,并帮助组织适应重大的架构变革。