思想领袖

AI 代理可以完成工作。但企业能否运营它们?

mm
将 Unite.AI 添加到您在 Google 上的首选来源

AI 代理在完成任务方面变得异常出色。只要给代理一个目标、合适的工具、足够的上下文以及明确的工作流程,它就能进行信息检索、文档分析、做出决策、更新系统,并与其他代理协作。

这正是 Agentic AI 的令人兴奋之处,也是我们在演示中常见的部分。

企业运营的情况截然不同。贷款申请在承保过程中会发生变化。客户在验证完成后提供新信息。两个系统对同一账户的看法不一致。昨天有效的批准今天可能不再有效。代理在将案件交给另一个代理之前进行摘要,而一个看似微小的细节在此过程中消失。

顺畅路径可能只占代理需要完成工作量的 80%。企业则处于剩余的 20%。

80/20 的框架并非行业统计数据,而是一种描述运营复杂性隐藏位置的方式。企业运营的难点往往不在于常规情况,而在于例外、交接、依赖关系、不断变化的上下文,以及组织对结果仍负有责任的决策。

随着 AI 从回答问题转向执行操作,这种运营复杂性变得更加重要。企业需要超越对代理构建方式的思考,开始考虑如何运营它们。

这正是 Agentic Operations 开始的地方。

从生成答案到执行操作

企业生成式 AI 的第一波主要围绕信息展开。模型对文档进行摘要、生成报告、回答问题、搜索企业知识,并帮助员工更快完成已有任务。

代理引入了根本不同的概念。它们可以执行改变业务流程状态的操作。代理可以批准或拒绝某事、更新记录系统、发送客户沟通、触发其他工作流、调用其他代理,或做出决定以决定接下来会发生什么。

OpenAI 在其实用指南中描述了代理 作为独立代表用户完成任务的系统,使用模型管理工作流执行并利用工具与外部系统交互。错误答案的运营后果与错误操作的后果截然不同。

因此,企业层面的问题也随之改变。仅仅询问模型是否生成了良好答案或代理是否成功完成了分配任务已不再足够。企业日益需要了解在业务上下文、政策、权限以及之前发生的所有事项的前提下,某项操作是否本应发生。

图 1:生成式 AI 产生输出。Agentic AI 改变业务状态。

一旦 AI 能够改变业务状态并影响后续决策,可靠性就不能仅在模型层面进行衡量。

代理可以成功,而业务流程却失败

考虑一个由 AI 驱动的贷款承保工作流。一个代理提取申请文件,另一个验证收入,第三个评估信用信息,随后一个代理在承保代理做出或推荐决定之前对案件进行摘要。

每个代理都有明确的职责,并且能够正确履行该职责。文档代理可以提取正确的信息。收入验证代理可以成功完成其任务。摘要代理可以创建对可用信息的准确摘要。承保代理可以正确遵循其指令。

最终的业务决策仍可能是 错误的。

想象一下,更新后的收入信息在最初验证之后才到达。新文件被处理,但在下一步的摘要阶段其重要性被削弱。最终的承保代理收到的是一个合理的摘要,却没有整个流程中存在的完整业务上下文。

并未必出现崩溃。没有 API 失效。没有单个代理必然产生幻觉。每个组件可能都报告成功执行,而业务流程却得出了错误的结果。

Anthropic 在其关于构建有效代理的指南中讨论了相关挑战,指出随着系统执行更多步骤,自治系统可能会出现复合错误。问题超出了模型准确性,因为状态、上下文、决策和假设在工作流中传递。

这在 代理可靠性和业务流程可靠性 之间形成了重要的区别。企业最终感受到的并不是单个代理,而是完整流程产生的结果。

图 2:局部成功并不保证业务成功

这是 Agentic AI 引入的一个重要变化。即使每个组件在单独检查时看起来健康,工作流仍可能失败。

能力并非授权

当前的大多数代理堆栈自然地侧重于能力。团队想了解代理是否能够推理、选择正确的工具、完成任务、从错误中恢复,并在可接受的准确性和延迟范围内运行。

企业还有另一项要求:授权。

假设一个承保代理能够批准贷款。这并不意味着它应当批准它能够评估的每一笔贷款。它的授权可能取决于贷款金额、风险类别、客户类型、可用证据、置信水平、以往决定,或是申请在早前审查后是否发生了变化。

这在代理 能做 与代理 被允许做。

OpenAI 建议评估与代理工具相关的风险,并在敏感且不可逆的操作周围添加防护措施或人工干预。 Microsoft 在其针对代理运营核心业务流程的指南中采取了类似的方法,在这些流程中,代理可以在定义的边界内做出例行决策,而决策权决定哪些操作可以独立执行,哪些需要人工批准。

随着代理能力的提升,这一区别变得更加重要,而非不重要。更强大的代理可以执行更具影响力的操作。因此,企业需要更明确的方式来定义和强制执行这些操作被允许的边界。

问题从 代理能做这个吗? 转变为 在何种条件下应允许代理执行此操作?

业务政策必须更贴近执行

企业已经拥有广泛的机制来控制人工操作的流程。他们使用标准作业程序(SOP)、批准矩阵、合规政策、风险阈值、培训、职责分离、审计以及升级程序。这些机制大多基于一个简单假设:人员阅读规则,理解情境,并在工作中应用该规则。

代理改变了这一假设。

考虑一项要求对超过特定阈值的交易进行二次批准的政策。当人为执行任务时,该政策可以以文档形式存在,并得到培训和工作流控制的支持。当代理能够快速执行数百甚至数千个操作时,仅有该政策文档本身并不能阻止违反政策的行为。

在书面政策与业务行动之间的某处,政策需要转化为可操作的形式。

这并不意味着每项政策都必须转化为确定性的代码。有些控制将是确定性的,有些需要语义解释,有些取决于风险或置信度,其他仍需人工判断。更大的架构变化在于,业务政策开始更靠近执行路径。

AWS 在金融服务领域的 Agentic AI 场景中专门指出了这一点,包括对代理行为进行基于政策的验证以及对关键活动的审计追踪的需求。

历史上,组织可以在执行前定义许多治理要求,并通过审计和审查在事后验证合规性。当自主系统持续且以机器速度运行时,一些控制必须在流程运行时实时生效。

人为环节是必要的,但它并非运营模型

对 AI 工作流中不确定性的最常见响应是加入人为环节。这在涉及关键决策时是有道理的,但当人工审查被视为对每一次例外的答案时,就会出现问题。

想象一个代理化的运营在处理成千上万甚至数百万个决策。如果每个异常情况、低置信度结果、政策模糊或例外都被转交给人员处理,组织并未消除运营瓶颈,而是将瓶颈转移到审查队列。随着时间推移,这还会产生另一个问题:当人类被要求批准过多例行决策时,人工监督本身的意义也会下降。

人类仍然是关键,但其角色需要转变。与其审查每一个决策,他们应专注于真正需要判断的情形,即代理的授权已达上限,或系统遇到不应自行解决的情况。

因此,可扩展的运营模型不能仅依赖风险评分和人工审查。在代理行为转化为业务行为之前,系统需要考虑当前的业务环境、相关政策、代理的权限以及工作流中已发生的情况。结果可能是继续、请求额外证据、暂停该操作,或将决定升级给人工。

图 3:人工审查成为运行时控制的一个结果

这改变了人工监督的角色。默认情况下,人类不再被插入每一个不确定的步骤。当业务环境、政策、权限或行动的后果需要判断时,人工干预成为一种可能的结果。

这种区别对企业规模至关重要。某些操作应自动执行,因为它们显然在政策和权限范围内。某些操作应暂停,因为缺少必要的证据或业务状态已发生变化。其他操作应升级,因为决定已跨越组织有意保留给人的边界。

目标不是将人类从环路中移除。它是将人类放入正确的循环,同时让例行决策在明确定义的边界内进行。随着代理系统的规模扩大,人类监督的质量可能不再取决于人们审查的决策数量,而是取决于操作系统能否识别出真正需要人类判断的决策。

可观测性是必要的,但仅仅观察并不等于控制

业界在 AI 可观测性方面取得了显著进展。团队可以检查提示、模型响应、追踪、工具调用、延迟、令牌使用情况,并且越来越多地能够查看代理在产生结果之前所走的完整轨迹。

这种可见性至关重要。 OpenAI 关于代理安全性和评估的指南还强调了评估和追踪分级等技术,以了解代理行为。

但仅凭可见性并不能解决运营问题。

想象一下,发现一名承保代理上周违反批准政策 2,700 次。这将体现出极佳的可观测性,却是糟糕的运营。

对于关键业务流程,企业最终需要的不仅是了解代理行为的能力,还需要在流程运行时作出响应的能力。

图 4:运营控制循环

可观测性回答代理做了什么。Agentic Operations 还需要回答代理是否应继续。

当某个行动代价高昂、影响重大、难以逆转或能够影响众多下游决策时,这一区别尤为重要。

最严重的故障可能发生在代理之间

随着企业向多代理和更长运行时间的工作流转变,另一个挑战变得显现。许多业务政策并非局限于单一操作。

考虑一项限制一系列决策中总金融敞口的政策。每笔单独的交易可能低于允许阈值,而累计敞口却超过了阈值。若仅独立审视每个行动,将看不到违规。

同样的问题也可能出现在权限上。代理可能被授权收集信息,但不能作出最终决定。经过多次交接后,下游代理可能收到信息,却未保留原任务附带的权限限制。每个单独的步骤看似合理,却使整个序列违背了预期的业务流程。

上下文也会导致类似的问题。工作流第一阶段重要的信息在后续几个步骤中可能被汇总、转换或省略。下游代理无法对已不再拥有的信息进行推理,即使其推理本身是正确的。

这些失败表明,可靠性单元需要扩大。

我们将继续通过询问模型的响应是否正确来评估模型。我们将通过询问代理是否正确完成任务来评估代理。但在工作流层面,问题在于信息、权限和政策是否在一系列操作中得以保留。在业务层面,问题在于最终结果是否既正确又被允许。

这也与更广泛的生命周期视角相一致,即在 NIST AI 风险管理框架中强调对 AI 风险进行持续的测量和管理,而不是将评估视为部署前的一次性活动。

这正是 Agentic Operations 的起点

AI治理、模型评估、LLMOps、可观测性、安全性以及负责任的AI已经涵盖了运营AI系统的重要部分。Agentic Operations并不取代这些学科。它关注的是当自主和半自主系统开始直接参与业务流程时变得重要的运营层面。

Agentic Operations是将在真实业务流程中运营自主和半自主AI系统的学科,包括在执行过程中如何管理授权、上下文、决策、例外、人为干预和问责。

这一区别很重要,因为被管理的对象不再仅仅是模型。它是一个持续的业务流程,在其中软件可以独立做出决策并采取行动。

在实践中,这会产生一套不同的运营问题。代理被授权可以做什么?在长期运行的工作流中,必须保留哪些业务上下文?当新证据使先前的决策失效时会怎样?组织如何检测单个可接受的行为在整体上违反政策?代理何时应继续、暂停、停止或升级?数月后,组织能否重建为何做出特定决策的原因?

还有所有权的问题。当代理正确完成其技术任务但业务结果错误时,谁应承担失败的责任?将执行委托给代理并不等同于将组织的问责转移。

代理可以执行工作。企业仍然拥有结果。

目标是受控的自主性

Agentic AI的未来有时被描述为向完全自主的进化,在此过程中人类逐渐从业务工作流中消失。对大多数企业而言,这可能并非正确的目标。

更有用的目标是 受控的自主性。

如今许多AI辅助的流程遵循一种模式:代理提出行动建议,而人类作出最终决定。随着信心的提升,某些工作流将允许代理在定义的授权范围内做出决策,同时周边系统监督执行,人类处理例外。成熟的、低风险的工作流最终可能让代理独立决定并行动,而关键决策仍由监控并记录。

Fig 5 : 自主程度的提升

适当的边界会因流程而异。银行可能在文档分类上允许较大自主性,但在信贷决策上要求严格控制。保险公司可能自动化常规理赔,同时对异常证据组合进行升级。医疗机构可能让代理收集并汇总信息,而将关键决策保留给人类。

因此重要的问题并非代理能变得多自主,而是组织能够负责任地运营多少自主性。

这也改变了控制的角色。控制不一定是降低自主性的机制。若执行得当,它们可以让组织在更有信心的情况下扩展自主性。

运营代理可能比构建它们更困难

模型将持续改进。工具使用将提升。代理框架将进步。推理能力将提升,许多今天看似困难的问题最终会变成常规。

然而,更好的模型并不能消除业务政策、变化的上下文、例外、组织边界或问责制。在某些方面,更强的代理会使这些问题更加重要。一个无法自主行动的系统其运营权限有限。一个能够执行成千上万业务决策的系统则承担全然不同的责任。

这就是为何企业AI的下一阶段可能不取决于哪个组织部署了最多的代理,而是取决于哪些组织学会了如何运营它们。

前80%展示了代理能够工作。剩余的20%决定企业是否能信任它处理业务。

随着代理变得更强大,企业的关键问题可能会从 我们的代理能做什么转向更难的议题:

我们准备让它们在何种条件下做什么,以及如何知道这些条件何时变化?

这正是Agentic Operations的起点。

Rajesh Gupta 是一位 AI 产品与技术领袖,曾在 Apple 和 Qualcomm 任职,并且是第二次创业者。他在机器学习、企业 AI 和 Agentic AI 领域工作超过 15 年,目前正在构建 RunCtrl AI,专注于对代理业务运营的运行时控制。