思想领袖
可靠性是 Agentic AI 的真正考验

在过去的两年里,业界一直在问一个问题:AI 代理是否足够胜任真实工作?我们可以停止提问。我们知道它们可以,但必须高度关注能否识别出代理即将犯下代价高昂的错误——以及能否在错误发生之前将其阻止。
生产中的最严重故障通常并不像一次干净的模型错误。代理可以成功完成每个 API 调用,却仍然基于过时的上下文工作,重试出现故障的工具,或朝着违反规则的操作前进。可靠性决定了 Agentic AI 项目是否能够走出试点阶段。
根据《2025年AI现状:代理、创新与转型》中的McKinsey调查,62%的组织正在尝试AI代理,但只有约10%在这些功能中实现规模化。向同事展示代理能够工作很容易。安全地运行代理,跨越真实数据和连接系统,却并非易事。
为什么 Agentic AI 会加剧风险
代理结合了概率推理、工具使用以及一定程度的自主性。虽然这使它们很有用,但也使公司面临的错误比传统应用更快累积。
上下文
代理只能基于提供的上下文工作。因此,如果该上下文不完整、过时或有误,早期的错误解释会贯穿到每个后续步骤。错误的聊天机器人回复令人恼火。错误的解释若更改了访问权限或触及基础设施,则构成事件。重要的是要了解代理是否使用了正确的证据、遵循了政策,并在出现问题时保持在可接受的影响范围内。
知识库
代理还会接入知识库、工单系统和支付平台;每一次连接都会扩大攻击面。代理可能调用错误的工具、以错误的顺序调用正确的工具,或执行检索内容中隐藏的指令。这些都是已知的失效模式,包括凭空捏造以及因代理串联工具和上下文的过程而产生的安全漏洞。
绿色仪表盘可能会误导你:基础设施看似正常,而代理却在悄悄一次又一次地查询同一工具。这是漂移的早期信号,而非普通的停机。
非确定性
非确定性同样使事件响应更加困难。传统的服务故障通常可以通过请求 ID 和已知的软件版本复现。代理的运行取决于模型版本、检索的文档、获得的工具输出以及一系列中间决策。如果没有记录代理收到的内容和尝试的操作,根因分析和治理都会变得更加困难。
成本与延迟
成本与延迟从另一个角度讲述相同的故事。令牌使用量或重试次数的突然激增可能表明计划不佳或出现循环,即使用户最终得到答案。推理成本已大幅下降 在过去的几年里,成本更低的推理使得人们更容易忽视低效行为,直至该行为在数千个工作流中重复出现。将成本、延迟和重试视为可靠性信号——而不仅仅是财务指标。
去中心化 AI 仍需要集中式可视性
去中心化在缺乏明确防护措施时会失败。将工作流和升级所有权交给前线团队,但在企业层面保持身份、访问和事件响应。财务团队能够区分合法的发票异常和不当的付款决策,而通用基准永远无法做到这一点。在同一项调查中,McKinsey 发现,报告真实 AI 影响的组织,其重新设计工作流的可能性几乎是其他组织的三倍,而不是在已有系统上直接叠加 AI。
话虽如此,权衡是真实存在的:当事件跨系统时,所有权会迅速变得模糊。解决方案是对每个代理、其工具、数据访问以及事件历史进行共享的运营视图。
分布式架构使得在出现故障时容易失去全局视图。许多团队可以看到令牌使用量和成本,但无法判断代理是否安全地实现了预期结果。当工作流中的记录分散在不同位置时,团队往往追逐症状而非根本原因。
标准化的遥测信号,如模型标识和工具调用,可提供帮助。行为基线,例如工作流中正常的步骤数量,也是识别卡顿系统中有用持久性的必要条件。评估不是上线前的一次性门槛,而是一个持续循环。
可靠 AI 在生产中的真实表现
可靠的 AI 关注的是管理错误,而不是避免错误。团队需要对行为有可见性;在性能偏离时发出警报;并制定当出现问题时的遏制计划。最重要的是,每个代理都需要围绕访问和自主行动的明确防护栏。它们还需要人工批准。
从可逆的低风险操作开始。将关键操作,如生产变更和金融交易,置于真实控制之下。关键工作流应能够事后重建,包括代理检索的上下文、调用的工具、获得的批准,以及结果是否真正正确。
传统的服务水平目标也需要扩展以覆盖代理的质量和安全;它们包括经验证的任务成功率、政策合规率、人工升级率、每个成功任务的成本,以及不良结果发生的频率。阈值应根据使用场景而变化。内部知识助理可以容忍的错误特征与处理受监管数据的代理不同。
最有用的可靠性系统能够识别通常在故障前出现的条件,例如重试次数异常跳升或历史上导致人工干预的路径。低风险工作流可以触发自动修复。高风险工作流则应暂停并将决策转交给授权人员。目标并非为了自主行动本身。目标是在证据支持时实现更快、更安全的行动。
AI SRE 闭环
这正是 AI SRE 发挥作用的地方。AI SRE 代理可以组装事故时间线,将当前行为与过去事故进行对比,并准备推荐的行动,同时组织对可逆任务保持受控的补救,对任何关键事项则需要人工批准。
AI 采纳速度正在加快。但采纳并不等同于运营成熟度。成功规模化代理 AI 的企业不一定是单独运行最强模型的公司。它们是能够观察代理在整个业务中的行为、捕捉漂移早期迹象,并在小错误演变为客户、安保或合规事件之前介入的企业。
这正是 AI SRE 所承担的角色:将去中心化创新与中心化可视性相连接,并将代理 AI 打造成企业可信赖的系统。












