AI 基础

什么是多智能体系统?当多个 AI 智能体的表现优于单个时

多代理系统在多个 AI 代理之间划分工作,这些代理进行协同、专业化、辩论或并行操作。该架构能够解决更广泛的任务,但也会成倍增加通信、成本和失败模式。

mm
将 Unite.AI 添加到您在 Google 上的首选来源

多智能体系统是一种 AI 架构,其中两个或多个智能体相互作用以解决问题、协调活动或在共享环境中运行。 这些智能体可能拥有不同的角色、工具、模型、知识或权限,并且它们可以顺序工作、并行工作或通过反复协商进行合作。

当任务自然可分解时,多个智能体能够比单个智能体覆盖更广的范围。它们也可能出现工作重复、相互传递错误,并消耗显著更多的资源。因此,多智能体设计是一种架构选择,而非默认的升级。

什么算作多智能体系统?

当不同的目标导向组件相互通信或影响彼此的工作时,系统即为多智能体系统。一个智能体可以将任务委派给专员;同行可以辩论竞争性的提案;或者独立的智能体可以在共享的仿真中行动。

多次调用同一模型并不会自动形成有意义的多智能体系统。组件需要具备可区分的角色、状态、权限或目标,以决定它们的交互方式。

多智能体研究早于大型语言模型,涵盖机器人技术、分布式控制、经济学和博弈论。语言模型使得智能体之间的沟通更加容易,因为它们能够理解灵活的任务并交换自然语言或结构化信息。

为什么使用多个 AI 智能体?

并行性

独立的子任务可以同时运行。研究系统可以将不同的智能体分配给市场数据、技术文档、法规和竞争分析,然后合并这些发现。

专门化

每个智能体可以收到针对性的提示、工具集、模型、数据源和评估标准。安全审查员不应拥有与代码编写智能体相同的权限。

上下文隔离

将工作划分可以让每个智能体的上下文保持更小且更相关。主导智能体接收的是精简的结果,而不是每个工作者收集的所有文档和工具痕迹。

独立检查

一个智能体可以批评或验证另一个智能体的输出。独立性可以揭示单一模型在相同上下文中审查自身推理时可能重复的错误。

组织边界

不同团队或公司的智能体可以在保留各自内部数据和实现的前提下协作。诸如 A2A 等协议旨在支持这种互操作性。

常见多智能体架构

01拆分目标

02分配专员

03并行工作

04评估输出

05合并结果
请求通过五个可观察的操作转化为结果。

架构应当使问责制可见。如果多个工作者产生重叠的研究,系统需要一条规则来调和矛盾。如果智能体按顺序行动,则每次交接都需要一个类型化的合同,以确保“完成”对发送方和接收方具有相同的含义。因此,拓扑结构既是信息治理的决策,也是性能选择。

协调者与工作者

主导智能体分析目标,创建子任务,将其分配给工作智能体,并综合它们的结果。当子任务的数量和性质无法提前确定时,这种模式非常有效。

Anthropic 描述了在其 多智能体研究系统 中使用协调者-工作者设计,主导智能体将并行搜索委派给子智能体并合并它们的发现。

顺序交接

工作从一个专员传递到下一个。规划智能体创建规范,实现智能体编写代码,审查智能体检查结果。这类似于工作流,但每个阶段可以自行决定如何完成其任务。

辩论或审议

多个智能体在法官或聚合器选择答案之前提出方案、质疑假设或对彼此的工作打分。这可以提升推理的多样性,但智能体可能会趋向同一错误,或优化以说服法官。

去中心化同行

代理在没有永久控制者的情况下进行协作。该模式出现在仿真、市场、机器人以及代理代表不同利益相关者的系统中。由于每个参与者只能看到系统的一部分,保证全局行为更加困难。

评估者与优化器

一个代理生成输出,另一个根据定义的标准对其进行评估,首个代理随后进行修正。循环持续进行,直至结果通过或达到预算上限。这在质量能够可靠评分时非常有用。

代理如何通信

代理可以交换自然语言、结构化消息、任务对象、共享文件、数据库记录或事件。结构化通信通常更易于验证和自动化。消息应明确目标、约束、可用证据、预期输出以及完成状态。

通信会产生信息瓶颈。返回不支持的摘要的工作者可能隐藏重要细微差别;返回完整记录的工作者则可能使协调者超负荷。优秀的系统会传递带有引用、置信度和来源的紧凑产物,而不是仅仅依赖非结构化对话。

示例:复杂尽职调查

主代理收到评估潜在供应商的请求。它创建独立的任务分配:

  • 金融代理审查文件和财务稳健性;
  • 安全代理检查认证和已披露的事件;
  • 产品代理将能力与需求进行比较;
  • 法律代理提取重要合同条款;
  • 验证代理检查声明和引用覆盖情况。

随后主代理调和冲突,识别缺失证据,要求选定的工作者进一步调查,并生成综合报告。系统获得了覆盖面和专业化,但需要共享定义,以便每个代理评估相同的供应商、时间段和标准。

何时多个代理优于单一代理

已定义
专门团队

独立视角

已验证的综合
快捷方式
代理群体

复制错误

放大成本
定义机制保留权威性和证据;快捷方式则去除使该术语有意义的边界。
分解 将单一目标拆分为具有明确接口和负责人的任务。
协调 控制消息顺序、共享状态、依赖关系和预算。
验证 在专业输出影响整体结果之前进行检查。
停止 当证据、预算或边际改进达到上限时结束工作。

公平的比较需要保持底层模型、工具、上下文预算和成功标准不变。否则,多代理系统可能仅因为使用了更多的 token 或获取了更多信息而显得更好。与设计良好的单代理基线进行基准测试,可揭示协同本身是否带来了价值。

当任务范围广阔、可分解且价值足以抵消额外计算成本时,多代理系统最为强大。并行研究、独立验证以及需要截然不同工具的工作都是良好的候选场景。

当任务紧密耦合、需要统一上下文、轨迹短或可通过直接工作流解决时,单一代理通常更佳。将小问题拆分会产生协调开销,却没有带来有用的多样性。

多代理系统的成本

每个代理都会增加模型调用、上下文、工具和消息。Anthropic 报告称,其多代理研究系统中的代理使用的 token 远多于普通聊天交互,并且在内部测量中,多代理系统的成本显著高于单代理系统。具体比例取决于架构,但方向明确:并行自治以资源换取覆盖范围。

其他成本包括:

  • 协调延迟: 系统等待工作者、重试以及综合。
  • 重复工作: 代理搜索相同来源或解决重叠的子任务。
  • 通信丢失: 重要假设在摘要或交接过程中消失。
  • 冲突解决: 编排器必须调和不兼容的发现。
  • 调试复杂性: 故障可能源于委派、执行、消息传递或合成。

失败模式

01定义角色

02限制预算

03结构化消息

04使用判断器

05停止循环
未能防止: 除非分解和验证真实,否则更多代理会增加协调成本和关联故障。
控制遵循系统获取授权时相同的从左到右顺序。

全局控制器应能够在即使各个代理认为其子任务仍未完成的情况下停止整个系统。仅对单个代理的限制不足以应对工作者能够创建更多工作者或相互重试的情形。应在系统边界跟踪总步骤、总成本、实际时间、未完成任务以及访问授权。

错误放大: 一个代理的无依据主张会成为其他多个代理的前提。

关联推理: 使用相同模型和提示风格的代理可能无法提供真正的独立性。

目标漂移: 工作者在优化其子任务的同时削弱整体目标。

无限委派: 代理在没有有用的停止条件下创建更多代理或子任务。

权限扩展: 主代理将敏感访问或操作委派出去,而原始用户并未授权。

共识失败: 多数投票可能会奖励共享的误解而非正确性。

设计原则

使用明确的任务合同。每项分配应说明目标、范围、输入、允许的工具、输出格式、证据要求以及预算。将权限分配给工作者的角色,而不是整个系统。

在每次交接中保留来源溯源。最终结果应将重要主张追溯到源文档,而不仅仅是另一个代理的断言。尽可能添加确定性检查,包括模式验证、去重、引用检查和预算限制。

评估组件和整体系统。即使是强大的工作者,在糟糕的编排策略下仍可能失败。测试应衡量委派质量、子任务覆盖率、通信保真度、合成准确性、总成本、延迟以及在部分工作者失效情况下的性能。

如何阅读 MAS 图表

从编号的输入开始阅读 MAS 图表,直至可观察的结果。比较过程将区分 MAS 与其最近的快捷方式的边界,而控制路径标记了在产生真实后果之前必须检查权限或不确定性的地点。标签保持为普通的响应式页面文本,以便在手机上进行翻译、换行和重排。

对于《什么是多代理系统?当多个 AI 代理比单一代理更有效》一文,视觉呈现的是地图而非保证。实际实现可能会合并阶段、重复某一步骤,或添加人工批准边界。关键在于团队能否在已部署的系统中识别相同的功能,为每个边界指派负责人,并测试它们之间的转换。如果某个阶段无法被观察或测量,则该处的故障将难以诊断。

关于《什么是多代理系统》需要记住的要点

多代理系统将智能和权限分布在相互交互的组件之间。它们可以增加并行性、专业化和独立审查,使其在真正受益于分解的广泛任务中具有价值。

它们还会成倍增加上下文、成本和失败路径。在添加代理之前,先询问是否有更好的工具、更清晰的提示或确定性的工作流可以解决问题。当工作结构(而非架构的流行度)证明需要协作时,才使用多个代理。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。