思想领袖

他们承诺我们会有智能体,但我们只得到了静态链

mm
将 Unite.AI 添加到您在 Google 上的首选来源

2023年春天,世界对基于LLM的AI智能体的出现感到兴奋。像AutoGPTBabyAGI这样的强大演示展示了LLM在循环中运行的潜力,选择下一个动作,观察其结果,然后选择下一个动作,一步一步地进行(也称为ReACT框架)。这种新方法预计将为能够自主、通用地执行多步任务的智能体提供动力。只需给它一个目标和一套工具,它就会处理其余的事情。到2024年底,景观将充满AI智能体和AI智能体构建框架。但是,它们如何衡量这一承诺?

可以肯定地说,受原始ReACT框架驱动的智能体遭受着严重的限制。给他们一个需要多个步骤和多个工具的任务,他们就会惨败。除了他们明显的延迟问题外,他们还会失去跟踪,无法遵循指令,过早或过晚停止,并在每次尝试中产生截然不同的结果。而这并不奇怪。ReACT框架将不可预测的LLM的限制与步骤数量相结合。然而,智能体构建者旨在解决现实世界的用例,特别是在企业中,无法满足这种水平的性能。他们需要可靠、可预测和可解释的结果,用于复杂的多步骤工作流程。并且他们需要人工智能系统来减轻,而不是加剧,LLM的不可预测性。

那么,智能体如何在企业中构建?对于需要多个工具和多个步骤的用例(例如对话式RAG),今天智能体构建者已经基本上放弃了ReACT的动态和自主承诺,转向了静态链的方法——创建预定义的链来解决特定的用例。这种方法类似于传统的软件工程,远远不是ReACT的智能体承诺。它实现了更高的控制和可靠性,但缺乏自主性和灵活性。因此,解决方案需要大量开发,应用范围狭窄,太过僵化,无法应对输入空间和环境中的高变异性。

当然,静态链的做法可以在“静态”程度上有所不同。有些链仅使用LLM执行原子步骤(例如,提取信息、总结文本或草拟消息),而其他链也使用LLM在运行时动态做出一些决定(例如,LLM在链中路由或LLM验证步骤的结果以确定是否应再次运行)。无论如何,只要LLM负责解决中的任何动态决策,我们就会陷入可靠性和自主性之间的权衡。解决方案越静态,越可靠和可预测,但也越缺乏自主性,因此应用范围越窄,开发强度越大。解决方案越动态和自主,越通用和易于构建,但也越不可靠和不可预测。

这种权衡可以在以下图表中表示:

 

这引发了一个问题,为什么我们还没有看到一个可以放置在右上象限的智能体框架?我们是否注定要永远在可靠性和自主性之间进行权衡?我们不能获得一个既有ReACT智能体的简单接口(接受一个目标和一套工具,然后解决它),又不牺牲可靠性的框架吗?

答案是——我们可以,而且我们会!但为了实现这一点,我们需要意识到我们一直以来都做错了。所有当前的智能体构建框架都有一个共同的缺陷:它们依赖LLM作为动态和自主的组件。然而,我们缺乏的至关重要的元素——我们需要创建既自主又可靠的智能体的元素——是规划技术。并且LLM不是很好的规划者。

但是,什么是“规划”?通过“规划”,我们指的是显式建模可能导致期望结果的替代行动方案的能力,以及在预算约束下高效地探索和利用这些替代方案。规划应在宏观和微观层面进行。宏观规划将任务分解为依赖和独立步骤,这些步骤必须执行以实现期望结果。通常被忽视的是需要微观规划,以确保单步级别的期望结果。有许多可用的策略可以通过使用更多的推理时间计算来增加可靠性并在单步级别实现保证。例如,您可以多次对语义搜索查询进行改述,可以为每个查询检索更多上下文,可以使用更大的模型,并且可以从LLM中获得更多推理——所有这些都可以产生更多满足要求的结果,从而可以选择最好的结果。好的微规划器可以在给定的计算和延迟预算下高效地使用推理时间计算来实现最好的结果。通过根据手头任务的特定需求来扩大资源投资。这样,具有规划的AI系统可以减轻LLM的概率性质,以在步骤级别实现保证的结果。没有这样的保证,我们就会回到会破坏甚至最好的宏观规划的复合错误问题。

但是,为什么LLM不能作为规划者?毕竟,它们能够将高级指令转换为合理的思维链或用自然语言或代码定义的计划。原因是规划需要更多。规划需要能够建模可能合理地导致期望结果的替代行动方案,并推理每个替代方案的预期效用和预期成本(在计算和/或延迟方面)。虽然LLM可以生成可用行动方案的表示,但它们无法预测相应的预期效用和成本。例如,在特定上下文中使用模型X与模型Y来生成答案的预期效用和成本是什么?在索引文档集或CRM API调用中查找特定信息的预期效用是什么?您的LLM根本不知道。并且有充分的理由——这些概率特征的历史痕迹很少出现在野外,并且不包含在LLM的训练数据中。它们往往特定于AI系统将运行的特定工具和数据环境,而LLM可以获得的一般知识则不同。即使LLM可以预测预期效用和成本,推理它们以选择最有效的行动方案也是一个逻辑决策理论推导,不能假设LLM的下一个标记预测可以可靠地执行。

那么,AI规划技术缺失的成分是什么?我们需要能够从经验和模拟中学习的规划模型,以显式地建模特定任务和特定工具及数据环境中的替代行动方案和相应的效用和成本概率。我们需要一种计划定义语言(PDL),用于表示和推理这些行动方案和概率。我们需要一个可以确定和高效地执行用PDL定义的计划的执行引擎。

一些人已经在努力实现这一承诺。但是,在那之前,请继续构建静态链。只要不要把它们称为“智能体”。

安农于2017年加入AI21,并在公司中担任过各种产品领导角色。在加入AI21之前,他曾担任以色列区域倡议NGO的国际活动经理。安农在特拉维夫大学(劳特曼跨学科优秀学生项目)学习了法律、经济学、历史和哲学。他曾在以色列信号情报国家单位(8200)担任分队指挥官,并拥有两个法律硕士学位(LLM),分别来自特拉维夫大学和哈佛法学院。