思想领袖
解码大型语言模型(LLM)在生成式人工智能中代理的机会和挑战

我们正在看到由大型语言模型(LLM)驱动的生成式人工智能应用的进展,从提示到增强检索生成(RAG)到代理。代理在行业和研究圈中被广泛讨论,主要是因为这项技术能够转化企业应用并提供卓越的客户体验。构建代理的常见模式使我们能够迈出实现人工通用智能(AGI)的第一步。
在我之前的文章中,我们看到了一种构建LLM驱动应用的智能梯度。从捕获问题域并使用LLM内部内存生成输出的提示开始。使用RAG,我们通过从向量数据库中搜索外部知识来增强提示,以控制输出。接下来,通过链接LLM调用,我们可以构建工作流来实现复杂的应用。代理将其提升到一个新的层次,通过自动确定这些LLM链应该如何形成。让我们详细看看。

代理的内部机制
代理的一个关键模式是,它们使用LLM的语言理解能力来制定解决给定问题的计划。LLM理解问题并为我们提供解决问题的步骤序列。然而,它并没有就此止步。代理不仅仅是一个纯粹的支持系统,它会为我们提供解决问题的推荐,然后将执行这些推荐的任务交给我们。代理拥有工具来执行这些操作。听起来很可怕,对吧?
如果我们问代理一个基本问题,如下所示:
人类: 电话发明者的公司叫什么名字?
以下是代理可能采取的思考步骤的示例。
代理(思考):
- 想法: 我需要搜索电话的发明者。
- 操作: 搜索[电话发明者]
- 观察: 亚历山大·格雷厄姆·贝尔
- 想法: 我需要搜索由亚历山大·格雷厄姆·贝尔创立的公司
- 操作: 搜索[由亚历山大·格雷厄姆·贝尔创立的公司]
- 观察: 亚历山大·格雷厄姆·贝尔于1885年联合创立了美国电话和电报公司(AT&T)
- 想法: 我已经找到了答案。我将返回。
代理(响应): 亚历山大·格雷厄姆·贝尔于1885年联合创立了AT&T
您可以看到代理遵循一种系统的方法来分解问题为可以通过采取特定操作来解决的子问题。这里的操作是由LLM推荐的,我们可以将它们映射到特定的工具来执行这些操作。我们可以启用代理的搜索工具,以便当它意识到LLM已经提供了搜索作为操作时,它将使用LLM提供的参数调用该工具。这里的搜索可以在互联网上进行,也可以重定向到搜索内部知识库,如向量数据库。系统现在变得自给自足,可以通过一系列步骤来解决复杂的问题。像LangChain和LLaMAIndex这样的框架为我们提供了一种简单的方法来构建这些代理并连接到工具和API。亚马逊最近推出了他们的Bedrock代理框架,它为设计代理提供了一个可视化界面。
在内部,代理遵循一种特殊的方式向LLM发送提示,以生成操作计划。上述的思考-操作-观察模式在一种称为ReAct(推理和行动)的代理类型中很流行。其他类型的代理包括MRKL和计划与执行,它们主要在提示风格上有所不同。
对于更复杂的代理,操作可能与工具绑定,工具会对源系统进行更改。例如,我们可以将代理连接到一个工具,该工具检查假期余额并在ERP系统中为员工申请休假。现在我们可以构建一个很好的聊天机器人,它将与用户交互,并通过聊天命令在系统中申请休假。再也不需要复杂的申请休假界面,只需一个简单的统一聊天界面。听起来很令人兴奋,对吧?
注意事项和负责任的AI的必要性
现在,如果我们有一个工具,它使用预授权的API调用股票交易。我们构建一个应用程序,代理学习股票变化(使用工具)并为我们做出买卖股票的决定。如果代理出售了错误的股票,因为它产生了幻觉并做出了错误的决定怎么办?由于LLM是巨大的模型,很难确定为什么它们做出某些决定,因此在没有适当的防护措施的情况下,幻觉很常见。
虽然代理很吸引人,但您可能已经猜到了它们有多么危险。如果它们产生幻觉并采取错误的操作,可能会导致巨大的财务损失或企业系统中的重大问题。因此,在LLM驱动的应用时代,负责任的AI变得至关重要。负责任的AI的原则,如可复制性、透明度和问责制,试图为代理的决策设置防护措施,并建议进行风险分析,以确定哪些操作需要人工干预。随着更复杂的代理被设计出来,它们需要更多的审查、透明度和问责制,以确保我们知道它们在做什么。
结束语
代理能够生成带有操作的逻辑步骤,这使它们非常接近人类的推理。赋予它们更强大的工具可以使它们拥有超能力。像ReAct这样的模式试图模仿人类解决问题的方式,我们将看到更好的代理模式,这些模式将与特定的上下文和领域(银行、保险、医疗保健、工业等)相关。未来已经到来,代理背后的技术已经准备好供我们使用。同时,我们需要密切关注负责任的AI防护措施,以确保我们不会构建Skynet!












