AI 模型与平台

从意图到执行:微软如何将大型语言模型转化为面向行动的AI

mm
将 Unite.AI 添加到您在 Google 上的首选来源

大型语言模型(LLMs)已经改变了我们处理自然语言处理的方式。它们可以回答问题,编写代码,并进行对话。然而,当涉及到现实世界任务时,它们却存在不足。例如,一个LLM可以指导您购买一件夹克,但无法为您下单。这一思维和行动之间的差距是一个主要的局限性。人们不仅需要信息,还需要结果。

为了弥补这一差距,微软正在将LLMs转化为面向行动的AI代理。通过使它们能够规划、分解任务和参与现实世界的交互,微软赋予LLMs有效管理实际任务的能力。这一转变有可能重新定义LLMs的功能, 将它们转化为可以自动化复杂工作流程和简化日常任务的工具。让我们来看看使这一切成为可能所需的条件,以及微软如何解决这个问题。

LLMs需要什么来行动

为了在现实世界中执行任务,LLMs需要超越对文本的理解。它们必须与数字和物理环境交互,并适应不断变化的条件。以下是它们需要的一些能力:

  1. 理解用户意图

为了有效地行动,LLMs需要理解用户的请求。输入如文本或语音命令通常是模糊或不完整的。系统必须使用其知识和请求的上下文来填补空白。多步骤对话可以帮助完善这些意图,确保AI在采取行动之前理解用户的需求。

  1. 将意图转化为行动

在理解任务之后,LLMs必须将其转化为可执行的步骤。这可能涉及点击按钮、调用API或控制物理设备。LLMs需要根据具体任务修改其行为,适应环境,并在出现问题时解决挑战。

  1. 适应变化

现实世界的任务并不总是按计划进行。LLMs需要预测问题,调整步骤,并在出现问题时找到替代方案。例如,如果必要的资源不可用,系统应该找到另一种方式来完成任务。这种灵活性确保了当事情发生变化时,流程不会停滞。

  1. 专注于特定任务

虽然LLMs被设计为通用使用,但专注于特定任务可以使它们更高效。通过专注于特定任务,这些系统可以使用更少的资源提供更好的结果。这对于具有有限计算能力的设备(如智能手机或嵌入式系统)尤为重要。 (MSFT )

通过开发这些技能,LLMs可以超越简单的信息处理。它们可以采取有意义的行动,为AI无缝集成到日常工作流程铺平了道路。

微软如何转化LLMs

微软创建面向行动的AI的方法遵循一个结构化的过程。主要目标是使LLMs能够理解命令、有效规划和采取行动。以下是他们的做法:

步骤1:收集和准备数据

在第一阶段,他们收集了与其特定用例相关的数据:UFO Agent(见下文)。这些数据包括用户查询、环境详细信息和任务特定操作。有两种类型的数据在此阶段被收集:首先,他们收集了任务计划数据,帮助LLMs概述完成任务所需的高级步骤。例如,“在Word中更改字体大小”可能涉及选择文本和调整工具栏设置等步骤。其次,他们收集了任务操作数据,允许LLMs将这些步骤转化为精确的指令,例如点击特定按钮或使用键盘快捷键。

这种组合使模型同时拥有大局和详细的指令,从而有效地执行任务。

步骤2:训练模型

一旦数据被收集,LLMs就会通过多次训练会话进行改进。在第一步中,LLMs被训练以进行任务规划,教它们如何将用户请求分解为可执行的步骤。然后使用专家标记的数据来教它们如何将这些计划转化为具体的操作。为了进一步增强其问题解决能力,LLMs参与了自我增强的探索过程,使它们能够处理未解决的任务并为持续学习生成新的示例。最后,应用了强化学习,利用成功和失败的反馈来进一步改进其决策。

步骤3:离线测试

训练完成后,模型在受控环境中进行测试,以确保可靠性。使用诸如任务成功率(TSR)和步骤成功率(SSR)等指标来衡量性能。例如,测试日历管理代理可能涉及验证其无错误地安排会议和发送邀请的能力。

步骤4:集成到真实系统

一旦验证,模型就会被集成到代理框架中。这使得它能够与真实的环境交互,例如点击按钮或导航菜单。工具如UI自动化API帮助系统动态地识别和操作用户界面元素。

例如,如果任务是突出显示Word中的文本,代理会识别突出显示按钮,选择文本,并应用格式。一个内存组件可以帮助LLM跟踪过去的操作,使其能够适应新场景。

步骤5:真实世界测试

最后一步是在线评估。在这里,系统在真实世界的场景中进行测试,以确保它可以处理意外的变化和错误。例如,客户支持机器人可能会引导用户完成重置密码的过程,同时适应不正确的输入或缺失的信息。这种测试确保AI足够强大,能够适用于日常使用。

实用示例:UFO Agent

为了展示面向行动的AI如何工作,微软开发了UFO Agent。该系统旨在执行Windows环境中的真实任务,将用户请求转化为完成的操作。

在其核心,UFO Agent使用LLM来解释请求和规划行动。例如,如果用户说“在这个文档中突出显示‘重要’这个词”,代理会与Word交互以完成任务。它收集上下文信息,例如UI控件的位置,并使用这些信息来规划和执行行动。

UFO Agent依赖于诸如Windows UI自动化(UIA)API等工具。该API扫描应用程序以查找控件元素,例如按钮或菜单。对于像“将文档保存为PDF”这样的任务,代理使用UIA来识别“文件”按钮,找到“保存为”选项,并执行必要的步骤。通过结构化数据,系统确保从训练到真实世界应用的顺畅操作。

克服挑战

虽然这是一个令人兴奋的发展,但创建面向行动的AI也带来了挑战。可扩展性是一个主要问题。训练和部署这些模型以适应多样化的任务需要大量资源。确保安全性和可靠性同样重要。模型必须在不产生意外后果的情况下执行任务,尤其是在敏感环境中。随着这些系统与私人数据交互,维护围绕隐私和安全的道德标准也至关重要。

微软的路线图专注于提高效率,扩展用例,并维护道德标准。随着这些进步,LLMs可能会重新定义AI与世界的交互方式,使其更加实用、适应性强和面向行动。

AI的未来

将LLMs转化为面向行动的代理可能是一个游戏规则的改变。这些系统可以自动化任务,简化工作流程,并使技术更加便捷。微软在面向行动的AI和工具如UFO Agent方面的工作只是开始。随着AI的不断发展,我们可以期待更智能、更有能力的系统,它们不仅仅与我们交互——它们会完成任务。这些系统可以自动化任务,简化工作流程,并使技术更加便捷。微软在面向行动的AI和工具如UFO Agent方面的工作只是开始。随着AI的不断发展,我们可以期待更智能、更有能力的系统,它们不仅仅与我们交互——它们会完成任务。

Dr. Tehseen Zia 是 COMSATS University Islamabad 的终身副教授,拥有来自奥地利维也纳科技大学的人工智能博士学位。专攻人工智能、机器学习、数据科学和计算机视觉,他在著名的科学期刊上发表了重要贡献。 Dr. Tehseen 还作为首席调查员领导了各种工业项目,并担任人工智能顾问。