思想领袖

我如何将我的知识转移到可以像人类专家一样做出决定的AI系统中

mm
将 Unite.AI 添加到您在 Google 上的首选来源
A human expert in a technical control room teaching an AI system to make complex decisions through a holographic interface.

当我离开微软并继续与企业合作他们的AI部署时,我不断看到大多数人热衷的AI系统实际上无法像人类专家一样做出决定。当然,他们可以写作、总结和产生令人惊叹的流畅文本,听起来像是一个决定,但当你将这些系统投入到真正的运营环境中时,存在权衡、不确定性、不完整的指令和实际后果,他们很快就会挣扎。这与来自MIT Project NANDA的数据相符,显示虽然60%的组织评估了AI工具,但只有20%达到试点阶段,只有5%达到生产阶段。换句话说,行业正在努力构建能够在真正的工作流中坚持下去的系统。

在企业环境中,特别是在供应链、制造和运营等领域,获得答案并不难;难的是知道哪个答案值得信任,哪些变量最重要,以及如果做错了,哪些事情可能会在下游破坏。在我看来,这既是一个专业知识问题,也是一个判断问题。

为了澄清,AI已经在产生更好的输出方面取得了非凡的进步。但是,输出的改善并不等同于决策的改善。这些是两个不同的里程碑,我认为行业已经花了很多时间把它们当作可以互换的东西来对待。

缺乏专业知识和判断力是我开始对构建AI感兴趣的原因,人类专家可以教会AI像他们一样做出复杂的决定。AI不应该仅仅是关于自动化任务,而是关于有效地将人类的判断力转移到AI系统中,使其能够在环境变得混乱时坚持下去。

大型语言模型(LLM)听起来像决策者,但它们并不是

毫无疑问,LLM很有用,但它们本身并不是决策系统。它们是包裹在语言中的预测系统。语言很有说服力,这也是问题的一部分。如果一个系统可以流利地解释自己,我们很容易高估它的理解程度。你问它一个商业问题,它会给你一个结构化的答案,包括权衡、注意事项和最后的总结,让它听起来比实际上更聪明。听起来连贯和在操作上有能力并不是同一件事,这也是许多企业AI系统出问题的地方。模型可以告诉你一个好的决策听起来是什么样的,但没有任何关于什么使得一个决策在压力下、随着时间的推移或在特定背景下是好的理解。这就是为什么许多组织难以超越实验阶段的原因之一。 Gartner发现,至少50%的生成式AI项目在概念验证后被放弃,远在它们能够产生真正的运营影响之前,通常是由于不明确的价值和风险控制。

信息与专业知识不同

与AI相关的最容易陷入的陷阱之一是,假设如果一个系统拥有足够的信息,它就应该能够像专家一样表现。听起来很有道理,但当你在日常生活中思考这个问题时,增加我们对某事物的信息并不一定能使我们成为专家。你可以阅读每一份航空手册,但仍然不准备好降落飞机。你可以记住每一个供应链的最佳实践,但当三件事同时出错时,你仍然会感到不知所措。

我可以继续下去,但重点是信息并不等同于能力。能力来自经验,特别是反复接触混乱的情况,答案并不明显。

每天,我都看到今天的大多数AI系统都是在静态示例上进行训练的。这对于做出预测很有帮助,但这只是决策的一个小部分。企业并不缺乏数据,但它们需要结构化的环境来练习,这意味着给予系统环境,让它们可以反复地:

  • 遇到现实场景
  • 做出选择
  • 看到结果
  • 获得反馈
  • 随着时间的推移而改进

AI可以使用预测算法进行训练,但这种方法有局限性。接下来需要的是可以在模拟环境中进行训练的AI,具有人类的监督。我称之为机器教学,这是一种将复杂的决策分解为场景和技能的方法,为人类专家提供了一个指导AI学习的指南。最终,反馈和试错使得代理能够从构建这些过程的人那里学习和行动,获得现实世界的自主权。

停止将AI视为单一实体

我看到的另一个错误是,人们假设一个大型模型应该能够做所有事情。没有一个篮球队只由一个人组成。没有一个工厂是由一个人经营的。复杂的系统之所以有效,是因为不同的组件执行不同的任务,并且有一个结构将它们联系在一起。

AI应该以同样的方式构建。我不认为企业决策的长期未来是一个巨大的模型坐在公司的中间,假装具有普遍的能力。更有可能的是,未来将由专门的代理团队组成。

一个代理可以成为数据检索的专家。另一个代理更擅长评估场景。另一个代理处理规划。一个代理检查合规性或捕获矛盾。另一个代理更像是一个监督者,决定何时升级或何时信心不足以继续。团队架构对我来说更有意义,因为它映射到现实组织的实际工作方式,并与更广泛的市场趋势保持一致。 麦肯锡的发现证实,组织通过在AI周围重新设计工作流程和运营结构来获得最大的价值。

并非所有决策都是以相同的方式做出的,我们经常假设同一个模型、相同的数据和相同的推理类型可以处理所有决策。实际上,不同的决策需要不同的机制。

决策实际发生的四种方式

在我的经验中,大多数决策倾向于落入几个类别中:

  1. 控制系统(规则和公式): 决策是通过将预定义的方程或规则应用于已知输入来实现的。如果X发生,做Y。
  2. 搜索和优化: 决策是通过评估许多可能的选项并根据定义的目标选择最好的选项来实现的。
  3. 强化学习(试错): 决策是通过采取行动、观察结果并根据奖励或惩罚进行调整来学习的。
  4. 实践和经验(人类式学习): 决策是通过反复接触、指导反馈和在现实场景中积累的判断来塑造的。

大多数企业AI在前两个类别中表现良好。第三和第四类别对于AI来说更具挑战性,因为那是人类式判断的所在。

没有结构的自主性就是风险

每当人们谈论自主AI时,讨论往往分为两个极端。一个方面认为这些系统基本上是魔术,可以运行一切。另一个方面认为它们永远不应该被信任去做任何有意义的事情。

我不认为任何一种观点都有用。我们应该专注于结构化的自主性,因为没有监督、升级逻辑、边界或问责制的自主性是风险的主要来源。风险问题现在也越来越受到关注,包括在诸如国家标准与技术研究所的AI风险管理框架等努力中,反映了组织如何认真对待监督、问责制和运营信任的问题。

企业AI的未来在于代理团队。从AI中获得最多价值的组织不会是那些自动化最多文字的组织。他们是那些能够将真正的专业知识转移到能够在环境变得混乱时坚持下去的系统中的组织。那是我认为AI看起来令人印象深刻和真正有用之间的区别,真正有用的是能够产生真正的投资回报率。

肯斯·安德森是AMESA的创始人和首席执行官,曾任微软自治人工智能采用的主任。他是智能自治代理领域的先驱,曾共同创造了“机器教学”方法,这种方法通过模拟、反馈和试错使人工智能代理能够发展成为现实世界中的自治代理。在过去的七年里,肯斯专注于为制造业和物流设计、构建和部署智能自治代理,领导了200多个现实世界的部署,包括壳牌、百事可乐和达美航空等大型企业。他也是《设计自治人工智能》(O'Reilly,2022年)一书的作者,目前正在开发一个水平平台,以协调人工智能代理在企业运营中做出百万美元的决策。