思想领袖

决策越关键,AI 就越不应该单独工作

mm
将 Unite.AI 添加到您在 Google 上的首选来源

AI 代理明显存在一个 问题,它被伪装成关于其优势的推销。代理自信地说话,优雅地写作,处理信息的速度比人类快。这可能会让人觉得 AI 已经准备好独立操作。但实际上,一旦涉及到真正的钱、客户期望和信任,AI 不应该是一个自治系统,因为它仍然需要成年人的监督。

这一教训并非来自理论,而是通过测试获得的,当时豪华生活方式服务的 AI 能够与真实客户交互。

好心的建议可能带来危险

在 AI 驱动的生活方式管理应用的早期测试中,系统一开始看起来很令人印象深刻。它可以编制一份餐厅的简要列表,建议娱乐选项,草拟当地活动的行程,并将所有这些整合成清晰、高质量的推荐。但在大约 15% 的情况下,它只是编造了细节——并且做得足够令人信服,以至于令人相信。

有一个例子使得这个问题无法忽视:AI 推荐了一家在迪拜的餐厅,但那家餐厅已经在八个月前关闭了。当被问及此事时,它没有犹豫或承认自己犯了错误。代理加倍地编造了一个评论并引用了它。

另一次,代理将一家路边小吃店误认为是一家米其林星级餐厅,因为它们的名字相似。如果人类没有审查订单,礼宾服务的客户可能会得到与计划完全不同的晚餐。

然后还有拍档游戏的事件。一个客户询问一个有拍档球场的体育俱乐部。AI 就要把他引导到一个只有网球场的地方。为什么?因为在某个地方的源数据中,它发现了一篇新闻文章,称拍档球场计划在那里建造,并且它微妙地将“计划”转换为“已经存在”。这正是使模型在服务行业中成为风险实验的原因:即使 AI 没有完整、准确的数据,它也不会停止——它会即兴发挥。

AI 的幻觉作为商业威胁

这个问题绝不仅限于旅游业——它存在于 AI 的实施中。

在明确定义的参数内,AI 工作得非常出色。你可以为它提供结构化数据、最新的 API,它将以远远超过你的速度出色地完成任务。它将根据十七个参数对案例进行排序,瞬间扫描规则,并在几秒钟内生成可用的草稿。但是,现实世界远远不是一个结构化的数据库。现实中充满了边缘情况、过时的信息、模糊的偏好、含糊的措辞和操作缺口。

这正是幻觉开始构成商业风险的地方。 研究 一再警告,幻觉可以瞬间破坏信任,特别是在客户在决策时刻收到精致但不准确的信息时。人们已经 广泛使用 AI 规划者,但信任仍然缺乏。

高净值人士是 AI 的终极压力测试

现在让我们提高赌注。

AI 很容易处理标准任务——例如预订从伦敦到迪拜的旅行:商务舱、四星级酒店、三晚。但真正的压力测试是一个来自高净值人士的简报:这是我们的周年纪念日。她提到了一家在阿马尔菲的餐厅,有一扇蓝色的门。她喜欢牡丹,但讨厌玫瑰,并且她会更喜欢一位说法语的司机。

这样的请求听起来很优雅,但从操作的角度来看,这是一个雷区。AI 代理肯定会建议选项,但它也可能提供 40% 的不正确信息,并且充满信心。

豪华和高净值人士客户段揭示了 AI 的真正局限性,比任何测试都快,因为他们的请求不是标准化的,他们的期望是情感化的、依赖于上下文的和高度特定的。大多数情况下,这样的请求很难自动验证。

此外,无法有效地服务高净值人士客户不会以简单的退款结束。它将损害公司的声誉,因为在这个领域,推荐和信任至关重要。

真正的员工每天都在处理这些幻觉。他们会注意到恰好在客户到达的那個星期二关闭的餐厅,以及实际上需要25分钟带着行李爬坡的那段看似只有5分钟的短途步行。受过训练的专家不会忽略一家看起来完美的精品酒店,但实际上由于装修而被脚手架覆盖。

为什么金融科技需要准确性,而不是速度

我们可以将同样的逻辑应用于整个金融科技领域。AI 可以分析产品、比较选项、识别异常并快速高效地生成推荐。但是,当涉及到钱时,随机错误是零容忍的。

金融科技公司突然 由自动化做出的决定付出代价——以失去客户信任的形式。成功的公司在早期实施控制机制,而不是在已经造成损害后才引入它们;适当的模型包括人类监督。

在 AI 和客户之间需要一个额外的验证层——一个阶段,在那里结果被彻底验证和安全。在错误成本高的领域,这个层成为产品的基础。

一个更有用的概念是基础设施。AI 应该专注于 结构化任务:研究、排序、比较和草拟。在这个过程中,人类应该做出最终的决定。随着时间的推移,一些工作流程将变得足够稳定,以至于可以完全自动化。在那时,可能会有可能建立一个基准,但这应该基于证据,而不是信仰。

这些想法可能听起来不如完全自治的未来那么鼓舞人心,但这正是认真的公司最终会成功的方式。

Dmitri Laush - Perfect.Live 的 CEO 和联合创始人,是传统礼宾服务的现代替代品,服务于 127 个国家的高净值个人和顶级企业合作伙伴。Dmitri 专注于构建技术驱动的解决方案,以便于客户的复杂需求,帮助他们节省时间。