思想领袖

如果你的员工像 AI 那样行事,你现在早该把他们解雇了。

mm
将 Unite.AI 添加到您在 Google 上的首选来源

想象一下,你刚雇佣了一个新人,大多数日子里他们高效、博学、表达清晰且自信。他们正是你所期望的,展现出优秀员工的诸多特质。

现在想象一下,偶尔在面对一个他们不知道答案的问题时,他们会随意编造答案。答案流畅、令人信服,起初你会把它当作表面价值接受。但当它对业务产生影响时,你会回过头来质问该员工——他们却无法解释自己的思考过程或展示推导过程。你甚至可能告诉他们他们错了,却只会遭到坚持相反意见的回应,并出现更多的编造来试图支撑。第二次或第三次出现这种情况后,你很可能会解雇他们,或者至少给出警告。对大多数雇主而言,答案几乎肯定是“是”。

我感到困惑的是,企业现在竟把关键工作流和决策交给已知会表现出这种行为的“员工”。之所以没有受到约束,唯一原因是这个“员工”是软件而非人类。

为什么 AI 的失误方式不同于人类

在部署 AI 的企业中,普遍存在一种错误的假设:如果技术有错误率,那就和人为错误大致相同,可以用同样的方式管理。但检查、审查和升级在大型语言模型(LLM)上并不总是奏效。它们被设计得像人类一样,但仔细看看内部机制,你会发现它们根本不像我们那样运作。

如果一名明星员工犯错,我们会认为错误是出于诚意——他们已经尽力而为,却不慎失误。这种情况会发生。如果他们故意编造答案以掩饰不知道某事,并且屡次如此,我们会将其视为不当行为。管理者知道该把监督重点放在哪里,因为工作难度与错误幅度相吻合。他们可以要求员工解释其推理并进行质询。员工通常会在超出自己能力范围时坦承。而在一次错误后,他们会学习,从而避免同样的错误在循环中重复出现。

AI 系统颠倒了所有这些假设。它们对失败的默认反应是流畅且自信的虚构。它们会给出看似合理却根本不真实的答案,这正是会终结人类职业生涯的行为。LLM 被设计成生成文本最具统计可能性的续写,当它们不知道答案时,常常会产生听起来可能正确的内容。OpenAI 的研究人员已经承认,某种程度的事实错误是这些模型工作方式的统计必然,并且 训练奖励自信的猜测,而不是诚实地承认不确定性

神经符号方法的切入点

这正是 神经符号方法 旨在解决的问题。它们将擅长理解混乱真实语言和数据的神经网络与确定性的基于规则的推理相结合。这意味着系统的结论来源于可检查的明确逻辑,而非源自无人可见的过程。

如果没有神经符号技术提供的这层额外逻辑,AI 的错误就不会像人类错误那样与工作难度相对应——它们是不可预测的。它们可能在琐碎任务上出现错误,而在困难任务上顺利完成,导致难以判断应将人工监督的重点放在哪里。当提供解释时,这些解释往往是事后生成的,而不是对其得出结论的真实过程的说明。同样的错误可能无限循环,因为系统内部没有人能够从中学习或承担责任。

缺乏理解的信任

研究人员记录到,当人们首次使用系统时,往往在一次可见错误后就放弃它;但当系统已经熟悉时,他们会走向另一个极端——接受其输出仅仅因为已经习惯,而不是因为这些输出变得更可靠。很少出现的是恰当的信任水平,因为这取决于人们能否了解 AI 系统何时可能出错并能够识别出错误。

这并不意味着 AI 不应被信任去处理重要工作。它说明我们愿意给予它一种我们不会对人类提供的信任,部分原因是当它出错时没有明显的个人可以追究责任。

如果 AI 要像受尊敬的同事一样承担判断性工作,它必须符合相同的基本标准。答案需要可验证,并且 推理可见,同时接受有时最好的做法是说“我不知道”。

William Tunstall-PedoeUnlikelyAI 的首席执行官兼创始人,他是一位连续创业者和天使投资人,致力于构建一种“神经符号”人工智能方法,该方法将深度学习与符号推理相结合,以解决传统 AI 模型在高风险环境中受到的偏差、幻觉以及准确性和可解释性不足的问题。他之前创立了语音助手初创公司 Evi,该公司被亚马逊收购,随后他和团队构建并推出了 Alexa。他在 2023 年获得了 2000 万美元的种子融资,以推动 UnlikelyAI 为金融服务、保险和会计等高度监管行业的企业提供平台。