Anderson 视角

AI 使用可能使任务耗时更长,研究发现

mm
将 Unite.AI 添加到您在 Google 上的首选来源
AI-generated image (GPT-2): A man sits at breakfast while a group of identical domestic robots shave him, cut his hair, prepare his food, and clean the house around him, turning even the smallest daily tasks into outsourced labor.

新研究表明,AI 可能使简单任务耗时更长,同时让用户相信他们变得更加高效。

 

斯坦福大学、纽约大学和普林斯顿大学的一项新研究发现,我们经常在不必要时使用 AI;对于我们习惯性地交给 AI 的小任务,我们往往会在没有 AI 的情况下花费更少的脑力,并节省更多的时间。

在为研究而开展的三项人体研究中,研究人员发现,参与者经常低估了 AI 将为他们节省多少时间,以及他们实际上使用 AI 的频率。

‘在 [第二项研究] 中,我们试图了解为什么人们可能会在简单任务中使用 AI,尽管 AI 使用并没有带来效率的好处。一个假设是,人们对 AI 协助所节省的时间和精力有误判。 ‘

‘为了测试这个假设,我们比较了人们预测的时间和精力与实际完成任务所需的时间和精力,并找到了 效率增益幻觉,人们高估了 AI 节省的时间和精力。 ‘

‘平均而言,人们预测 AI 协助可以节省 55.7 秒的时间,但实际上只节省了 7.5 秒。这种误判在简单任务中尤其严重,人们预测 AI 协助可以节省时间,但实际上使任务更慢。’

这篇题为 效率增益幻觉:人们低估了 AI 使用率和高估了其在简单任务中的益处 的论文由七位作者共同撰写,发现先前的 AI 使用似乎会加强未来的 AI 使用,即使技术没有带来真正的效率益处。

三个实验的概述,用于测试人们如何使用 AI 完成简单的日常任务,揭示用户低估了他们对 AI 的依赖程度,高估了 AI 节省的时间,并在之前接触 AI 后更有可能再次使用它。来源 - https://arxiv.org/pdf/2605.22687

三个实验的概述,用于测试人们如何使用 AI 完成简单的日常任务,揭示用户低估了他们对 AI 的依赖程度,高估了 AI 节省的时间,并在之前接触 AI 后更有可能再次使用它。 来源

研究发现,人们在使用 AI 后更有可能再次使用它,即使这并不总是有益或节省时间:

‘与之相反,经验并没有改善人们对 AI 有用的估计;我们发现了一种 会话级别的迁移效应,即初始的 AI 使用增加了后续的 AI 使用。 ‘

‘参与者最初使用 AI 完成任务后,更有可能在简单任务中选择 AI 协助,即使这并不总是节省时间或精力。 ‘

在一项人体研究中,研究人员发现,AI 帮助所带来的节省完全是虚幻的:

‘AI 协助可能会 适得其反。我们发现,使用 AI 的人比独立完成任务的人多花了 7.06 秒,并报告了更高的努力程度。 ‘

该研究仅限于五分钟或更短的任务,但可能会引起那些现在经常使用 ChatGPT 和其他流行的 LLMs 来完成小任务的读者的共鸣。

学习小组

在各种用户研究中,任务是基于 用户需求和行动的分类法(TUNA)框架设计的。实验涵盖了信息检索、摘要、算术、拼写纠正、重写和其他低复杂度任务,可以在五分钟内完成。

第一项研究比较了参与者预测的使用 AI 的意愿与他们在任务完成期间的实际行为,调查人们是否准确地理解了他们对 AI 协助的依赖程度。

第二项研究关注的是感知到的与实际的效率增益,通过比较参与者对时间节省和减少脑力消耗的预期与实际完成时间和工作量来比较。

第三项研究检查了先前的 AI 接触是否会改变后续的决策,跟踪参与者在之前完成任务时是否使用了 AI,然后在后续任务中是否更有可能再次使用 AI。

过度思考 – AI 在简单任务中的使用

为了了解人们是否准确地估计了他们对 AI 的依赖程度,一项研究让参与者完成四项任务,并提供使用 AI 协助的选项。参与者实际使用 AI 的程度与他们之前估计的使用程度存在显著的差异:

参与者一致地低估了他们在简单任务中使用 AI 的频率,差距在更容易的提示中扩大,实际 AI 使用率达到 38%,而预测率为 20%,表明习惯性的 AI 委托远远超出了用户的意识。

参与者一致地低估了他们在简单任务中使用 AI 的频率,差距在更容易的提示中扩大,实际 AI 使用率达到 38%,而预测率为 20%,表明习惯性的 AI 委托远远超出了用户的意识。

研究人员指出:

‘我们发现人们实际上使用 AI 的频率远高于预测的平均频率。平均而言,参与者报告他们将在 33% 的任务中使用 AI,但实际的 AI 使用率为 47%(β = 1.07,p < 0.001)。’

‘这种差距在更容易的任务中更为明显(β = 0.69,p < 0.001):参与者预测的 AI 使用率为 20%,但实际的 AI 使用率为 38%(β = 1.42,p < 0.001),几乎是预测频率的两倍。’

实验重点关注那些现在经常被交给 AI 的普通低强度任务。参与者被要求执行简单的活动,包括事实回忆、算术、拼写纠正、重写短篇文章、文本摘要和基本推理问题,其中一些任务只需要几句话或一个句子来完成。

研究还包括相同活动的稍微困难版本,以便比较 AI 使用是否会随着工作难度的增加而改变。

AI 节省时间的好处被高估

在第二项研究中,参与者被分为两个独立的组,一组首先估计 AI 将在一系列任务中节省多少时间和脑力消耗,而另一组实际完成这些任务,使用 AI 协助或独立完成。任务仍然集中在低复杂度的活动上,包括算术、重写、事实回忆、摘要、拼写纠正和短推理练习。

目标是比较人们对 AI 生产力的预期与实际完成工作时发生的情况。根据论文,参与者一致地高估了 AI 将带来的好处,特别是在更容易的任务中,许多人认为 AI 将大大减少工作量和完成时间。

相反,测量结果通常只显示出微小的收益,在某些情况下,AI 使用实际上会减慢参与者的速度。

在某些更简单的任务中,AI 用户实际上比独立完成任务的人花费了更长的时间:

预测与实际的时间和脑力消耗在 AI 协助和独立任务完成中,揭示了论文提出的“速度幻觉”,参与者一致地认为 AI 会节省更多的时间,但实际 AI 协助的完成时间远远长于预测,而独立完成任务的估计则更接近实际结果。

预测与实际的时间和脑力消耗在 AI 协助和独立任务完成中,揭示了论文提出的“速度幻觉”,参与者一致地认为 AI 会节省更多的时间,但实际 AI 协助的完成时间远远长于预测,而独立完成任务的估计则更接近实际结果。

该研究还检查了感知到的脑力消耗。参与者经常认为 AI 会使任务感觉更容易;然而,实际的脑力消耗减少远小于预期。论文将其描述为“效率增益幻觉”,人们系统地高估了 AI 协助的速度和有用性。

AI 使用加深了幻觉

最后一项研究旨在测试即使是短暂的 AI 接触是否会改变后续的决策。参与者被分为多个组,并首先进入“接触阶段”,其中一些参与者使用 AI 完成了简单的任务;一些参与者使用 AI 完成了更困难的任务;而其他人则独立完成了相同的任务,而没有使用 AI。一个单独的控制组完全跳过了任务阶段。

随后,所有组进入第二个“测试阶段”,这次给他们新的、更容易的任务,并允许他们自己决定是否使用 AI。任务仍然集中在低复杂度的任务上,包括重写、算术、回忆、拼写纠正、摘要和短推理练习,可以在几分钟内完成。

论文报告称,之前使用过 AI 的参与者在后续任务中更有可能再次依赖 AI,即使之前的 AI 使用没有带来时间或脑力消耗的节省。

研究人员发现,之前的 AI 用户在后续测试阶段比之前独立完成任务的参与者更频繁地选择 AI 协助:

之前使用过 AI 的参与者在后续任务中更有可能再次依赖 AI,即使之前的 AI 使用没有带来时间或脑力消耗的节省。左侧面板显示,之前的 AI 用户在后续测试阶段比之前独立完成任务的参与者更频繁地选择 AI 协助。右侧面板说明了论文提出的“速度幻觉”,即之前的 AI 接触增加了参与者认为 AI 协助更快、更高效的信念,即使实际完成时间经常没有带来显著的好处,甚至有时性能更慢。

之前使用过 AI 的参与者在后续任务中更有可能再次依赖 AI,即使之前的 AI 使用没有带来时间或脑力消耗的节省。左侧面板显示,之前的 AI 用户在后续测试阶段比之前独立完成任务的参与者更频繁地选择 AI 协助。右侧面板说明了论文提出的“速度幻觉”,即之前的 AI 接触增加了参与者认为 AI 协助更快、更高效的信念,即使实际完成时间经常没有带来显著的好处,甚至有时性能更慢。

重复的 AI 接触被报告为扭曲了参与者的判断,即使任务是否真正可以更快地完成而不使用 AI。那些已经使用过 AI 的人变得不太可能同意任务可以在没有 AI 的情况下更快完成,即使测量结果经常显示没有显著的好处,甚至有时完成时间更长。

研究人员认为,这会产生一种“自我强化循环”,其中 AI 的使用增加了对 AI 的未来依赖,同时削弱了用户准确判断 AI 是否真正提高了生产力的能力。

结论

观点 许多采用 AI 完成小任务的读者可能会对这篇新论文的结论感到熟悉。

个人而言,我对自动化重复任务的痴迷早于当前的 AI 热潮几十年。现在和过去一样,问题仍然存在:设置和/或维护自动化所需的努力是否超过了不使用自动化直接完成任务所需的努力?

那些热爱自动化的人可能最终会为了自动化而自动化,即使需要几年甚至几十年才能看到任何回报(以节省时间的形式),这会将活动的背景从“优化”转变为“爱好”。

没有什么问题,只要你不欺骗自己,认为真正的收益正在实现。然而,这是一个我在近年来一直试图抵制的坏习惯,最近的 AI 选项似乎容易加剧这种情况,因为即使是糟糕或非最优的结果也可以比以前更快地获得。

欺骗性指标

这篇论文略微忽略了通过 AI 获得的偶然或幸运结果与通过 AI 获得的盲目尝试和挫折之间的紧张关系,例如使用 ChatGPT 等 AI 聊天机器人时,需要使其适应自己的需求,并且可以在工作流程中依赖它,即使在强制升级到新版本时,这些新版本可能不会像之前的版本那样运行。

“神奇”的结果是指 AI 立即以简单、合理的方式解决问题的那次机会。例如,每当我审阅一篇论文时,我必须打印它,并且总是不得不在顶部用粗体写上页码,因为这些页码通常要么缺失,要么在底部以小字体显示。要求 ChatGPT 编写一个可以在 PDF 顶部添加大号、粗体页码的 Python 脚本,结果非常快,我现在可以将 Arxiv PDF 拖到一个.BAT 文件中,并在 2-3 秒内获得带有明显页码的新版本:

通过 AI 编写的 Python 脚本为 PDF 添加了明显的页码。

通过 AI 编写的 Python 脚本为 PDF 添加了明显的页码。

除了花了一两分钟的时间来争论 Windows 是否有一个独立的 Arial Black 字体(它没有了)外,这可能是我使用 AI 获得的最快的有用结果。

可以说,这种“突破”或“轻松获胜”会给人一种 AI 真正能够节省时间和/或脑力消耗的错误印象,因为我们倾向于过度强调这样的实例:我们的自然倾向是抑制痛苦或消极的记忆,并重用或关注更快乐的记忆,这意味着 AI 以有用的方式解决小问题的成功实例将成为我们追求的灯塔,即使这与统计证据和我们自己的经验相矛盾,即这样的“轻松获胜”是例外而不是常规。

除了这篇新论文外,还有越来越多的证据表明,我们对 AI 的有用性存在幻觉。2025 年的一项研究发现,使用 AI 的开发人员比不使用 AI 的开发人员多花了 19% 的时间;另一项最近的研究证实了这篇论文的基本信息,即 AI 节省时间需要时间。

如果这种研究可以转化为一种老式的、由 AI 驱动的时间和动作研究,将为我们提供真正的见解,即 AI 实际上为我们节省了多少时间,或者花费了多少时间。

最后,这项研究在另一个重要方面是例外的,因为它至少尝试量化使用 AI 进行较小任务的“脑力消耗”。随着人们越来越关注 AI 辅助工作的“强度”,我们迫切需要可靠的衡量单位来量化 AI 的要求和怪癖对我们造成的疲劳程度,以及对工作质量和工作适应性的更一般的成本。

 

* 格式是作者的,来自原始论文。任何内联引用都被我转换为超链接。

首次发表于 2026 年 5 月 23 日星期六

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai