思想领袖

AI 还未准备好应对真实工作:模型为何在复杂任务上失灵

mm
将 Unite.AI 添加到您在 Google 上的首选来源

AI 泡沫中的投资者恳求白领专业人士交出他们最棘手的问题,并向员工承诺,只要再多交出一点数据,他们的下午就能恢复自由。复杂的分析、判断决策以及多年才形成的工作流程被模型所吸收,表面上是让人类腾出时间去做更好的事。这正是当下美国企业的主流叙事,却是一个陷阱。 

The Capability Myth: Why Models Flunk Complex Tasks

一项来自加州大学伯克利分校的 研究 对领先的 AI 代理在 55 个行业(从医疗到金融再到法律)的真实职业任务上进行测试。整体表现低于 25%。随后研究人员挑选出每个领域中最困难的任务——那类能够区分资深专业人士和初级人士的工作——结果所有模型全部失效。分数不仅低,甚至为零。 

你可能会认为这样的结果本应自行改变舆论,但事实并非如此。跨行业的 AI 投资者仍极力说服专业人士相信当前的大多数 AI 模型已经超前于实际水平。但最有趣的问题并不是 AI 今天能否完成工作中最难的部分,因为我们以及所有销售 AI 的人已经知道答案。 

于是,出现了另一个问题:当年轻专业人士在自己的推理尚未完全形成之前,就接受了这种数据交换,他们的判断会怎样? 

The Minnesota Findings: How AI Flattens Skill Toward the Middle

明尼苏达大学法学院的一项新的实证 研究 给出了真实答案,以法律为测试案例。研究者让大约一百名高年级法学院学生完成一系列真实任务:从原始材料中综合法律、闭卷回答问题以检验吸收情况、将法律应用于事实情境、随后自行修改作品。一个组在最初和最后一步才使用 AI,另一组则一直不使用 AI,直到最后才使用。 

使用 AI 完成首稿的学生作品更强且更快完成,这本身并不特别惊人。真正令人惊讶的是随后发生的事。研究者原本预期早期使用 AI 会留下理解缺口,等工具被移除时会显现出来。但事实并未如此。使用 AI 综合法律的学生在冷测时对法律的理解反而优于未使用 AI 的学生。独立推理并未被侵蚀,反而在某些情况下有所提升。 

转折点出现在最终阶段——所有学生都可以使用 AI 来修改作品。起初稿件较弱的学生利用 AI 实际上显著提升了作品质量;而起初稿件较强的学生则出现退步。单独面对一个强大的工具且缺乏进一步使用结构指导时,技能不再累积提升,而是趋向于中等水平。 

这两项研究共同揭示了一个严峻的真相: AI 并不是专业判断的替代品,伯克利的数字应当彻底终结这一争论。但 AI 也并非一种会在接触时就腐蚀推理的破坏性力量。它的影响完全取决于它在工作流程中的出现位置。 

Sequencing Over Substitution: Keeping Judgment at the Core

这一点同样适用于法律实践之外的所有知识型职业。每个知识型行业现在都在进行类似的实验:医生决定是否让模型起草鉴别诊断,分析师决定是否让模型完成第一轮模型构建,助理决定是否让模型先行搭建论点框架再自行完善。明尼苏达的研究结果表明,答案并非对所有形式的 AI 给出统一的“是”或“否”。关键在于使用顺序。AI 适合用于繁重的前置工作和产生摩擦的任务环节,但不应介入判断环节。它不应位于客户真正付费的核心任务之中,而目前它也无法胜任,即便尝试也做不到。 

仍然坚持相反说法的公司正在销售一种数据表明根本不存在的 AI 版本。那些围绕研究实际划出的界限来构建产品和客户关系的公司,才是五年后仍能获得专业人士信任的企业。其他所有人都只能花时间去解释一个代价高昂的误解。 

Austin Worrell 是一位六次创办科技公司的企业家,同时是加州律师协会会员。他担任 Dialogica 的首席执行官兼联合创始人,Dialogica 是一个安全的增强情报平台,旨在帮助律所清理日常业务中的杂务,同时保留法律判断、客户信任和行业定义的保密性。

在共同创立 Dialogica之前,他曾在 Gunderson Dettmer 律所执业,为风险投资公司和科技企业提供风险融资、公司设立以及超过 12 亿美元的并购咨询,并拥有企业与民事诉讼的先前经验。他的创业项目包括: KINO,一个由 Cathie Wood 的 ARK 风险基金、Slow Ventures、Sequoia 等支持的 AI 驱动流媒体平台;以及 EG Global,这是一家社会影响力区块链公司,市值已增长至 5 亿美元,并向全球公益捐赠超过 400 万美元。Austin 在模拟法庭和辩论赛的最高水平竞争了十余年,其中包括击败耶鲁大学夺得全国冠军称号。