思想领袖
回顾“人们如何使用ChatGPT”

我是Ilya Romanov,我正在开发一个处于隐秘模式的AI产品。 在我的上一篇文章中,我讨论了一个(并不真正?)颠覆性的关于AI和收入底线的MIT报告。另一个热门报告出来了——“人们如何使用ChatGPT”。它的大胆开场“总体而言,我们发现ChatGPT通过决策支持提供经济价值,这在知识密集型工作中尤其重要”让我想知道是否——最后——有证据证明AI在工作过程和底线中有了切实的贡献。让我们深入探讨!
报告和团队
“人们如何使用ChatGPT” 由OpenAI研究人员和哈佛经济学家David Deming准备。他们在AI工程、隐私保护数据分析和经济政策方面的综合专业知识使得这项关于ChatGPT的大规模实证研究成为可能。
该研究基于与ChatGPT的150万次对话。团队使用隐私保护漏斗来匿名用户,同时仍然了解消息背后的意图。基本上,每次ChatGPT对话都经过自动过滤器,删除任何名称或个人细节,然后研究人员看到它们。这些经过清理的、机器生成的标签(如主题或意图)被分析。为了链接基本的 демограф背景,如教育或职业,团队在一个安全的清洁环境中工作,他们只能获取至少100个用户的聚合数据,因此无法识别任何个人或消息。
发现
“摘要”中的大胆陈述是关于AI如何在现代经济中提供价值的关键见解。与最近涌现的众多“自动化一切”的解决方案相比,ChatGPT主要被用作决策支持工具,而不是纯粹的任务自动化平台。该报告介绍了两种ChatGPT用户分配的任务类型: “提问”和“执行”。前者指的是寻求信息、建议或指导以做出更好的决策的工作(“相关性和因果关系有什么区别?”)。后者是执行特定任务,如撰写电子邮件、报告,甚至创建代码(“写一封电子邮件给我的经理,说我无法联系销售团队,尽管我多次尝试联系”)。
有趣的是,该报告区分了工作和非工作对话。所有非工作对话占2025年的70%,这表明与2024年的53%相比有了显著的增加。个人互动主要集中在日常任务(“如何”建议和辅导)和写作辅助(编辑或翻译)。这种增加和使用背景将ChatGPT定位为日常伴侣——新的谷歌——用于探索、创作和决策,超出了工作场所。
该报告显示,49%的所有消息是“提问”,而只有40%是“执行”提示。关键点是“提问”消息增长更快,并且从ChatGPT用户那里获得更高的满意度评分。2024年7月,“提问”和“执行”几乎相等,分别占所有ChatGPT消息的46%。到2025年6月,“提问”增加到51.6%,意味着绝对增加了5.6个百分点,相对增长了12%,而“执行”下降到34.6%,意味着相对下降了25%。
这种差异意味着什么?该报告认为,经济效益在于知识密集型工作中更快、更好的决策支持,这会放大生产力。在知识密集型工作中,业务结果直接受到决策质量和速度的影响,拥有更好的信息处理、替代观点和优秀的分析支持可以显著提高工人的表现。
结论的基础是这些发现。另一方面,拥有研究生学位的用户比受教育程度较低的用户更有可能使用ChatGPT进行“提问”(多2个百分点),而使用“执行”消息的可能性较小(少1.6个百分点)。同样,用户在高薪的科学和技术职业中更有可能使用AI进行“提问”——计算机相关工作中47%的工作相关消息是“提问”。
看不见的决策能力远远超过人类大脑,可以用金钱来衡量——不是OpenAI赚取的收入(截至今年8月初,每年130亿美元的收入),而是消费者剩余。简单来说,消费者剩余是个人愿意为某项服务支付的最高金额与实际支付的价格之间的差额。例如,我愿意为每月ChatGPT订阅支付100美元,但我只支付20美元,所以消费者剩余是80美元。
在规模上,正如Collis和Brynjolfsson(2025年)所做的研究发现,消费者剩余在美国 Alone至少为970亿美元。据他们的研究,人们需要被支付98美元,平均每月,才能停止使用生成性AI一个月。ChatGPT在工作和非工作背景下的价值对于用户来说是巨大的,可以肯定地说,在企业环境中,财务收益会更大。
为什么提问?
当我研究了这份报告背后的团队,并(惊喜!)邀请Perplexity与我一起思考这份报告时,我不禁想知道人们为什么会使用ChatGPT进行“提问”而不是“执行”。
用更科学的术语来说,我想引用报告中提到的研究。Ide和Talamas(2025年)提出了AI在工作场所扮演的两个角色:同事,它完成交付成果,即工作,以及副驾驶,它增强了问题解决能力,而没有任何最终输出。来自“人们如何使用ChatGPT”的数据支持了副驾驶范式:再次,人们提问而不是使用ChatGPT(49% vs 40%),提问正在增加,并且“做出决定和解决问题”在每个调查职业群体中排名最高的工作活动。简而言之,ChatGPT提供了建议而不是工作的大多数情况下。
那么,AI为什么会这样?滚动浏览LinkedIn,你会看到“自动化这个”和“自动化那个”。
我也思考过这个问题,当我读到报告和数百个来自AI爱好者的LinkedIn帖子时,他们发现了最终的脚本来让AI工作。我的假设是,ChatGPT上“提问”类型比“执行”类型占主导地位的现象可能只是反映了模型的当前(或过去)局限性,而不是基本的公共偏好,偏爱AI作为副驾驶。有可能,一旦有真正强大的代理AI解决方案,用户就会越来越多地将AI采用为真正的同事,而不是顾问。简单来说,人们想使用AI作为同事,但仍然存在一些限制。
根据我的经验和我在客户开发访谈中听到的内容,我假设AI尚未克服的一个严重缺点是缺乏上下文。第二,它并非所有工作都可以分解为一个简单的提示(或者我只是不够耐心)。
让我详细解释这两点。由于AI缺乏上下文,因此在内容创作方面无法让它自由发挥。它需要被监控,提示可能需要被修改以获得更好的结果。 IBM 用科学术语解释了这个想法。人类通过不断的感知、记忆和现实世界经验积累了丰富的环境理解,而AI助手则仅仅根据固定“上下文窗口”的最近输入预测下一个令牌(~单词)。AI具有短期记忆,一旦记忆容量被填满,早期信息就会丢失。
大型语言模型在处理多步骤复杂任务时存在困难。随着任务的组合,性能和连贯性会降低,Prompt Drive 解释了这一点。有一个方法可以克服这种限制,即所谓的分而治之的方法。然而,它承认没有单一提示可以捕捉所有细微差别,因此AI仍然是一个优秀的副驾驶,同时也是一个有限的同事。
现在,我一直在思考ChatGPT的领域。这种比例(49% vs 40%)是否会在其他AI工具中得到复制?
- 根据 App Labx 的说法,60% 发送给 Perplexity AI 的消息是研究驱动的请求,而不是纯粹的内容生成。
- DeepSeek R1 作为高级同事,在逻辑任务和链式思考辅助方面表现出色,根据 其内部报告。
- GitHub Co-pilot(名字中就有提示,对吧?)旨在为代码、调试和学习辅助提供编辑建议。可以肯定地说,它的作用是辅助而不是执行。
- Microsoft Copilot 显示出“提问”和“执行”之间的差距大致相等,反映了 ChatGPT 的使用模式。
那么,发现结果留给我们什么?在我看来,AI是知识密集型工作的强大助推器,能够加速决策并转化为直接的时间节省和间接的收入收益。抵制AI以“人情味”或“独特内容”为由意味着长期失败。人们使用ChatGPT和其他AI助手来推进决策,而不是完全取代人类决策者。
这种模式会改变吗?人们会因为将工作越来越多地委托给AI而看到大规模的脑力衰退吗?请关注我的下一篇文章,关于AI如何影响人类大脑和认知能力。












