Anderson 视角
AI 说服人们捐赠几乎是人类筹款者捐赠的 3 倍

一项新的牛津大学领导的研究表明,领先的语言模型可以比专业的筹款者筹集到更多的钱,并且可以在所有其他说服形式中可靠地击败人类。
一项新的英国-美国研究发现,前沿语言模型比受过训练的专业人士更有效地说服人们,后者专门从事改变人们想法的工作。
在一次真实的筹款测试中,研究人员发现,AI 能够说服人们捐赠大约 17.2% 的可用资金,而专业的人类募捐者只有 6.4% 的捐赠率——这是一个 10.8 个百分点的差距,大约相当于 AI 下的捐赠率的 2.7 倍,参与度更高,平均捐赠金额也更大,两者都有助于造成这种差异。
该论文指出:
‘值得注意的是,尽管 AI 被明确指示只遵循影响效率策略,但它在其他六种机制上也优于人类募捐者,这些机制它没有被提示使用。 ‘
‘[人类] 说服者认为 AI 的论点更有力,教会了他们更多的知识,并且比 [募捐者] 更富有同情心和愉快的交谈。 ‘
‘这些结果一起表明,AI 在广泛的捐赠相关机制中超越了专业的人类,并表明 AI 的态度说服优势延伸到了现实世界的行为。 ‘
作者推测,测试模型的出色性能——包括 Claude Opus、ChatGPT、Grok 和 Google Gemini 的专业版本——可能归因于信息传递给受访者的密度和速度;当 AI 被迫降低到“人类速度”时,其优势几乎消失:
‘我们发现了相互一致的证据,表明 AI 的优势来自于快速部署大量信息:在指导之后,专业的人类可以与受限于人类速度和人类长度的 AI 系统并驾齐驱。 ‘
该论文还报告称,在测试的 318 名个人人类说服者中,没有一个能够超越平均 AI 系统的性能——即使一些参与者接受了 基于 AI 自身技术的专门培训。
作者总结道:
‘我们的结果意味着我们正在进入一个世界,在那里 AI 为人类行为者提供了大量熟练的辩护。预测这种变化的后果是具有挑战性的,因为它需要我们对谁将拥有最有说服力的 AI 技术、谁将成为说服的目标以及可能减少 AI 说服对人类人口影响的管辖权障碍、保障措施或其他摩擦做出假设。 ‘
‘AI 可以说服甚至专业人类的影响之一可能是,已经强大的行为者会巩固他们的影响力。 ‘
这篇 新论文 的标题是 AI 系统超越专业人类,来自牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦经济政治学院的八位研究人员。
方法和研究
核心结果来自四项实验:说服选民和专家辩论者;测试指导和速度限制作为人类/ AI 的“平衡器”;与专业募捐者在政治问题上竞争;以及 与他们竞争真正的慈善捐赠。
该研究使用了 18,978 次对话和 6,923 人,领先的 AI 模型与不同水平的人类专家进行对比,从每小时 12 英镑的雇佣人群工人到每小时 140 英镑 + 可赚取奖金的经验丰富的人类说服者,并且他们可以提前一周研究这些会议。
测试中使用的模型包括 Claude Opus 4.1 和 4.6,ChatGPT-4o,GPT-5.4,Grok 4.20 和 Gemini 2.5 Pro。
精英辩论对决
第一项实验检查了 AI 是否可以在一对一对话中超越日益熟练的人类说服者,讨论政治和社会问题:

政治和社会政策问题,参与者讨论一个随机分配的问题,在对话之前和之后。这些话题被选取以涵盖广泛的有争议的公共辩论,从移民、言论自由和社交媒体监管到福利政策、辅助死亡和君主制的未来。 来源
参与者首先被要求对其中一个英国政策问题(如上所示)发表意见,然后被分配一个 AI 或人类对话伙伴。在讨论结束后,通常持续约 14 分钟,他们被要求再次评估他们的立场。
测试了三个人类群体,普通工人从 Prolific 人群平台招募,提供了一个基准,支付每小时 12 英镑。第二组由 1,100 多名参与者和近 9,500 次对话的四轮说服锦标赛中表现最强的选手组成。第三组由 56 名精英竞争辩论者组成,他们都至少进入过一次重大国际比赛的半决赛,其中包括四位世界冠军、11 位大陆冠军,平均有 8.9 年的辩论经验。
为使人类说服者处于有利条件,锦标赛获胜者和精英辩论者为可观的现金奖金而竞争,最高可达 11,000 英镑,而辩论者可以选择他们认为自己可以有效辩论的议题,并且可以提前研究这些话题。平均每位辩论者花费大约八个小时准备这些对话。
即使这样,AI 在每个比较中都取得了最强的结果:

估计的说服效果,测量为对话后在有争议的政策问题上的平均态度变化。
结果图表中的红色标记表示前沿 AI 模型。在所有比较中,这些模型都比任何人类群体产生了更大的态度转变。
人类最强的表现来自精英辩论者——但即使他们也落后于不受限制的 AI 系统。当 AI 被限制在人类书写速度和消息长度时,其优势几乎消失,表明快速信息传递可能是人类和 AI 说服力差异的主要原因。
LLM 能够超过普通参与者 8.2 个百分点,并且超过锦标赛选定的说服者 5.6 个百分点。与 精英 辩论者的差距最小——他们自己也产生了大量的态度转变——但 AI 仍然能够获得 4.6 个百分点的优势。
人类是否可以学会击败 AI?
第二项实验探讨了 AI 是否可以被消除,或者通过限制 AI 本身。为了测试第一种可能性,43 名精英辩论者从第一项研究中返回,接受了基于 AI 使用的技术 的额外培训。
参与者审查了记录,检查了如何构造 AI 提示,并在两次四小时的指导课程中练习了替代的说服方法,然后在相同的条件下再次竞争。
指导产生了明显的行为变化,人类辩论者使用了更多的词语,引入了更多可核实的说法,并实现了研究中观察到的最大态度转变。指导提高了表现,并产生了研究中观察到的最强的人类结果,但差距仍然是统计学上显著的,受过指导的辩论者仍然落后于不受限制的 AI 系统(如下表所示):
研究人员测试了 AI 的性能是否依赖于响应速度和消息长度,通过限制 AI 到人类书写速度和消息长度。在这些条件下,受过指导的辩论者和受限的 AI 产生了类似的结果:

指导和 AI 速度限制对说服性能的影响。上面板比较了精英辩论者、受过指导的精英辩论者和一个受限于人类书写速度和消息长度的 AI 系统。下面板显示了第一项和第二项研究中个别说服者的估计性能分布。虽然指导提高了结果,但没有任何人类群体能够匹配平均不受限制的 AI 系统,而限制 AI 到人类吞吐量则消除了其优势。
这一发现得到了对前两项研究中所有 318 名人类说服者的更广泛分析的支持:没有一个人超过了平均不受限制的 AI 系统的性能,无论经验水平、问题领域或人口统计子组如何。
专业说服者是否可以击败 AI?
第三项研究考虑了 AI 是否可以在现实世界的环境中保持其优势,面对那些将说服他人作为职业的人,而不是学术辩论比赛。
研究人员招募了 19 名来自英国筹款公司 AppcoUK 的专业募捐者。这些参与者与前几项实验中的辩论者不同,他们有大量的实际筹款经验,职业生涯中平均有大约 10,000 次说服对话。每人每小时支付 140 英镑,提前一周收到政策话题,并为相同的基于绩效的奖金而竞争,这些奖金在研究的其他地方也被使用。
即使面对这一群体,AI 仍然更具说服力(见前面的结果)。专业募捐者将意见转变了 6.9 个百分点,与对照组相比——但 AI 产生了 12.8 个百分点的转变,给予它 5.9 个百分点的优势。
AI 是否可以说服人们打开钱包?
第四项也是最后一项研究检查了真实的筹款,而不是改变的观点。研究人员与 AppcoUK 合作,这次专注于 拯救儿童,一家慈善机构,AppcoUK 之前曾为其筹集了 2016 年至 2023 年间的 824,297 英镑,来自 22,583 名捐赠者。
参与者与 Claude Opus 4.6 或 18 名专业募捐者之一交谈。然后,他们收到了一英镑的研究奖金,可以将任何金额捐赠给拯救儿童。其中七种方法(见下图),Claude Opus 4.6 被指示使用 影响效率信息,解释了个人捐赠如何转化为慈善机构的可衡量结果。
AI 产生了比专业募捐者更大的捐赠效果,捐赠增加了 17.2 个百分点,与对照组相比,募捐者只有 6.4 个百分点的捐赠增加:

第四项研究中的捐赠结果和参与者评分。左面板比较了与专业募捐者和 Claude Opus 4.6 交谈后的一英镑研究奖金的百分比。右面板比较了七项捐赠相关机制的参与者评分,AI 在所有七项机制中都获得了更高的评分。
差异出现在参与者捐赠的比例和捐赠者平均捐赠金额中。
参与者还将 AI 评为比人类募捐者更高,在一系列与捐赠相关的措施中,最大差异出现在 实施意图、承诺升级 和 感知影响效率 上。
根据论文,早期研究中与 AI 优势相关的信息重点方法也与这一项筹款实验中的慈善捐赠增加有关。
结论
虽然作者如前所述得出结论,研究结果令人担忧,但他们补充说,小型玩家也可能通过类似的方式获得最新和最佳的 AI 技术的访问权。
这种结果的隐含意义是,最佳模型可能会随着时间的推移被拒绝给较小的玩家。
首次发表于 2026 年 6 月 18 日,星期四












