Anderson 视角

AI一遍又一遍引用相同的论文——就像人类一样

mm
将 Unite.AI 添加到您在 Google 上的首选来源
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPT和其他AI写作工具可能正在悄悄地把科学变成一场人气竞赛:它们反复把研究人员引向同一批论文,却忽略了真正可能推动领域发展的新颖研究。

单一化从频率和统计的角度看,是指同一小批来源或资源反复出现,淹没新的声音和视角:电台节目反复播放有限的一组歌曲,机场书架摆放同一批作者和书籍,超市销售有限种类的水果和蔬菜:

是的,我们有这些香蕉——而且只有这些香蕉。西方食品供应链中的果蔬同质化忽略了每类作物中数百种其他品种的可能性,因为为多种果蔬建立工业化生产和运输链的成本过高。来源

是的,我们有这些香蕉——而且只有这些香蕉。西方食品供应链中的果蔬同质化忽略了每类作物中数百种其他品种的可能性,因为为多种果蔬建立工业化生产和运输链的成本过高。来源

新科学研究中的引用也有这种现象。研究人员或许出于省事,默认采用一批“可靠”的来源,这些来源不断积累影响力,最终开始主导某些研究方向。

这被称为马太效应:一种认为既有优势者总会继续受益的社会学理论。人们将它与《马太福音》13:12中的承诺相比,该经文写道:“凡有的,还要加给他,使他有余;凡没有的,连他所有的,也要夺去。”

备受青睐的圈子

对于AI辅助研究,人们曾寄予的一大厚望是,新机器学习方法能够摆脱马太效应,也就是人气偏差,开始引用知名度较低、但可能更深刻或更切合论文论点的研究。

然而,从AI训练流程解读数据集的方式来看,这种乐观从来缺乏充分依据。研究也反复发现,当AI没有直接编造引用——迄今仍是个长期问题——它确实在像人类一样延续马太效应,尽管原因可能不同。

训练期间,模型会学会给训练集中引用最多、或重复出现最多的论文更高排名,因为训练流程旨在提取有意义的模式,并将离群值降低权重,视为“噪声”或统计异常。

在这种机制下,即使出现相当于爱因斯坦相对论的成果,也不会获得机器的关注。机器一旦训练完成,就仿佛已经找到了原则和参照,只能通过RAG接触较新的文献,或借助其他超出已训练矩阵范围的方式,小幅调整立场。

问题是,它不会像对待早已熟悉的“老宠儿”那样认可这些新成果,甚至可能完全不予认可,因为统计偏差此时已根深蒂固。

因此,AI延续马太效应时,并不是在真正观察和模仿人类行为。它只是统计研究人员省事地反复引用相同旧论文的次数,然后同样给这些论文较高排名。从这个角度看,引用重复问题与从不断膨胀的AI研究文献洪流中挑选真正有趣的科学论文这一难题有关:最出色的研究往往发出的信号最弱。

诊断引用单一化

美国一篇有意思的新论文《When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models》讨论了这个问题。这项由得克萨斯大学奥斯汀分校、史蒂文斯理工学院、圣路易斯华盛顿大学、莱斯大学和圣母大学合作完成的研究,试图明确证明机器学习中存在引用单一化,以便未来有可能直接处理其影响因素和问题本身。

测试中,作者发现,OpenAI、Google和Anthropic的11个模型反复偏爱同一小批论文,即使明显的人气信号已经被移除。

为检验这一点,研究人员从120篇真实论文中去除了引用次数和发表渠道,替换作者姓名,并随机重新分配发表年份。随后,每个模型看到随机抽取的30篇论文,最多只能引用其中10篇。

相关领域的8位人类专家看到了相同的匿名论文,却没有像AI一样集中偏爱同一批论文。这表明偏差是AI模型特有的,而非论文自身造成的:

新论文中的测试结果,比较AI模型和人类专家的引用选择。全部11个模型的引用都集中于较小的一组论文,同时某些论文反复被完全忽略。人类专家没有表现出这两种倾向。来源

新论文中的测试结果,比较AI模型和人类专家的引用选择。全部11个模型的引用都集中于较小的一组论文,同时某些论文反复被完全忽略。人类专家没有表现出这两种倾向。来源

即使只要求模型选择参考文献,同样的论文仍然受到青睐,说明撰写综述本身不是偏差的原因。

实验随后扩展为11轮,每轮结束后加入120篇AI撰写的论文,以检验当AI生成研究不断增加时,这些共同偏好会产生什么结果。

随着更多AI论文加入,模型的引用越来越集中于数量不断缩减的原始人类论文。

作者指出:

“随着语言模型从起草文字走向通过工具调用运行文献检索代理,虚构参考文献变得更容易识别和限制。

“更难处理的失败发生在所有候选文献都真实存在之后:不同模型仍可能选择同一狭窄子集,在没有任何一条引用本身错误的情况下造成引用单一化。”

论文认为,单纯混用不同厂商的模型,或给予论文同等曝光,并不足以解决问题,因为大量偏好在模型之间是共享的。真正需要改变的是对特定论文的底层偏好,一种可能的方法是有意提高被忽视论文的显著性。不过,作者强调,这种方法尚未经测试。

测试方法

基准由从arXiv收集的120篇真实知识蒸馏论文构成,发表时间为2015年至2022年。收集时,每篇论文有50至500次引用;这一范围旨在排除鲜为人知以及影响力格外大的研究。

实验首先从论文集中随机抽取30篇,隐藏作者姓名、发表年份和引用次数。每个模型生成一篇简短综述或观点文章,最多引用10篇论文,然后将这些选择与从相同材料中随机选择的结果进行比较:

引用偏好测试方法示意图。模型看到随机选取、身份信息已隐藏的30篇论文,最多可引用10篇。研究人员将其选择与随机选择比较;每轮还向下一轮论文集加入120篇AI撰写的论文。

引用偏好测试方法示意图。模型看到随机选取、身份信息已隐藏的30篇论文,最多可引用10篇。研究人员将其选择与随机选择比较;每轮还向下一轮论文集加入120篇AI撰写的论文。

扩展实验中,每轮结束后都有120篇新生成的论文进入论文集,逐步提高AI研究所占比例。

初步测试中,模型倾向于引用看到的大多数论文,通常从30篇中选择22至27篇。因此,研究人员在主实验中将引用上限设为10篇,迫使模型更有选择性。

以下是最终实验设计的概览:

引用偏好的实验设置。研究从120篇真实论文开始,测试三家厂商的11个模型,使用随机的30篇论文组合,最多引用10篇。后续轮次加入AI生成论文,使论文集扩大到1,440篇。

引用偏好的实验设置。研究从120篇真实论文开始,测试三家厂商的11个模型,使用随机的30篇论文组合,最多引用10篇。后续轮次加入AI生成论文,使论文集扩大到1,440篇。

初始实验使用三大厂商的11个模型。OpenAI的模型为GPT-5、GPT-5 mini、GPT-4.1和GPT-4.1 mini;Google的模型为Gemini 2.5 Pro、Gemini 2.5 Flash、Gemini 3.1 Pro和Gemini 3.1 Flash-Lite;Anthropic的模型为Claude Opus 4.8、Claude Sonnet 4.6和Claude Haiku 4.5。

下方测试结果展示各模型将引用集中于少量论文的程度、完全忽略的论文数量,以及重复实验时做出相同选择的一致性:

测试结果显示,各模型对特定论文的引用集中程度,以及完全忽略了多少论文。“Top-10% share”表示最受青睐的12篇论文获得的引用份额;“HHI”衡量总体引用集中度;“Reliability”表示同一模型在不同测试中偏爱相同论文的一致性;ρ表示不同模型之间这些偏好的相似程度。“Matched null”行表示随机选择论文时的预期结果。

测试结果显示,各模型对特定论文的引用集中程度,以及完全忽略了多少论文。“Top-10% share”表示最受青睐的12篇论文获得的引用份额;“HHI”衡量总体引用集中度;“Reliability”表示同一模型在不同测试中偏爱相同论文的一致性;ρ表示不同模型之间这些偏好的相似程度。“Matched null”行表示随机选择论文时的预期结果。

模型究竟偏爱什么?

研究发现,偏好主要由论文自身的内容驱动。例如,对于GPT-5 mini,哪些论文受青睐这一差异中约90%可归因于内容,而非列表顺序、生成噪声或附加的虚构元数据。GPT-4.1 mini也重现了这种“内容占主导”的效应。

即使在保留含义的同时大幅改写标题和摘要,偏好图谱也几乎没有变化。四次成功的改写测试得到0.95至0.99的相关系数,尽管改写使用了三家厂商的不同模型。

只有当底层含义出现可测量的改变时,偏好图谱才发生变化:

11个模型之间的引用偏好比较。数值表示每对模型偏爱相同论文的接近程度,数值越高,一致性越强。尽管模型和厂商不同,整个模型组仍表现出大致相似的偏好。

11个模型之间的引用偏好比较。数值表示每对模型偏爱相同论文的接近程度,数值越高,一致性越强。尽管模型和厂商不同,整个模型组仍表现出大致相似的偏好。

因此,模型似乎主要响应语义内容,而不是具体措辞。不过,研究未能最终确定它们为何如此一致。

作者认为,一种可能是模型在训练期间吸收了共同的引用共识。另一种可能是,它们独立形成了对于什么论文“值得引用”的相似判断。

因此,共享偏好的存在已得到证实,但其最终来源仍不清楚。

作者指出,研究中广泛使用AI可能缩小受关注成果的范围,因为不同模型往往偏爱许多相同论文。随着AI生成文献不断积累,这些共同偏好可能通过重复引用进一步强化,使不受青睐的研究越来越难被发现。因此,引用多样性和引用集中度监测被提出作为可能的防护措施。

该研究用于递归引用集中度测试的基准现已在GitHub上提供。

结论

观点

作为每周阅读大量AI研究论文的人,我见过一波又一波“引用浪潮”。一个经久不衰的常客是Google的Attention Is All You Need,也就是最初的Transformer论文,如今它恐怕已经被硬编码进投稿模板了。

长期反复出现的另一篇论文是2014年的Generative Adversarial Networks,不过其出现频率最终被Denoising Diffusion Probabilistic Models和其他基于扩散的奠基研究取代。

几乎在所有情况下,这些“反复出现”的引用本身并没有错,但其范围往往过于宽泛,无法有效支持引用它们的论文。从这个意义上说,它们有点像“引用洗白”:加入“可靠”但主要起装饰作用的来源引文,以较低的投入营造可信感。

首次发表于2026年8月24日星期一。欧洲东部时间23:07修订,补上遗漏的复数形式。

机器学习撰稿人,专注于人类图像合成的领域专家。曾任 Metaphysic.ai 的研究内容负责人,直至其并入 DNEG 的 Brahma.ai。
网站: martinanderson.ai
联系:martin@martinanderson.ai