Anderson 视角
AI 一遍又一遍引用相同的论文——就像人类一样

ChatGPT 和其他 AI 写作工具可能正在悄悄把科学变成一场人气竞争,反复引导研究者引用相同的论文,却忽视那些真正能够推动领域进步的全新作品。
Monoculture,在频率和统计学上指相同的有限来源或资产一次又一次地重复出现,淹没了新颖的声音和新鲜的视角:广播编排中相同的有限歌曲集合;机场书架上相同的作者和图书群体;以及超市中相同的受限的水果蔬菜选择:

是的,这些香蕉只有这些。西方食品链中水果和蔬菜的同质化忽视了每种情况下数百种其他物种的可能性,因为各种代谢和运输链对于多样化的水果或蔬菜来说成本过高,难以实现工业化。 Source
这种情况同样出现在新科学研究中的引用里,研究者可能出于懒惰,默认使用一套‘可靠’的来源,这些来源随着时间获得势头,直至主导研究的多个分支。
这被称为马太效应——一种社会学理论,认为在位者将永远受益;该综合症被比作《马太福音》13:12中的承诺,指出‘拥有的会被加给他们,且他们会拥有丰盛;没有的,连他们拥有的也会被夺走’。
人群中的热点
AI 增强研究的一大期望是新机器学习方法能够突破马太效应——亦称流行度偏差——并开始引用那些可能更具洞察力或更贴合论文论点的鲜为人知的作品。
然而,依据 AI 训练程序对数据集的解释方式,这种乐观从未有过充分依据;反复发现,当 AI 并未直接捏造引用时——这至今仍是长期存在的问题——它实际上在延续马太效应,正如人类一样——尽管原因可能并不相同。
在训练过程中,模型会学习对训练集里被引用次数最多(或‘最常重复’)的论文给予高排名,因为训练程序旨在提取有意义的模式,并将异常值视为‘噪声’或统计异常。
在这种体制下,爱因斯坦相对论等同等理论永远不会受到机器的关注;模型一旦训练完毕,便认为已找到其原理和参照,只能通过RAG或其他扩展模型超出训练矩阵的手段,轻微地接触更新的出版物来稍作调整。
问题在于,它不会像对已知的‘旧爱好’那样,甚至根本不对这些新作品给予认可,因为其统计偏见已深深根植。
因此,AI 在延续马太效应时并非真正观察并模仿人类行为——它只是统计研究者懒散地默认相同旧论文的次数,并同样给予这些论文高排名。在这方面,引用重复的问题与从不断增长的 AI 研究出版物的浩如烟海中挑选真正有趣的科学论文的挑战相关,因为最强的工作往往信号最弱。
诊断单一化
该问题在美国一篇有趣的新论文中得到探讨,题为当 AI 写作时,谁被引用?跨语言模型的引用单一化证据。这项新工作由德克萨斯大学奥斯汀分校、史蒂文斯理工学院、华盛顿大学圣路易斯分校、莱斯大学以及圣母大学合作完成,旨在明确证明机器学习中的引用单一化现象,以便未来能够直接针对其变量以及该问题本身进行处理。
在测试中,作者发现来自 OpenAI、Google 和 Anthropic 的十一种模型反复偏好同一小组论文——即使在剔除明显的流行度信号后仍如此。
为检验此点,研究者将 120 篇真实论文去除引用次数和出版渠道,同时替换作者姓名,并随机重新分配出版年份。随后向每个模型展示随机挑选的三十篇论文,模型最多只能引用十篇。
八位相关领域的人类专家也获得了相同的盲审论文,但没有与 AI 达成相同的偏好,表明这种偏差特定于 AI 模型而非论文本身:

来自新论文的测试结果,比较 AI 模型与人类专家的引用选择。所有十一种模型的引用集中在少数论文上,而有些论文则被完全忽视。人类专家则没有表现出这种倾向。 Source
即使模型仅被要求选择参考文献,这些相同的论文仍保持受欢迎,表明撰写综述本身并未导致偏差。
随后实验扩展至十一轮,每轮后加入 120 篇 AI 撰写的论文,以测试在不断增长的 AI 生成研究池中,这些共享偏好会产生何种影响。
随着更多 AI 撰写的论文加入,模型对原始人类论文的引用愈发集中于越来越少的几篇。
‘随着语言模型从撰写文字转向使用工具调用运行文献检索代理,捏造的参考文献变得更容易被捕获和限制。’
‘更棘手的失败在于每个候选文献都是真实的:不同模型仍可能选择相同的狭窄子集,导致引用单一化,即使没有任何单一引用是错误的。’
为缓解该问题,论文认为仅仅混合不同供应商的模型或让论文获得同等曝光并不足够,因为大部分偏好在模型间是共享的。相反,需要改变对特定论文的根本偏好——可能通过有意提升被忽视论文的可见度。然而,作者强调此方法尚未经过检验。
测试方法
该基准由 120 篇真实的知识蒸馏论文构成,收集自 arXiv,出版时间介于 2015 至 2022 年。每篇论文在收集时的引用次数在 50 到 500 之间,此范围旨在排除既晦涩又极具影响力的工作。
实验首先从可用集合中随机抽取三十篇论文,隐藏作者姓名、出版年份和引用次数。每个模型生成一篇不超过十篇引用的简短综述或立场文章,并将这些选择与同一材料的随机抽取进行比较:

用于测试引用偏好的方法示意图。随机选取的三十篇论文展示给隐藏身份信息的模型,随后模型可引用最多十篇。其选择与随机抽取进行比较,同时每轮向下一轮的集合中加入 120 篇 AI 撰写的论文。
在扩展实验中,每轮结束后会向集合中加入 120 篇新生成的论文,逐步提升 AI 撰写研究的比例。
初步测试中,模型倾向于引用大多数展示给它们的论文,通常选取 30 篇中的 22 至 27 篇。因此研究者为主实验设定了十篇引用的上限,迫使模型做出更具选择性的决定。
以下是实验设计的概要:

用于测试引用偏好的实验设置。研究从 120 篇真实论文开始,测试来自三家供应商的十一种模型,使用随机抽取的 30 篇论文并限制最多十篇引用。后续轮次加入 AI 生成的论文,使集合扩展至 1,440 篇。
初始实验使用了来自三大供应商的十一种模型: OpenAI 代表为GPT-5、GPT-5 mini、GPT-4.1和GPT-4.1 mini;Google 代表为Gemini 2.5 Pro、Gemini 2.5 Flash、Gemini 3.1 Pro和Gemini 3.1 Flash-Lite;Anthropic 代表为Claude Opus 4.8、Claude Sonnet 4.6和Claude Haiku 4.5。
下方的测试结果展示了每个模型将引用集中在少数论文上的程度;完全忽视了多少论文;以及在实验重复时保持相同选择的一致性:

测试结果显示每个模型在特定论文上的引用集中程度以及完全忽视的论文数量。‘Top-10% share’显示前 12 篇最受青睐论文获得的引用比例,‘HHI’衡量整体引用的集中度。‘Reliability’显示每个模型在不同测试中偏好相同论文的一致性,ρ 显示模型之间偏好相似度。‘Matched null’行表示若随机选择论文应得到的预期结果。
模型到底在偏好什么?
研究发现,这种偏好主要由论文本身的内容驱动。例如,对于 GPT-5 mini,约 90% 的偏好差异可归因于内容,而非列表顺序、生成噪声或每篇论文附带的捏造元数据。相同的‘内容主导’效应在 GPT-4.1 mini 中亦得到复现。
当对标题和摘要进行大幅改写但保持其意义不变时,偏好图(见下)几乎未发生变化。四次成功的改写测试中,相关系数达到 0.95–0.99,尽管改写使用的是三家供应商的不同模型。
仅当底层含义发生可测量的改变时,偏好图才出现变化:

测试结果比较十一种模型的引用偏好。数字表示每对模型在相同论文上的偏好相似度,数值越高表明一致性越高。尽管模型和供应商之间存在差异,整体上仍呈现出相似的偏好。
因此,模型似乎主要响应语义内容,而非特定措辞。然而,导致它们高度一致的原因尚未得到确定性结论。
作者指出,一种可能是共同的引用共识在训练过程中被吸收。另一种可能是对何为‘可引用’论文的相似判断可能独立形成。
因此,已确认共享偏好的存在,但其根本来源仍未知。
作者指出,AI 在研究中的广泛使用可能会缩小受到关注的工作范围,因为不同模型倾向于偏好许多相同的论文;随着 AI 生成文献的积累,这些共享偏好可能通过重复引用进一步强化,使得不受青睐的研究越来越难以被发现。因此,引用多样性以及对引用集中度的监测被提出作为可能的防护措施。
该研究用于递归引用集中度的基准现已在GitHub上提供。
结论
观点作为每周阅读大量 AI 研究论文的人,我见证了‘引用浪潮’的起伏。一个长期屹立不倒的例子是 Google 的Attention Is All You Need,即原始的 Transformer 论文,如今几乎已硬编码进投稿模板。
另一个长期重复出现的例子是 2014 年的Generative Adversarial Networks,尽管随后其引用频率被Denoising Diffusion Probabilistic Models以及其他基于扩散的支柱研究所取代。
在几乎所有情况下,这些‘重复’引用本身并非错误;但它们往往范围过于宽泛,难以为被引用的论文提供有价值的支撑;从这个意义上说,它们类似于‘引用洗白’——引入‘可靠’但主要起装饰作用的来源引用,以低成本营造可信感。
首次发布于2026年8月24日,星期一












