Andersonの視点
AIは同じ論文を何度も引用する – 人間と同様に

ChatGPTなどのAI執筆ツールは、新しく独創的で分野の発展につながる研究を見落とす一方、研究者を繰り返し同じ論文へと誘導し、科学をひそかに人気競争へ変えつつあるのかもしれない。
頻度や統計の観点でいう単一化とは、限られた同じ情報源や資源が何度も登場し、新しい声や視点をかき消すことだ。ラジオ番組では限られた楽曲が繰り返され、空港の書棚には同じ著者や書籍が並び、スーパーの果物や野菜も限られた種類に偏る。

確かにバナナはある。ただし、このバナナしかない。欧米の食品供給網における果物や野菜の均一化は、それぞれに存在する何百もの別の品種の可能性を無視している。多様な果物や野菜に対応する生産・輸送網を工業化するには、費用がかかりすぎるためだ。出典
新しい科学研究に登場する引用でも同じことが起きる。研究者は、場合によっては手間を省くため、「信頼できる」一定の情報源を常用する。その情報源は勢いを増し、やがて研究の流れを支配するようになる。
これはマタイ効果と呼ばれ、すでに優位にある者が引き続き利益を得るとする社会学の理論だ。この現象は『マタイによる福音書』13章12節の約束になぞらえられる。そこにはこう書かれている。「持っている人はさらに与えられ、豊かになる。持っていない人は、持っているものまでも取り上げられる」。
好まれる顔ぶれ
AIを活用した研究に寄せられた大きな期待の一つは、新しい機械学習手法がマタイ効果、すなわち人気バイアスから抜け出し、知名度は低くても洞察に富み、論文の論点により適した研究を引用するようになることだった。
しかし、AIの訓練処理がデータセットを解釈する仕組みを考えると、こうした楽観を十分に裏づける理由は最初からなかった。AIが引用をでっち上げていない場合でも、それ自体が今なお慢性的な問題だが、人間と同じようにマタイ効果を持続させていることが繰り返し確認されている。ただし、その理由は同じとは限らない。
訓練中、モデルは訓練データで最も引用が多い、あるいは最も頻繁に繰り返される論文を高く評価するよう学ぶ。訓練処理は意味のあるパターンを引き出し、外れ値を軽視して「ノイズ」や統計的異常とみなすよう設計されているからだ。
この仕組みでは、アインシュタインの相対性理論に匹敵する研究でさえ、機械の注目を集められないだろう。機械は訓練を終えると、すでに原則や参照先を見つけたかのように振る舞い、RAGで新しい文献にアクセスするか、訓練済みの行列の外へ到達する別の手段を使って、立場をわずかに修正することしかできない。
問題は、統計的な偏りがすでに深く定着しているため、そうした新しい研究を、以前から知っていた「お気に入り」と同等には評価せず、まったく評価しない場合さえあることだ。
したがって、AIがマタイ効果を持続させるとき、実際に人間の行動を観察し模倣しているわけではない。研究者が手間を省いて同じ古い論文に頼る回数を数え、その論文を同じように高く順位づけているだけだ。この点で、引用の反復は、増え続けるAI研究論文の吹雪から本当に興味深い科学論文を選び出す難しさとつながっている。最も優れた研究ほど、発する信号が弱いことがあるからだ。
引用の単一化を診断する
この問題を扱う米国の興味深い新論文が『When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models』だ。テキサス大学オースティン校、スティーブンス工科大学、セントルイス・ワシントン大学、ライス大学、ノートルダム大学の共同研究で、機械学習に引用の単一化が存在することを明確に実証し、将来、その要因と問題そのものに直接対処できるようにすることを目指している。
著者らは実験で、OpenAI、Google、Anthropicの11モデルが、明白な人気の手掛かりを取り除いた後も、同じ少数の論文を繰り返し好むことを発見した。
実験では、実在する120本の論文から引用数と発表媒体の情報を削除し、著者名を置き換え、発表年を無作為に割り当て直した。その後、無作為に選んだ30本ずつを各モデルに提示し、引用を最大10本に制限した。
同じ匿名化された論文を関連分野の人間の専門家8人にも提示したが、専門家はAIと同じお気に入りへ収束しなかった。これは、偏りが論文自体ではなくAIモデルに固有であることを示している。

新論文に掲載された、AIモデルと人間の専門家による引用選択の比較結果。11モデルすべてで引用は少数の論文に集中し、一部の論文は繰り返し完全に無視された。人間の専門家には、どちらの傾向も見られなかった。出典
モデルに参考文献の選択だけを求めても同じ論文が人気を保ったため、レビューを書く行為そのものが偏りの原因ではないと分かった。
実験はその後11ラウンドに拡張され、各ラウンドの終了後にAIが書いた論文120本を追加した。AI生成研究が増え続ける集団の中で、共通の選好が働くと何が起きるかを調べるためだ。
AI論文が増えるにつれ、モデルの引用は、元の人間による論文のうち、ますます少数のものへ集中していった。
著者らは次のように述べている。
「言語モデルが文章の草稿作成から、ツール呼び出しを使う文献検索エージェントの実行へ移行するにつれ、架空の参考文献は検出し、抑制しやすくなっている。
「より難しい失敗は、候補がすべて実在するようになった後に始まる。異なるモデルがなお同じ狭い部分集合を選び、一つ一つの引用に誤りがなくても、引用の単一化を生む可能性がある」。
対策について論文は、異なる提供元のモデルを混ぜたり、論文に均等な露出を与えたりするだけでは足りないと論じる。選好の多くがモデル間で共有されているからだ。必要なのは、特定の論文を好む根本的な傾向を変えることだろう。例えば、無視されてきた論文を意図的に目立たせる方法が考えられる。ただし著者らは、この方法は未検証だと強調している。
実験の方法
ベンチマークには、arXivから収集した2015~2022年発表の、実在する知識蒸留論文120本を用いた。収集時の引用数は各50~500件で、ほとんど知られていない研究と、突出して影響力のある研究の両方を除くために、この範囲が選ばれた。
まず論文集合から30本を無作為に抽出し、著者名、発表年、引用数を隠した。各モデルは最大10本を引用する短いレビューまたは立場を論じる文章を作成し、その選択を同じ資料からの無作為選択と比較した。

引用選好を調べる手法の模式図。識別情報を隠した30本の論文を無作為に選んでモデルに提示し、最大10本を引用させた。結果を無作為選択と比較するとともに、各ラウンドでAIが書いた120本を次のラウンドの論文集合に追加した。
拡張実験では、各ラウンドの終了後に新たに生成した120本が加わり、AI執筆研究の割合が徐々に増加した。
予備実験でモデルは提示された論文の大半を引用する傾向があり、通常は30本中22~27本を選んだ。そのため本実験では最大10本とし、より選択的に判断させた。
最終的な実験設計の概要を以下に示す。

引用選好を調べる実験構成。実在する120本の論文から開始し、3社の11モデルを、30本の無作為な組み合わせと最大10本の引用という条件で評価した。後続ラウンドではAI生成論文を追加し、集合は1,440本へ拡大した。
初期実験では主要3社の11モデルを使用した。OpenAIはGPT-5、GPT-5 mini、GPT-4.1、GPT-4.1 mini、GoogleはGemini 2.5 Pro、Gemini 2.5 Flash、Gemini 3.1 Pro、Gemini 3.1 Flash-Lite、AnthropicはClaude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5である。
以下の結果は、各モデルが少数の論文にどれほど引用を集中させたか、何本を完全に無視したか、実験を繰り返した際に同じ選択をどれほど一貫して行ったかを示す。

特定の論文への引用集中度と、完全に無視された論文の数を示す結果。「Top-10% share」は最も好まれた12本が得た引用の割合、「HHI」は全体の引用集中度、「Reliability」は同一モデルが試験間で同じ論文を好む一貫性、ρはモデル間での選好の類似度を表す。「Matched null」の行は、論文を無作為に選んだ場合の期待値を示す。
モデルは実際には何を好むのか
選好は圧倒的に論文自体の内容に左右されていた。例えばGPT-5 miniでは、どの論文が好まれるかという変動の約90%が、一覧の順序、生成ノイズ、付加された架空のメタデータではなく、内容に起因した。同じ「内容優位」の効果はGPT-4.1 miniでも再現された。
意味を保ちながら題名と要旨を大幅に書き換えても、選好マップはほとんど変化しなかった。成功した4回の言い換え実験では、書き換えに3社の異なるモデルを用いたにもかかわらず、0.95~0.99の相関が得られた。
選好マップが変化したのは、根底にある意味が測定可能なほど変わった場合だけだった。

11モデルの引用選好を比較した結果。数値は各モデルの組み合わせが同じ論文をどれほど似通って好んだかを示し、高いほど一致が強い。モデルや提供元が異なっていても、全体におおむね似た選好が見られた。
したがって、モデルは特定の言い回しよりも、主として意味内容に反応しているようだ。ただし、これほど強く一致する理由を決定的に突き止めることはできなかった。
著者らによれば、訓練中に共通の引用に関する合意が取り込まれた可能性がある。あるいは、何が「引用に値する」論文なのかについて、各モデルが独立に似た判断へ到達している可能性もある。
つまり、共通の選好の存在は確認されたが、その究極的な起源は不明のままだ。
著者らは、研究でAIが広く使われると、注目される研究の範囲が狭まる可能性があると指摘する。異なるモデルが多くの同じ論文を好み、AI生成文献が蓄積すると、反復引用を通じて共通の選好がさらに強まり、好まれない研究を見つけることが次第に難しくなるためだ。そこで、引用の多様性と引用集中度の監視が、防止策の候補として提案されている。
再帰的な引用集中を測る本研究のベンチマークは、現在GitHubで公開されている。
結論
筆者の見解
毎週膨大な数のAI研究論文を読む立場から、私は「引用の波」が現れては消えるのを見てきた。長年の常連の一つがGoogleのAttention Is All You Need、最初のTransformer論文だ。今では投稿テンプレートに直接組み込まれているのではないかと思えるほどだ。
長く繰り返し引用された別の論文は、2014年のGenerative Adversarial Networksだった。しかし最終的には、Denoising Diffusion Probabilistic Modelsなど、拡散に基づく基礎的研究に登場頻度で追い越された。
ほぼすべての場合、こうした「常連」の引用自体が間違いというわけではない。ただ、その射程が広すぎて、引用先の論文を有効に裏づけていないことが多い。その意味では、一種の「引用ロンダリング」に近い。「信頼できる」が主として飾りの役割しか果たさない情報源を添え、少ない手間で信頼感を演出するのである。
初出:2026年8月24日(月)。東欧時間23:07、抜けていた複数形を補うため修正。












