Andersonの視点

AIは同じ論文を繰り返し引用する – 人間と同様に

mm
Unite.AI を Google の優先ソースに追加
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPTやその他のAI執筆ツールは、静かに科学を人気争いに変えている可能性があり、研究者を同じ論文へと繰り返し導きながら、実際に分野を前進させ得る新しく斬新な研究を見過ごしています。

 

モノカルチャーとは、頻度や統計の観点で、同じ限られた情報源や資産が何度も繰り返し現れ、新しい声や新鮮な視点を埋もれさせる状態を指します。たとえば、ラジオの編成で同じ限られた楽曲が流れ続け、空港の書架で同じ著者と本が並び、スーパーマーケットで同じ限定的な果物や野菜が並んでいるような状況です。

Yes, we have these bananas, and only these bananas. Source - https://www.publishersweekly.com/pw/print/20191104/81637-is-publishing-too-top-heavy.html

はい、これらのバナナだけです – そしてこれだけです。西側の食料供給チェーンにおける果物と野菜の均質化は、各ケースで数百種もの他の種の可能性を無視しています。なぜなら、多様な種類の果物や野菜を産出・輸送するチェーンを産業化するにはコストが高すぎるからです。 Source

この現象は新しい科学研究の引用にも見られ、研究者が怠惰に『信頼できる』情報源のセットをデフォルトで使用し、それが勢いを増して研究分野を支配し始めるまで続きます。

これはマシュー効果として知られる社会学的理論で、既得権者は常に利益を得ると示唆しています。この症候群はマタイ13章12節の約束『持っている者にはさらに与えられ、豊かになる。持っていない者からは、持っているものさえも奪われる』と比較されます。

人気者たち

AI支援研究への大きな期待の一つは、新しい機械学習手法がマシュー効果、すなわち人気バイアスを打破し、あまり知られていないがより鋭い、あるいは論文の主張により適した研究を引用し始めることでした。

しかし、AIの学習プロセスがデータセットを解釈する方法を見ると、この楽観には根拠がなく、これまで繰り返し明らかになっているのは、AIが引用を全く捏造しない場合でも(現在も慢性的な問題である)マシュー効果を人間と同様に永続させているということです—ただし理由は同じではないかもしれません。

学習中、モデルはトレーニングセット内で最も引用回数が多い(あるいは『最も頻繁に繰り返される』)論文を高く評価することを学習します。これは、学習アルゴリズムが有意義なパターンを抽出し、外れ値を『ノイズ』や統計的異常として除外するよう設計されているためです。

この体制下では、アインシュタインの相対性理論に相当するものが機械から注目されることは決してありません。学習が完了したモデルは、既に自らの原理と参照先を見つけたと感じ、RAG(検索強化生成)やその他の手段で新しい出版物にアクセスしてわずかに視点を調整できるだけです。

問題は、モデルが新しい研究を既に知っている『古いお気に入り』と同様に、あるいは全くクレジットしないことです。統計的バイアスがすでに深く根付いているためです。

したがって、AIがマシュー効果を永続させることは、人間の行動を観察し模倣しているわけではなく、研究者が怠惰に同じ古い論文を選択する回数を数えてそれらを高く評価しているだけです。この点で、引用の繰り返し問題は、増え続けるAI研究出版物の中から真に興味深い科学論文を選び出す課題と関連しています。最も優れた研究ほどシグナルが弱くなりがちだからです。

モノカルチャーの診断

この課題は、米国の新しい興味深い論文『When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models』で取り上げられています。この新研究は、テキサス大学オースティン校、スティーブンス工科大学、ワシントン大学セントルイス校、ライス大学、ノートルダム大学の共同研究で、機械学習における引用モノカルチャーの存在を決定的に証明し、将来的にその変数を直接的に対処できるようにすること、そして問題自体を解決することを目指しています。

テストでは、著者らはOpenAI、Google、Anthropicの11モデルが、明らかな人気シグナルが除去された後でも、同じ小さな論文群を繰り返し好むことを発見しました。

この検証のために、120本の実際の論文から引用数と出版先情報を除去し、著者名を置換、出版年をランダムに再割り当てしました。その後、30本ずつのランダムなセットを各モデルに提示し、引用は最大10件までとしました。

関連分野の8人の人間専門家にも同じ盲検論文を提示しましたが、AIと同じお気に入りには収束せず、バイアスが論文自体ではなくAIモデルに特有であることを示しました。

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

新しい論文から、AIモデルと人間専門家の引用選択を比較したテスト結果です。全11モデルにおいて、引用はより小さな論文群に集中し、一部の論文は完全に無視され続けました。人間の専門家はそのような傾向を示しませんでした。 Source

モデルに参考文献だけを選択させても、同じ論文が人気を保ち、レビューを書かせたこと自体がバイアスの原因ではないことが示されました。

その後、実験は11ラウンドに拡張され、各ラウンド後に120本のAI生成論文が追加され、共有された好みが増大するAI生成研究プールでどのように作用するかを検証しました。

AI生成論文が増えるにつれ、モデルは元の人間の論文のうち、ますます少数の論文に引用を集中させました。

言語モデルが文章の草稿作成からツール呼び出しを伴う文献検索エージェントの実行へと移行するにつれ、捏造された参照を検出し制御することが容易になっています。

より深刻な失敗は、すべての候補が実在することが前提となった後に始まります。異なるモデルが依然として同じ狭いサブセットを選択し、単一の引用が誤っていなくても引用モノカルチャーを生み出すのです。

この問題への対策として、論文は単に異なるベンダーのモデルを混合したり、論文に同等の露出を与えるだけでは不十分であると指摘しています。好みの多くがモデル間で共有されているためです。むしろ、特定の論文に対する根本的な好みを変える必要があり、無視されがちな論文に意図的により大きな注目を与えることが考えられます。しかし、著者らはこのアプローチは未検証であることを強調しています。

テスト手法

ベンチマークは、2015年から2022年にかけてarXivから収集された120本の実際の知識蒸留論文を基に構築されました。各論文は収集時点で50〜500件の引用があり、これはマイナーなものと極めて影響力の大きいものの両方を除外するための範囲です。

実験は、利用可能なコレクションからランダムに30本の論文を抽出し、著者名・出版年・引用数を隠すことから始めました。各モデルは最大10本まで引用した短いレビューまたは立場文を書き、これらの選択を同じ資料からのランダム抽出と比較しました。

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round's collection.

引用嗜好をテストするために使用された手法の概要です。識別情報を隠した状態でランダムに選ばれた30本の論文がモデルに提示され、最大10本まで引用できました。その選択はランダム抽出と比較され、各ラウンドで120本のAI生成論文が次のラウンドのコレクションに追加されました。

拡張実験では、各ラウンド後に新たに生成された120本の論文がコレクションに加わり、AI生成研究の比率が徐々に増加しました。

予備テストでは、モデルは提示された論文の大半を引用する傾向があり、通常30本中22〜27本を選択していました。したがって、研究者は本実験の引用上限を10件に設定し、モデルにより選択的な判断を強いました。

以下に、得られた実験設計の概要を示します。

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

引用嗜好をテストするための実験設定です。本研究は120本の実際の論文から開始し、3ベンダーの11モデルをテストしました。30本のランダムセットと最大10件の引用を使用し、後のラウンドでAI生成論文が追加され、コレクションは1,440本に拡大しました。

最初の実験では、3大プロバイダーの合計11モデルを使用しました。OpenAIはGPT-5、GPT-5 mini、GPT-4.1、GPT-4.1 miniを、GoogleはGemini 2.5 Pro、Gemini 2.5 Flash、Gemini 3.1 Pro、Gemini 3.1 Flash-Liteを、AnthropicはClaude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5を代表しました。

以下に示すテスト結果から、各モデルがどれだけ引用を少数の論文に集中させたか、全く無視した論文の数、そして実験を繰り返した際にどれほど一貫して同じ選択をしたかが分かります。

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The 'Matched null' row indicates what would be expected if papers were chosen at random.

各モデルが特定の論文への引用をどれほど強く集中させ、どれだけの論文を完全に無視したかを示すテスト結果です。’Top-10% share’ は12本の最も好まれた論文への引用数を示し、’HHI’ は全体的な引用の集中度を測ります。’Reliability’ はテスト間で各モデルが同じ論文をどれだけ一貫して好んだかを示し、ρ はモデル間でそれらの好みがどれほど類似しているかを示します。’Matched null’ 行は論文がランダムに選ばれた場合に期待される結果を示しています。

モデルは実際に何を好んでいるのか?

好みは圧倒的に論文そのものの内容によって駆動されていることが判明しました。例えば、GPT-5 miniでは、どの論文が好まれるかの変動の約90%が内容に起因し、リスト順序や生成ノイズ、各論文に付与された捏造メタデータといった要因はほとんど影響しませんでした。同様の『支配的な内容』効果はGPT-4.1 miniでも再現されました。

好みのマップ(下参照)は、タイトルと要旨が大幅に書き換えられ、意味が保たれた場合でもほとんど変化しませんでした。4つの成功したパラフレーズテストでは、3ベンダーの異なるモデルを用いたにもかかわらず、相関係数0.95〜0.99が得られました。

好みのマップに変化が見られたのは、根本的な意味が測定可能に変化した場合に限られました:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

11モデル間の引用嗜好を比較したテスト結果です。数値は各モデルペアがどれだけ同じ論文を好んだかを示し、数値が高いほど合意が大きいことを示します。モデルやベンダーの違いにもかかわらず、全体として類似した嗜好が見られました。

したがって、モデルは特定の語句よりも意味的内容に主に反応しているようです。しかし、強い合意の理由は決定的に特定できませんでした。

著者らは、共通の引用コンセンサスが学習過程で吸収された可能性があると主張しています。別の可能性として、何が『引用に値する』論文かについての類似した判断が独立して形成された可能性があります。

したがって、共有された好みの存在は確認されたものの、その根本的な起源は依然として不明です。

著者らは、研究にAIが広く利用されることで、注目される研究の範囲が狭まる可能性があると指摘しています。なぜなら、異なるモデルが多くの同じ論文を好む傾向があり、AI生成文献が蓄積するにつれて、これらの共有された好みが繰り返し引用されることでさらに強化され、評価が低い研究が発見しにくくなるからです。そのため、引用の多様性と引用集中度のモニタリングが潜在的な安全策として提案されています。

本研究の再帰的引用集中度ベンチマークは、現在GitHubで入手可能です。

結論

意見 毎週膨大な数のAI研究論文を読んでいる者として、’引用の波’が出現し、消えるのを目にしてきました。恒久的な定番の一つはGoogleの『Attention Is All You Need』、すなわちオリジナルのTransformer論文で、現在では投稿テンプレートにハードコードされているほどです。

長らく繰り返し引用されてきたもう一つは2014年の『Generative Adversarial Networks』ですが、最終的には『Denoising Diffusion Probabilistic Models』やその他の拡散ベースの主要研究に頻度で取って代わられました。

ほぼすべての場合において、これらの『繰り返し』引用は必ずしも誤りではありませんが、引用先の論文に対して有用な裏付けとなるには範囲が広すぎることが多く、その意味で『引用洗浄』に近いものと言えます――信頼できるが主に装飾的な出典引用を低コストで信憑性を演出する行為です。

2026年8月24日月曜日に初掲載

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai