Andersonの視点

『サーベイペーパーのDDoS攻撃』が科学研究を圧倒する

mm
Unite.AI を Google の優先ソースに追加
An Oxbridge professor, a white middle-aged man, is shocked to see the entrance to his office clogged with an avalanche of books. ChatGPT-40; Firefly V3.

ChatGPTなどの生成的なAIモデルは、学術出版プラットフォームにAI生成のサーベイペーパーを大量に投稿し、信号対雑音比が臨界的なレベルに達しています。新しい研究によると、この大量の投稿は研究者を圧倒し、引用を歪め、科学的記録に対する信頼を損なっていると言われています。AI支援の論文投稿の増加は、科学に対する「DDoS攻撃」と呼ばれています。

 

(一部)意見 先週、7年間で初めて、AIに関する科学文献を最新の情報に追いつくことができなくなりました。新しい出版物について書く時間を確保するためには、必ずしも最新の情報に追いつく必要はないということを認識しなければなりませんでした。

特定のカテゴリ(コンピュータビジョンマシンラーニング言語モデルなど)のエントリ数は、1日あたり1000を超えていました。

そのような大量の投稿では、すべての新しいタイトルをスキミングするだけで、1日を無駄にすることになります。

これは10月7日の火曜日でした。対照的に、マシンラーニングカテゴリでは、10月14日の火曜日には、前の週の火曜日の400を超えるエントリーよりもやや少ない投稿数で、わずか354のエントリーがありました。

マシンラーニングカテゴリの1日あたりの投稿数:354。ソース:https://arxiv.org/

マシンラーニングカテゴリの1日あたりの投稿数:354。ソース:https://arxiv.org/

Arxivを毎日読んでいないと、これらの数字がどれほど異常であるかはわかりません。

火曜日はArxivの「ラッシュアワー」である可能性があります。なぜなら、研究者が影響力のある人々にリーチするために最も早く働く日だからです。マシンラーニングカテゴリは、他のカテゴリよりもユニークなペーパーの数が少ない「キャッチオール」セクションです。

しかし、投稿数の増加は、学術界やメディアで注目されている現象です。

この増加の最も驚くべき側面は、他の隣接カテゴリは過去3年間でほとんど変化がないのに対し、コンピュータサイエンスカテゴリが急激に増加していることです。

2022年以降のコンピュータサイエンス論文の増加。ソース:https://info.arxiv.org/about/reports/submission_category_by_year.html

2022年以降のコンピュータサイエンス論文の増加。ソース:https://info.arxiv.org/about/reports/submission_category_by_year.html

3年前、ArxivのAI論文投稿数は数年ごとに2倍になっていました。2025年のArxivの年次ダイジェストを読むことは興味深いことになるでしょう。

ボリューム11

この現象が起こっている2つの明らかな理由は、a) 生成的なAIへの前例のない金銭的コミットメントが、民間および学術セクターで研究投資を引き付けていること、b) AI言語モデルシステムであるChatGPTが、研究論文(AIに関する論文を含む)の投稿をほぼ工業化されたプロセスにしていることです。

しかし、研究の質は投稿数とともに上昇していません(AIのエラーの多い出力は、学術界よりも法的セクターでより多くのヘッドラインを占めています)。

ゼロトレランスポリシーを実施することは難しいです。なぜなら、AI生成コンテンツを認識することは容易ではなく、AIの使用は、以前は不利な立場にあった非英語話者の研究者やチームの仕事の明確性を向上させるからです。

しかし、この言語の障壁を低減することの問題は、人間の管理が付与されることなく、世界中の投稿者の数が増えることです。

もし投稿数が指数関数的に増加し続けるなら、信号対雑音比はAI自身がしか能わずに、AI論文の新しい洪水と支流をナビゲートすることになるでしょう。科学研究は、人間の取り組みです。

研究への攻撃

この考察の原因は、中国からの新しい共同研究です。『Stop DDoS Attacking the Research Community with AI-Generated Survey Papers』と題されています。

新しい位置づけ論文は、特に『サーベイ』投稿に焦点を当てています。サーベイは、従来、特定の研究分野のまとめであり、文脈化、解釈、情報に基づいた予測を行ってきました。

マシンラーニングとAIに関するサーベイのごく一部。ソース:arxiv.org

マシンラーニングとAIに関するサーベイのごく一部。ソース:arxiv.org

サーベイはオリジナリティーを必要とせず、AIによって自動化されることができます。著者は、サーベイの増加をセキュリティ脅威と見なしています。

‘[最近の] AI生成サーベイの増加、特に大規模言語モデル(LLM)によって可能になったものは、従来の手間のかかるジャンルを、低労力、高出力のものに変えました。しかしこれは、我々が「サーベイペーパーのDDoS攻撃」と呼ぶ現象をもたらします。

‘これは、表面的なまとめだけの、しかし往々にして冗長、低品質、または妄想的なサーベイ原稿の無制限な増加を指し、研究コミュニティを圧倒し、科学的記録に対する信頼を損なうものです。

‘[私たちは] AI生成サーベイ論文(つまり、サーベイペーパーのDDoS攻撃)を研究コミュニティに大量にアップロードするのを止めるべきだと主張します。強力なAI支援レビュー書き込みの規範を確立することでです。 ‘

著者は、AI生成サーベイが、深い分析や批判的比較が欠如し、事実の誤りや妄想的な引用を広める可能性があると主張しています。

‘研究の質と信頼性への影響は深刻です。まず、真の進歩は、アルゴリズムによって生成された既存の研究の再編によって隠される可能性があります。

‘新規参入者や学際的な研究者は、信頼できる概要を見つけるのに苦労するかもしれません。さらに、自動化された下書きによって導入されたエラーまたは偏見は、チェックされずに次の研究に伝播する可能性があります。

‘要約すると、非ピアレビューのAI生成サーベイの洪水は、文学レビューの厳格さと科学的記録の信頼性を危うくします。 ‘

‘異常’な著者

研究者は、サーベイ投稿の進化について、いくつかの興味深い分析を提供しています。

左:2020年から2024年までのコンピュータサイエンスサーベイ論文の年間数。中央:同じ期間のAI生成スコアの平均。右:年ごとの「異常」著者数(短期間に3つ以上のサーベイを投稿する著者、共同研究者の多様性が限られている著者、反復的な機関パターンを持つ著者)。これら3つの傾向はすべて、ChatGPTやその他の大規模言語モデルのリリースとともに2023年に急激に上昇しています。

左:2020年から2024年までのコンピュータサイエンスサーベイ論文の年間数。中央:同じ期間のAI生成スコアの平均。右:年ごとの「異常」著者数(短期間に3つ以上のサーベイを投稿する著者、共同研究者の多様性が限られている著者、反復的な機関パターンを持つ著者)。これら3つの傾向はすべて、ChatGPTやその他の大規模言語モデルのリリースとともに2023年に急激に上昇しています。

最初の列には成長トレンドが見られます。曲線は2022年頃から急激に上昇し、ChatGPTが登場し、大規模言語モデルが主流になったときからです。Claude、PaLM、Geminiなどの後続モデルは、2023年を通じてその勢いを維持しました。

中央のグラフは、ChatGPTの登場後に投稿数が急激に増加したことを示しています。ある研究チームは、2024年までに、科学的要約の10%以上がLLMを経由して生成されたと発見しました。AI検出会社の別の報告書は、ChatGPTの後にarXivの論文の72%がAIの助けを借りて書かれたと示しています。AI生成スコアが高い論文の数も1年で2倍になりました。

右側のグラフは、短期間に3つ以上のサーベイを投稿する「異常」な著者パターンの数が、2022年から急激に増加していることを示しています。

著者は、これらのサーベイの多くは、単独著者または小グループによって投稿されたものであり、短期間に複数のサーベイを投稿しているものであり、または無関係なトピックをカバーしているものであり、また、要約している分野での以前の記録がないものであるため、AIによって書かれた可能性が高いと主張しています。

さらに、いくつかのサーベイは、明確な機関的つながりがない匿名の集団によって出版されており、フィールドをサーベイで氾濫させるために、サーベイを素早く作成する可能性があります。

問題

新しい論文の主張をすべて網羅することはできませんが、最も注目すべき観察と著者の提案された解決策を検討しましょう。

質と独創性

問題は量だけではありません。多くのAI生成サーベイは、良いサーベイに必要なものを省略しています。明確な構造、深い分析、正確なクレジット、真の洞察力です。代わりに、AI生成サーベイは、必要なケアやキュレーションが欠如し、単に論文をリストアップしただけのものです。

著者はさらに、AI生成サーベイは構造が欠如し、明確な方向性がなく、重要なセクションを省略し、文脈を創造できないと主張しています。人間が書いたサーベイは、適切なカテゴリを確立し、より一貫性のある物語を語ります。

また、多くのAI生成サーベイは、ウィキペディアから直接コピーされたトピックの分類を使用していることがあります。たとえば、Vision Transformersに関するサーベイには、共通のセクションタイトルと構造があり、テンプレート駆動のAI出力を示唆しています。

‘一方、人間が書いたサーベイは、新しい分類法を導入する可能性があります。たとえば、ViTを効率性の戦略で分類します。多くの最近のサーベイプレプリントにこのような独創的な構造が欠如していることは、人間の洞察が限られているAIによって生成された可能性があることを示唆しています。 ‘

引用を正しく

おそらく最も公然と恥ずかしいのは、AI生成サーベイが引用を間違えることが多いことです。重要な論文を省略し、無関係な論文を含め、時には存在しない論文をリストアップすることもあります。エラーは、真の専門知識ではなく、表面的なパターンマッチングから生じていることを示唆しています。

著者は、最近のいくつかのサーベイ論文が、異なるチームからなっていても、70%の参考文献リストを共有していることを指摘しています。重複度は高いので、LLMへの共通の依存を示唆しています。

実際、ChatGPTのカジュアルなユーザーは、トピックがより抽象的になるにつれて、モデルがより限られたソースから学習することを知っています。多くの場合、Webでモデルが使用した情報源を見つけることは、モデルを介して情報にアクセスするよりも役立つことがあります。

均質なスタイルの出現

著者は、同じトピックに関する多くのAI生成サーベイが、LLMがフレーズや構造を再利用するため、ほぼ同一のものになることを指摘しています。

‘「Xについての文献レビューを書いてください」というリクエストに、LLMは非常に似たような回答を生成することがあります。最近の研究によると、LLMに関連する特定の書き方のパターンが急激に増加しており、多くの論文が同じスタイルを共有していることを示唆しています。 ‘

あなたのChatGPTが見えている

論文では、AI生成サーベイを簡単に検出できる方法として、フレーズ「AI言語モデルとして」または「私の知識カットオフ」などの存在を示しています。これは、言語モデルからの出力が、投稿前に最小限の、またはまったくキュレーションなしで提出されたことを示唆しています。

論文では、疑わしいサーベイは、単語の多様性が低く、繰り返しのフレーズが見られることが多いと主張しています。たとえば、複数の段落が「さらに」で始まることがあります。このようなパターンは、GPTスタイルの書き方の特徴であると著者は主張しています。

(私の個人的なコメントとしては、オンラインジャーナリズムの厳格さが、作家に、スタイルのない形式で多くの項目をリストアップすることを要求することがあります。したがって、ChatGPTやその同類は、人間の作家からこの悪い習慣を学習した可能性があります。さらに、著者はAI生成コンテンツ検出の原則に触れており、これは複雑で変化する分野です。)

研究者は、AIサーベイが研究文化や信頼性に与える影響についてさらに議論していますが、詳細については、元の論文を参照してください。

解決策?

論文の解決策は、興味深く、革命的ですが、同時に奇妙に独創的ではありません。サーベイ論文の有用性を、ダイナミックライブサーベイに置き換えるというものです。つまり、ウィキとGitHubページのハイブリッドで、LLMやその他のAIシステムから新しいデータが常に流れ込むものですが、コミットは人間によってのみ行われるため、AIが自動的に更新を「公開」することはありません。

‘このフレームワークでは、コミュニティメンバーが最初に、スコープ、研究の質問、参考文献を指定して、サーベイのウィキを作成します。次に、LLMベースのインジェストエージェントが、プレプリントアーカイブ、会議録、ベンチマークのリーダーボードを継続的に監視し、要約、図、重要なパフォーマンスメトリクスを抽出します。さらに、新しい結果の簡潔な要約を生成し、引用グラフを更新し、研究トレンドの出現をレビューのためにフラグします。 ‘

‘人間の貢献者は、機械だけが提供できない解釈の深さを提供するために参加します。進化する分類を微妙な方法論的差異に合わせて整理し、サブフィールド全体のアルゴリズム的イノベーションの解釈を調整し、文書に批判的な比較を提供します。 ‘

変化の書

著者は、この提案を熱心に説明し、正当化しています。高エフォートの人間が書いたサーベイは、AIの周辺分野では、ほとんど価値がないほど短期間で古くなってしまうと指摘しています。

‘年ごとに、研究コミュニティは、繰り返しまたは表面的な概要で溢れ返り、実質的な洞察を見つけることが研究者や新規参入者にとって困難になる。伝統的な出版サイクル(下書き、提出、査読、出版)は数ヶ月かかる可能性があり、その間に重要なブレークスルーがすでに風景を変えている可能性があります。 ‘

‘さらに、静的なサーベイの増加は、読者が多数の重複する文書を検索して有意義な洞察を見つける必要があるため、認知的過負荷につながります。 ‘

不幸にも、提案されたシステムは、Discordの最悪の特性と最も非難される特性を共有しています。最も重要なのは、常に変化し、変化するリソースであるということです。

ダイナミックライブサーベイのどの部分も、いつでも変更または削除される可能性があるため、信頼できる安定した情報源として使用することはできません。ただし、archive.isやWayback Machineなどのアーカイブサイトが提供するように、特定の時点でのコミットへのリンクが可能になる場合があります。しかし、どのようなリソースが必要になるでしょうか? それを長期的に維持することができますか?

さらに、定義やコンテンツが常に変化するプラットフォームやウィキは、従来の検索エンジンやLLMによってインデックスされるのが困難です。

提案されたシステムの最も弱い部分は、人間がLLMエージェントからのコミットを監督する必要があるということです。常に、人間は高価です。提案されているのは、博物館と図書館の間にあるものです。どちらも、カバーされるデータの量とトピックの数に比例して、相当な量の「肉体」のプロビジョニングを必要とします。

「実際の人間を使う」ということがAI開発の問題に対する唯一の答えである場合、その問題はまだ解決されていません。

結論

現在、AIのサーベイ論文の半分期限は、ただ面倒です。もし現在の自動化投稿の傾向が続くなら、信号対雑音比は慢性的になり、文学は制御不能になるでしょう。

そのような状況では、FAANG以外の小規模な声が聞かれることはさらに困難になり、市場の大手企業はさらに大きな存在感を示すことになるでしょう。

ライブサーベイに加えて、新しい論文では、著者はAIを使用した場合、AIを使用したことを明示的に宣言し、さらに、AI支援部分を論文内で明示的にラベル付けすることを提案しています。

これは大きな負担であるため、論文では、別の提案として、AIの貢献を論文内で明示的に区別したセクションを設けることを示唆しています。

要約すると、新しい研究には現実的な解決策はありません。しかし、著者は、先行する課題を提示することで、有意義な貢献を果たしています。

 

論文『Stop DDoS Attacking the Research Community with AI-Generated Survey Papers』は、https://arxiv.org/abs/2510.09686で見つけることができ、上海交通大学のさまざまな学部の6人の著者によって書かれています。

___________________________________

* すべての人がそのように感じているわけではありません

著者の強調、僕のものではありません。また、著者のインライン引用をハイパーリンクに変換した僕のものです。

最初に公開されたのは、2025年10月17日、金曜日です。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai