Andersonの視点

科学論文におけるAIスロップと戦う

mm
Unite.AI を Google の優先ソースに追加
Image 'A shelf filled with lots of bottles of liquid' by Evgeniy Smersh. Used under the Unsplash license. Source: https://unsplash.com/photos/a-shelf-filled-with-lots-of-bottles-of-liquid-aWnA944oXLE

AIは規模であらゆることを行い、DoS攻撃レベルのウェブスクレイピングから、膨大な量の科学研究投稿を生成・支援するまでに至っています。その結果、物流的危機と品質の危機の両方が生じており、シグナル対ノイズ比はますます航行不能になっています。

先週、プレプリントサーバーarXivは発表しました、提出者に対し新たなレート制限ポリシーを導入し、月に2件までに制限することを。発表によれば、この措置は短期間で提出率が急激に上昇したことを受けて取られたものです。

2024年1月から2026年9月までのarXiv cs.AIカテゴリへの月間投稿数で、期間中に6倍以上の増加を示しています。出典 - https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/

2024年1月から2026年9月までのarXiv cs.AIカテゴリへの月間投稿数で、期間中に6倍以上の増加を示しています。出典

Kat Boborisのブログ記事は、先週の木曜日にHacker Newsでコメントを呼びましたが、arXivが2026年9月に40,363件の投稿を受け取ったと述べています—これは2024年9月の20,569件のほぼ2倍、そして2016年9月の9,869件の4倍以上です。

Boborisが観察したところ、最新月の投稿は、arXivスタッフとモデレーター向けに約9,000件のサポートチケットも生成しました。

私たちのモデレーターは、範囲が狭い薄い論文の増加と、単一の研究を分割して小さな論文の集合として提出する『サラミ』論文の増加を観察しています。

密度の高いAI生成論文の顕著な増加も見られます。AIツールにより、著者がarXivや他のリポジトリに低価値の論文を氾濫させることが容易になっています。

すでに今年の5月、arXivはチェックされていないAIコンテンツに対し1年の禁止措置を実施しました。また、昨年10月には、調査論文や立場論文(いずれも完全な学術研究よりも少ない労力で生成可能)を提出する者に対し、arXivで公開するにはピアレビューの裏付けが必要であると伝えました。

現時点では、arXivドメインのしばしば障害となるHTTPリクエストの上限はあまり目立っておらず、その非常に有用なRSSフィードがこの継続的な縮小を乗り切ることが期待されます。先週、Redditは発表しました、長らく懸念されていたRSSフィードの完全廃止を、来月中旬から実施することを。しかし、arXivが非営利組織であるため、読者を強制的なサイト訪問や強制ログインへ導くことで得られる同様の資本はほとんどありません—少なくとも現時点では。

高まる潮流に立ち向かって

AIの科学研究への利用の負の影響、特にAI関連研究において、深刻かつ拡大する問題に直面し、他のすべての分野を凌駕し、無名から政治的・経済的シンボルへと昇格した最近の状況において、AI関連論文の質の低下に対抗する方法を検討する研究の流れが現れました。

この問題に取り組む最新の試みは、韓国のソウル大学と米国ミネソタ大学の協力によるものです。論文は、タイトルをScience or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papersとし、論文の主張、証拠、引用、構造間の接続の失敗を通じて「科学的スロップ」を測定することを提案しています。

新しい論文から、‘科学的スロップ’へのアプローチの概要を示し、構造、議論、支援アーティファクトの失敗が従来のAIテキスト検出器が見逃す弱点を明らかにする方法を示しています。出典 - https://arxiv.org/pdf/2610.00531

新しい論文から、‘科学的スロップ’へのアプローチの概要を示し、構造、議論、支援アーティファクトの失敗が従来のAIテキスト検出器が見逃す弱点を明らかにする方法を示しています。 出典

従来のアプローチとは異なり、新システムはテキスト自体を超えて、論文の主張が議論、証拠、引用によって適切に裏付けられているかを評価します。著者らは次のように述べています*:

論文の各部分は単独で見れば妥当と思われるため、こうした崩壊はトークンレベルの検出器には見えず、論文全体のレベルでのみ特定または修正が可能です。科学的スロップをベンチマークし緩和するために、本論文は3つの課題に取り組みます。

‘まず、トークンレベルの指標では、論文全体で科学的推論がどのように結びつくかを捉えられません. セクション、主張、引用、証拠、そして成果物はそれぞれ妥当と思われても、それら相互の関係が崩壊することがあります。 我々はエンドツーエンドのAI生成論文でこのような失敗が繰り返し見られることを確認しており、ICLRの査読者は人間が執筆した投稿でもすでにこれらを減点対象としています。

‘第二に、これらのパターンの検出は測定されていません. 既存のテストセットはテキストのみをラベル付けしているため、論文全体を読むLLMを含む検出器がこれらのパターンを特定できる程度は測定されていません。

‘第三に、これらのパターンは信頼性をもって緩和することが困難です. トークンレベルのシグナルはパラフレーズによって除去できる一方で、これらのパターンを修復するには、基礎となる科学を変更せずに欠落した関係を復元する必要があります。’

著者らの新しいベンチマークである SciSlopBench は、SciSlopHarness に具現化されており、論文の科学的推論における失敗を検出・修復し、基礎となる科学的証拠を保持するよう設計されたフレームワークです:

SciSlopHarness が行った修正と欠陥のある抜粋を比較した例。サポートされていない追加は却下され、必要に応じて主張は再配置または書き換えられ、論文で利用可能な証拠をより適切に反映します。

SciSlopHarness が行った修正と欠陥のある抜粋を比較した例。サポートされていない追加は却下され、必要に応じて主張は再配置または書き換えられ、論文で利用可能な証拠をより適切に反映します。

SciSlopBench ベンチマーク自体は、390 本の AI 生成論文から構築されており、各論文は類似の研究課題と貢献タイプに取り組む人間が執筆した論文とペアになっています。

テストでは、SciSlopBench を用いて 390 組の論文を区別し、各組は前述の AI 生成論文と、研究課題と貢献タイプが一致する人間が執筆した論文で構成されました。ベンチマークはこれらの比較のうち 85.9% で AI 生成論文を正しく識別し、従来の AI テキスト検出器を大幅に上回りました。

著者らは次のように述べています:

‘標準的な改訂は残存スロップを残し、スロップ認識プロンプトは報酬ハッキングを引き起こす一方で、SciSlopHarness は最も強力な改訂ベースラインに対して残りの AI–人間ギャップを 63% 縮小し、人間の参照ターゲットを必要としません。

‘全体として、我々は AI 生成の科学論文が全体的な推論に根本的な痕跡を残すこと、そして責任ある緩和には単なる文章の洗練ではなく、厳格な証拠に基づく根拠が必要であることを示しています。’

論文自体の貢献に加えて、著者らは新しい研究の原則を、ユーザーが科学論文を提出してその中に含まれる AI スロップの量を分析できる ライブデモ の形で実装しました。

興味深いことに、デモで分析された新しい論文自体は、「中程度」のスロップスコア 40/100† を示しています:

新しい論文は、独自のアルゴリズムで分析され、著者の新しいプロセスで特定された「スロップ」領域をフラグ付けします。出典: https://yerimoh.github.io/scientific-slop-demo/r/75h2-yvx2-amhd

新しい論文は、独自のアルゴリズムで分析され、著者の新しいプロセスで「スロップ」領域がフラグ付けされます。 出典

手法とデータアプローチ

2025 年の共同研究 Why Slop Matters は、AI スロップの特徴として「表面的な能力」を挙げ、見かけ上の品質が実質の欠如を隠すと説明しました。新しい研究はこの考えを科学論文により具体的に適用し、研究の構成や主張の裏付け、方法と証拠の検証が困難になる失敗を「科学的スロップ」と定義し、これらの失敗を 構造、議論、アーティファクト の3つに分類します:

ベンチマークで使用される6種類の科学的スロップの測定ルール。表は各測定項目で何が検査されるか、スコアの計算方法、最大スコア1が何を表すかを示し、スコアが高いほど失敗が広範であることを示します。

ベンチマークで使用される6種類の科学的スロップの測定ルール。表は各測定項目で何が検査されるか、スコアの計算方法、最大スコア1が何を表すかを示し、スコアが高いほど失敗が広範であることを示します。

論文で定義された科学的スロップの6つの測定項目は、横断参照(セクションが論文内の他の箇所の内容を意味的に参照しているか)、マクロ冗長性(後続のセクションが前の内容を繰り返しているか)、議論グラフ(主張が前提となる論理で適切に裏付けられているか)、引用孤立(引用が表面的に使用され、引用された研究が論文や相互にどのように関係するかが説明されていないか)、図の説明(手法の図が実際に手法を説明しているか)、および証拠ギャップ(報告された結果が具体的な例で裏付けられているか)です。

ベンチマークは、AI 生成論文と比較可能/同等の人間が執筆した論文をペアにして構築され、AI 論文はFARS と 2025 Agents4Science コンペティションから選定されました。

機械生成された FARS 論文ごとに、研究者はその引用文献から同じタイプでトップティアの会場で受理された人間が執筆した論文を検索し、研究トピックが最も近いものを選択して 143 ペアを作成した。Agents4Science の論文も同様に人間執筆の対になる論文とペアリングされ、さらに 247 ペアが生成され、ベンチマークは合計で 390 の AI‑人間ペアとなった。これらの論文は生命科学、社会科学、自然科学にまたがるが、データセットはコンピュータサイエンスに大きく偏っている。

指標としては、PairAcc(人間論文が AI 論文より上位にランク付けされる頻度)と、AUROC(さまざまな閾値における人間論文と AI 論文の全体的な分離度)を用いて性能を評価した。著者らは、偽陽性率を人間論文で 5% に固定した場合の検出性能も報告している。

テスト

初期テストでは、AI テキスト検出器 Binoculars、DetectGPT、NTS†† と、自動レビューシステム AI Scientist Reviewer および CycleReviewer を比較した。

後続のリビジョンテストでは、4 つのベースラインが使用された:base prompting、Claude Code、reviewer-based refinement、および slop-aware revision。最初の 3 つは論文を改善する一般的な指示のみが与えられたが、slop-aware revision には検出されたスロップの定義と位置情報も追加で提供された。すべては同等のリビジョン条件下で SciSlopHarness と比較された。

実装にあたっては、テキスト検出器には論文の本文が入力され、他の手法には論文のソースコードが提供され、必要に応じてコードへのアクセスも許可された。Binoculars は Falcon-7B のベースモデルと指示モデルを使用し、DetectGPT はT5-3B を用いて 100 件の摂動を生成し、AI Scientist はQwen2.5-32B-Instruct を使用し、CycleReviewer はリリースされた 8B チェックポイントを使用した。Falcon の 2,048 トークン上限を超える論文については、重複しないウィンドウを個別にスコアリングし、平均を取った。

初期の検出結果は以下の 2 つの表に詳述されている。SciSlop は PairAcc が 85.9% で、Binoculars の 68.7% および最も強力な自動レビューアの 68.5% を上回り、エラー率を半分以下に削減した。

SciSlop と AI テキスト検出器および自動レビューアの検出結果、さらに 6 つの個別スロップ指標の結果を比較。SciSlop は全体の PairAcc が最も高く、横断参照が最も強い個別結果を示す。

ScienceSlop と AI テキスト検出器および自動レビューアの検出結果、さらに 6 つの個別スロップ指標の結果を比較。SciSlop は全体の PairAcc が最も高く、横断参照が最も強い個別結果を示す。

横断参照は単独でも特に高い性能を示し、モデルを使用せずに PairAcc が 90.5% に達し、偽陽性率 5% の条件で AI 生成論文の 65% を検出した。これは Binoculars の 24% と比較して大幅に上回る。

著者らは、これらの結果は論文全体の関係性が従来のテキストレベル検出よりも AI 生成のシグナルとして強いことを示すと同時に、今後のリビジョンで対象とできる具体的な弱点も特定できたと主張している。

次に、科学的スロップと人間による論文品質評価との関係が検討された。下の左列に示すように、スロップが高いほど ICLR の総合評価、妥当性、プレゼンテーション、貢献度のスコアが低くなる傾向が見られた。

SciSlop と AI テキスト検出器および自動レビューアを ICLR のレビュー結果と比較した結果。左パネルは AI らしさとレビュー得点の関係、中央は個別レビュー項目の比較、右は 9 年間にわたる採択・不採択論文の識別性能を示す。

SciSlop と AI テキスト検出器および自動レビューアを ICLR のレビュー結果と比較した結果。左パネルは AI らしさとレビュー得点の関係、中央は個別レビュー項目の比較、右は 9 年間にわたる採択・不採択論文の識別性能を示す。

採択論文と不採択論文は、調査した 9 年すべてで偶然以上の精度で区別できたが、従来の検出器はほとんどの比較で偶然以下の性能にとどまった。

したがって、科学的スロップは AI 著者性のシグナルだけでなく、人間レビューアがすでにペナルティを課す弱点を反映していることが判明した。

最終テストでは、SciSlopHarness が一般的なリビジョン後に残るスロップを除去できるかを検証した。下図のとおり、ハーネスは 6 つの指標すべてで人間平均に最も近い結果を示したが、一般的なリビジョンは多くのスロップを残し、スロップ対応リビジョンは時に過剰修正することがあった。

SciSlopHarness と 4 つのベースライン手法を 6 つのスロップ指標で比較したリビジョン結果。値が 0 に近いほど人間論文の平均に近く、SciSlopHarness は概ねこのレベルに向かって改善する一方、スロップ対応リビジョンはしばしば過剰に補正する。

SciSlopHarness と 4 つのベースライン手法を 6 つのスロップ指標で比較した改訂結果です。値がゼロに近いほど人間の論文平均に近く、SciSlopHarness は一般的にこのレベルに近づく一方で、スロップ対応の改訂はしばしばそれを超えてしまいます。

提案された各変更は、論文の科学的根拠と裏付け証拠に照らし合わせてチェックされ、裏付けのない編集は却下されました。6 つの指標全体で、人間が執筆した論文との差は、最も強力な改訂ベースラインである Claude Code と比較して 63% 縮小しました。

結論

この記事を書いている過程で興味深かったのは、この論文が自身のデモサイトで低評価だっただけでなく、最近研究論文で増えつつある小さな呪いとなっている「怠惰」または「表面的」な引用††の例が少なくとも一つ観察されたことです。

このようなケースでは、特定の論文に限らず、研究者は既存の文献と真摯に向き合うよりも自分の知識に頼る傾向が見られます。しかし、慣例で「作業を示す」ことが求められるため、引用はしばしば焦りやプロセスへの軽蔑と取れる形で提供され、読者が多数の参考文献を十分な「出所の光沢」として受け入れることに依存しているように見えますが、過度な精査には耐えられないでしょう。

Arxiv は AI 主導の投稿の産業化に対抗していますが、十分な規模の関連災害が起きない限り、研究における AI の直接的な関与に同様の制約が設けられるかどうかはまだ不透明です。

 

* 著者側の強調であり、私のものではありません – 必要に応じて著者のインライン引用をハイパーリンクに変換した点です。

† 著者は自身の論文で AI を全く使用していないと主張しているわけではなく、そのような使用について詳述しています。

†† 読者の興味を引くかもしれませんが、著者が提供したリンクが適切でなかったため、私自身で NTS フレームワークの正しいリンクを探さなければなりませんでした – これこそが SciSlop が重視する指標の一つです!

2026年10月4日(日)に初掲載

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai