Andersonの視点

AI生成言語が科学文献を汚染し始めている

mm
Unite.AI を Google の優先ソースに追加

フランスとロシアの研究者は、GPT-3などのAI駆動の確率的テキスト生成器を使用すると、科学文献に「拷問された言語」、「存在しない文献への引用」、「無断の画像の再利用」が導入されることを示唆する研究を発表しました。

最も懸念されるのは、研究された論文が科学的に不正確または再現できない内容を、客観的かつ体系的な研究の成果として提示していることです。これは、生成言語モデルが論文著者の英語スキルを補うだけでなく、実際に研究の難しい作業を(そして、必ずしもうまく)行っていることを示唆しています。

報告は、拷問されたフレーズ:科学で出現する疑わしい文章スタイルと題され、トゥールーズ大学のコンピュータサイエンス学部とヤンデックスの研究者アレクサンダー・マガジノフによってまとめられました。

この研究は、特にエルゼビアジャーナルマイクロプロセッサとマイクロシステムにおける、意味のないAI生成科学出版物の増加に焦点を当てています。

別の名前

自己回帰言語モデルであるGPT-3は、大量のデータでトレーニングされ、データを要約、まとめ、解釈して、自然なスピーチや文章パターンを再現できる生成言語モデルを生成するように設計されています。

これらのフレームワークは、トレーニング段階で、直接的で「吸収されていない」元のデータの再現に対して罰則を受けるため、必ずしも既存のフレーズの同義語を探すことになります。

研究者によって発見された、明らかにAIによって作成された/支援された科学的投稿には、機械学習分野で知られているフレーズの創造的な同義語の失敗した試みが多数含まれています。

このような例としては、次のものがあります。
ディープニューラルネットワーク: 深いニューラル組織
人工ニューラルネットワーク: (偽の | 偽物) ニューラル組織
モバイルネットワーク: 多様な組織
ネットワーク攻撃: 組織 (待ち伏せ | 攻撃)
ネットワーク接続: 組織の関連付け
ビッグデータ: (巨大な | 巨大な | 巨大な | 巨大な) 情報
データウェアハウス: 情報 (倉庫 | 配送センター)
人工知能 (AI): (偽の | 人間による) 意識
高性能コンピューティング: 上級の計算
フォグ / ミスト / クラウドコンピューティング: 霞の計算
グラフィックス処理ユニット (GPU): デザインの準備ユニット
中央処理ユニット (CPU): 中心の準備ユニット
ワークフローエンジン: ワークプロセスのモーター
顔認識: 顔の認識
音声認識: 話の認識
平均二乗誤差: 平均二乗 (間違い | 違い)
平均絶対誤差: 平均 (全体の | 最高の) (間違い | 違い)
信号対雑音: (動き | 旗 | 指標 | 記号 | 信号) 対 (騒音 | 喧騒)
グローバルパラメータ: 世界的なパラメータ
ランダムアクセス: (任意の | 不規則な) 通行権
ランダムフォレスト: (任意の | 不規則な) (森 | 林 | 豊かな土地)
ランダム値: (任意の | 不規則な) 価値
アリコロニー: 地中の昆虫 (州 | 県 | エリア | 地域 | 植民地)
アリコロニー: 地下の虫 (州 | 県 | エリア | 地域 | 植民地)
残りのエネルギー: 残りの活力
運動エネルギー: 運動の活力
ナイーブベイズ: (信じやすい | 無邪気な | うぶな) ベイズ
パーソナルデジタルアシスタント (PDA): 個人のコンピュータ化コラボレーター

2021年5月、研究者はDimensions学術検索エンジンをこのようなこじれた、自動化された言語を探すために照会し、有効なフレーズである「巨大な情報」などの正当なフレーズを除外しました。その時点で、彼らはマイクロプロセッサとマイクロシステムが、間違った言い換えの発生数が最も多かったことを観察しました。

現在でも、アーカイブスナップショット(2021年7月15日)を介して、「深いニューラル組織」(「ディープニューラルネットワーク」)などの無意味なフレーズの科学的論文をいくつか取得することができます。その他のリストにあるものも同様にヒットします。

Dimensionsでの「深いニューラル組織」('ディープニューラルネットワーク')の検索結果。ソース: https://app.dimensions.ai/

Dimensionsでの「深いニューラル組織」(‘ディープニューラルネットワーク’)の検索結果。ソース: https://app.dimensions.ai/

マイクロプロセッサジャーナルは1976年に設立され、2年後にマイクロプロセッサとマイクロシステムに名前を変更しました。

無意味な言語の増加

研究者は2018年2月から2021年6月までの期間を研究し、過去2年間で投稿の量が急激に増加し、特に過去6〜8ヶ月で増加したことを観察しました。

相関か因果か。マイクロプロセッサとマイクロシステムジャーナルへの投稿の増加は、「無意味」テキストと同義語の増加と一致しているようです。ソース: https://arxiv.org/pdf/2107.06751.pdf

相関か因果か。マイクロプロセッサとマイクロシステムジャーナルへの投稿の増加は、「無意味」テキストと同義語の増加と一致しているようです。ソース: https://arxiv.org/pdf/2107.06751.pdf

研究者が収集した最終的なデータセットには、トゥールーズ大学のエルゼビアのサブスクリプションを介して取得された1,078のフルレングスアーティクルが含まれています。

中国の科学論文における編集の減少

論文は、2021年から投稿された論文の編集の評価時間が急激に短縮し、40日未満に落ち込んだことを観察しています。これは、2月から2021年にかけて、査読の標準時間が6倍減少したことを示しています。

最も多くのフラグ付き論文は、中国大陸に所属する著者から来ています。404件の論文が30日未満で受け入れられたうち、97.5%は中国関連です。一方、編集プロセスが40日を超えた場合(615件)、中国関連の投稿は9.5%しか占めていません。これは10倍の不均衡です。

報告書は、フラグ付き論文の浸透を、編集プロセスの欠陥と、増加する投稿数に対するリソース不足に帰しています。

研究者は、GPTスタイルの生成モデルや同様の言語生成フレームワークが、フラグ付き論文の多くを生成したのではないかと推測しています。ただし、生成モデルがそのソースを抽象化する方法は、これを証明することを難しくしています。主な証拠は、不必要な同義語と論文の論理的な整合性の厳密な評価にあります。

研究者はさらに、生成言語モデルは、問題のあるテキストを生成するだけでなく、それらを認識して体系的にフラグを付けることもできると観察しています。研究者自身が手動で行ったように、GPT-2を使用したそのような実装については、将来のシステムが問題のある科学的投稿を識別するためのフレームワークを提供しています。

「汚染された」投稿の発生率は、エルゼビアジャーナル(72.1%)で他のジャーナル(13.6%が最大)よりもはるかに高くなっています。

単なる意味論ではない

研究者は、問題のあるジャーナルは単に間違った言語を使用しているのではなく、科学的に不正確な声明を含んでいることを強調しています。これは、生成言語モデルが、科学者の英語スキルを向上させるだけでなく、論文の中核となる定理やデータの一部を実際に生成している可能性があることを示唆しています。

他の場合、研究者は、抽出された(そして優れた)以前の研究を「再合成」または「スピン」して、「出版または絶滅」の学術研究文化の圧力に応え、またはAI研究における世界的優位性のための国家ランキングを改善するために、純粋な量で論文を生成するために使用されていると推測しています。

投稿された論文の無意味な内容。この場合、研究者はテキストが、無断で引用されたEDN記事から、極端に書き直されたものであることを発見しました。

投稿された論文の無意味な内容。この場合、研究者はテキストが、無断で引用されたEDN記事から、極端に書き直されたものであることを発見しました。

研究者は、いくつかの投稿されたエルゼビア論文を分析し、意味を推測できない文を見つけました。存在しない文献への参照、実際にはサポート資料に現れない変数や定理への参照、画像の無断で引用、科学的厳密さの欠如の指標です。

引用の失敗

科学的論文で論点を支持するために意図された引用は、多くのフラグ付き例で「壊れた」または「無関係な出版物」へのリンクであることがわかりました。

さらに、「関連する研究」への参照は、GPTスタイルのシステムによって「妄想」されたと考えられる著者を含むことが多いようです。

注意散漫

最先端の言語モデルであるGPT-3のもう1つの欠点は、長い議論で焦点を失いやすいことです。研究者は、フラグ付きの論文では、論文の序文や他の場所で初めて提示されたトピックが、後で再び取り上げられることがないことが多いことを発見しました。

彼らはまた、ソーステキストが一連の翻訳エンジンを通過することで、各エンジンが意味をさらに歪めることで、最悪の例が発生する可能性があると推測しています。

原因と理由

この現象の背後にあるものを理解しようと試みるにあたり、研究者はいくつかの可能性を示唆しています。ペーパーミルからのコンテンツが、初期段階で不正確さを導入するために使用されている可能性があります。記事スピン工具のようなスピンボットが、盗作を隠すために使用されている可能性があります。定期的に出版するという圧力が、研究者にGPT-3スタイルのシステムを使用して新しい学術論文を生成または補完するよう促している可能性があります。

研究者は、学術出版のこの分野における監視と基準の向上を求める行動の呼びかけで終わります。エルゼビアや他の出版社に、より厳格なスクリーニングとレビュー手順を導入するよう求め、現在の基準と慣行を広く批判し、「合成テキストによる欺瞞は、科学文献の完全性を脅かしています」と述べています。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai