Andersonの視点
さほど高度なAIでなくとも、人間が書いた記事と見分けがつかない記事を書くことができる

新しい研究によると、さほど高度なAIモデルでなくとも、人間が書いた記事と見分けがつかない記事を書くことができることがわかった。最先端のシステムと同じレベルで、読者は誰が書いたか判断することができない。
ドイツとフランスの共同研究によると、人間はAIが書いた記事か人間が書いた記事か判断することができない。オープンソースモデルでさえ、平均的な消費者レベルのデスクトップコンピューターで動作することができる。
また、小規模なAIが台頭していることを示す別の指標として、2,318件の判断と1,054人の参加者を集めた学術研究ポータルでは、人間の読者は、7億パラメーターのモデルの出力である記事を、チャンスレベルを超えて判断することができないことがわかった。MistralやLlamaのバリアントも含まれる。

テストされたLLMの平均ソースと真実性スコア。GPT-4oの200億パラメータは、7Bパラメータの小規模モデルを大幅に上回らない。テストされたモデルは、Gemma 7B、Phi-3 Mini、LLaMA-2 13B、Mistral 7B、GPT-4o、GPT-3.5である。 ソース
研究者たちは、2024年に最初に調査したテーマに戻っている。 リリース 祝福か呪いか?ジェネレーティブAIのフェイクニュースへの影響に関する調査。発見そのものは、2024年に最初に発表されたプロジェクトの新しく発表された結果であり、研究者たちの独自の JudgeGPT オンライン参加フレームワークを使用している。
軽量化されたパワー
「人間は判断できるか?LLM生成ニュースの人間の認識に関する二軸研究」というタイトルのこの研究は、フランクフルト応用科学大学とナントのIRISA研究ユニットの3人の研究者によって行われた。研究の方法論は、「フェイクニュース」と「AI書きニュース」(フェイクニュースは人間によって書かれることも、AIによって書かれることもあり、両者は同義ではない)という2つの概念を区別する重要な違いを示している。
しかし、多くの場合、最も興味深い側面は、この論文の結論である。7Bパラメーターのみで、Mistral 7BやGemma 7Bのような小規模モデルは、200億パラメーターのチャットGPTモデル(4o)と対等に戦うことができるということである。
‘オープンウェイトモデルのパラメータ数が7Bでさえ、GPT-4oの出力と同じように評価されるテキストを生成することができる。つまり、人間と見分けがつかないテキストを生成する能力は、最先端のモデルに限定されていない。
しかし、「AI生成ニュース」は、スペルチェックからフルな労力の転嫁まで、さまざまな人間とAIのコラボレーションを表すことができる。この研究では、テストに使用されたAIコンテンツの種類については明確にしていない(ただし、生成方法については以下で説明する)。
方法
JudgeGPTプラットフォームに参加した参加者は、各ニュースフラグメントについて、連続した0-100スライダーで3つの独立した評価を行った。

評価者がソースの帰属、真実性、トピックの熟知度を評価するJudgeGPTポータルのGUI。ソースペーパーを参照してください。
ソースの判断は、文章が機械によって書かれたか人間によって書かれたかを捉えるものでした。真実性の判断は、文章が偽物か本物かを捉えるものでした。トピックの熟知度は、読者がテーマにどれだけ詳しかったかを捉えるものでした。
連続スケールは、Likertスケールよりも、確実性の度合いをより正確に捉えるために使用されました。また、統計分析、包括してPearson相関とクラスタリングを含むことも可能になりました。
機械生成テキストフラグメントは、研究者たちの独自の RogueGPTフレームワーク によって生成されました。RogueGPTは、JudgeGPTのフィーダーアーキテクチャです。RogueGPTは、6つの大規模言語モデル(LLM)からの貢献を調整します: ChatGPT-4; ChatGPT-3.5; ChatGPT-4o; LLaMA-2 13B;Gemma 7B;およびMistral 7B。
パーソナベースのプロンプティングが使用され、AI生成は現実のニューストピックに基づいており、人間によって事実確認されました。
一方、人間が書いたフラグメントは、既存のニュース媒体と情報データベースからサンプリングされました。
研究者たちは以下のように述べています:
‘刺激セットは、機械起源のフラグメント(約98%)に故意に偏っています。人間起源のアイテムは、校正アンカーとして機能します。 ‘
‘この設計選択は、人間とAIの比較ではなく、AI内の変動(モデル間)に焦点を当てていることを反映しています。参加者は基準率に通知されず、人間起源のサブセットのみを分析した場合でも、ほぼチャンスレベルの検出結果が得られます。 ‘
参加者は、まずインフォームドコンセントを与え、年齢、教育、政治的志向、AIへの熟知度に関するデモグラフィッククエスチョンに答えた後、ニュースフラグメントのシーケンスを評価しました。
各人は5〜87アイテムをレビューし、中央値は12でした。プレゼンテーションの順序はランダム化され、モデル割り当ては参加者間でバランスが取られ、偏りの可能性を減らすために行われました。プラットフォームは、レスポンスタイムと匿名識別子とともに、3つのスライダーレイティングを記録しました。これにより、個々の判断が背景要因とリンクすることができました。
研究者たちは、サンプルがヨーロッパに住む、大学教育を受けた人々(68%)に偏っていることを指摘しており、これはより広範な一般化の制限であると論文では述べられています。
テスト
テストは、5つの発見のタイプに分けられます。機械生成テキストと人間書きテキストを区別すること、異なるLLM間の検出の比較、ドメインの専門知識と政治的志向が精度に与える影響の検討、参加者の間で異なる応答戦略の特定、繰り返し評価での精度の変化の追跡(疲労によるもの):

1,054人の参加者から2,318件の判断の5つの主要な発見の要約。人間のAI書きテキストの検出はすべてのモデルでチャンスレベルに留まり、精度はドメインの専門知識によって予測されることが示され、参加者は2つの信頼プロファイルに分かれ、約30回の評価後にパフォーマンスが低下することが示された。
テストでは、参加者がAI生成テキストと人間書きテキストを区別することができないことが示されました。

機械起源と人間起源のフラグメントのソースと真実性スコアの分布。2つの条件間で有意差はなく、統計的テストではAI生成テキストと人間書きテキストを信頼性を持って区別することができない。
2つ目の側面では、グラフは、検出の失敗はモデルによって変化しないことを示しています。すべてのLLMの出力は、チャンスレベルの判断を示すクラスターを形成し、間にある有意差はありません。Mistral 7BやGemma 7Bのような小規模なオープンウェイトシステムは、GPT-4oと同等に評価され、人間と見分けがつかないテキストは、最も大きなモデルに限定されていないことを示しています。
3つ目の側面では、精度はドメインの専門知識によってより強く予測され、政治的志向は有意差を示しませんでした。フェイクニュースに精通していることが、両方の軸で精度の向上と関連していることが示されました。

3つ目の調査線に関する結果。参加者の背景要因と判断精度の相関関係は、政治的志向がソース帰属または真実性スコアリングに有意な影響を与えないことを示しています。一方、フェイクニュースへの熟知度は、両方の軸で精度の向上と関連しています。ソースペーパーを参照してください。
4つ目の発見では、参加者は、コンテンツの起源に関係なく低い信頼を割り当てる「懐疑者」と、より高い信頼の基準を維持する「信頼者」という2つの異なる応答スタイルに分かれました。
最後に、5つ目の目的では、連続的な判断のローリング分析により、参加者は最初の約15〜20の評価でタスクに適応し、精度が向上することが示されました。

参加者の評価のシーケンスを通したソース帰属と真実性スコアのローリング平均。ユーザーはタスクに適応し、最初の15〜20アイテムで短期的な改善が見られるが、その後約30回の評価後に両方の尺度でパフォーマンスが低下する。デフォルトレスポンスへの低下は、認知的疲労と解釈される。ソースペーパーを参照してください。
しかし、この効果は短期間で終了し、約30アイテム後にパフォーマンスが低下し、参加者はコンテンツを偽物としてラベル付けする傾向にありました。これは、検出に基づくアプローチが持続可能な期間に効果的である限界を示唆しています。
これは、フェイクニュースと本物のニュース、AIニュースと人間のニュースを区別するという課題に疲れたため、安全のためにAIと/orフェイクニュースであると仮定する傾向があることを示唆しています。自分で調査して潜在的なフェイクニュースストーリーを検証するよう人々に求めることは、フェイクニュースの問題を悪化させるだけであると主張する人にとって、2024年の研究 が示唆 しています。
研究者たちは、結果から導かれる人間の判断の失敗は、暗号技術による出典プロバンス技術への移行を示唆しており、Adobeが主導する C2PAイニシアチブ などがその例である。他の可能な解決策として、研究者たちの独自の OriginLens フレームワークや、CRED-1という別のプロジェクトが挙げられる。
研究者たちは以下のように結論付けます:
‘人間は判断できるか?私たちの二軸研究は、2,318件の判断と6つのLLMファミリーを通じて明確な実証的な答えを提供します。人間は判断できない。
‘機械生成テキストは、モデルサイズやファミリーに関係なく、人間の書き言葉と区別できない。ドメインの専門知識は政治的志向よりも検出精度を強く予測し、参加者は異なる信頼戦略を採用し、認知的疲労により持続的な検出が制限される。 ‘
‘これらの発見は、ユーザーレベルの検出からシステムレベルの対策への移行を支持しています。コンテンツの出典、適応的な信頼指標、制限付きの予防接種介入が含まれる。
結論
この論文の心配な点は、研究者たちが関与しているプロジェクトや論文の周辺ネットワークであり、研究者たちがこれまでに始めたか、または関与しているプロジェクトや論文のネットワークである。研究者たちは、AI生成テキストと人間書きテキストのサンプルを調査することができたとしたら、もっと理解が深まったでしょう。
しかし、オープンウェイト、オープンソースモデルがChatGPTシリーズのようなAPI駆動の大型モデルと比較できるということは興味深いです。200億パラメーターのモデルは、実際のタスクには過剰である可能性があります。AI生成と人間書きのソースサンプルについてもう少し詳しく知る必要があります。
その間、canirun.aiウェブサイトによると、Mistral 7B(テストでChatGPT-4oとほぼ同等であった)は、NVIDIA RTX 3080で「動作」し、6GBのVRAMを備えた3060では「まあまあ」動作するようです。つまり、これらの実験に参加したい人は、最新のグラフィックスカードを持っていなくても参加することができます。
* Gemma 7Bはサイトにリストされていません。
2026年4月9日木曜日に初めて公開されました












