Andersonの視点

ChatGPT-5とGemini 2.5は40%のニュースルームクエリでホールユーションを起こす

mm
Unite.AI を Google の優先ソースに追加
A robot journalist in a retro newsroom. SDXL, Flux Kontext Pro, Firefly 3, et al.

新しい研究によると、ChatGPT-5とGoogle Geminiは、ニュースルームスタイルのクエリの40%でホールユーションを起こし、検証可能な事実によって裏付けられていない自信を持った主張を頻繁に発明しています。GoogleのNotebookLMは、13%の割合でホールユーションを起こし、どのジャーナリストでも解雇されるレベルです。この研究では、モデルは頻繁に情報源を歪曲し、意見を事実に変え、帰属を取り除き、ジャーナリズムにリスクのあるツールになることを発見しました。著者は、これらのタスクのためのより良い、専用のツールの必要性を強調しています。

 

大規模言語モデルは、最近、ジャーナリズムへの採用が急速に進んでいます。デジタルジャーナリズムが2000年代初頭に開始された不可逆的なプロセスにより、コスト、予算、スタッフが削減された職場環境で採用されています。

実際、メディアは、1980年代のデジタル組版の導入や、1920年代のラジオの出現、1950年代のテレビの出現などの挑戦以来、すでに「革新」による雇用削減に慣れています。

AIのジャーナリズムへの道は、セットバックなしではありません。55%の企業がAIに置き換えられた人間を後悔している状況で、ガートナーは、組織が2年以内にAIの採用スケジュールを大幅に縮小することを予測しています。いくつかのニュース組織は、AIに置き換えられたジャーナリストを再雇用しています。機械学習の代替案の重大で、しばしば恥ずかしい短所が明らかになったためです。

人間だけが間違えるわけではない

ホールユーションは、正確な引用が必要な分野で大きな問題となっています。法務、研究、ジャーナリズムの分野で、AIの失敗ケースに注目が集まっています。新しい米国研究では、ジャーナリズムにおける機械学習が予想よりも大きな課題に直面していることが発覚しました。

研究者は、ChatGPTGoogle Gemini 、および引用に重点を置いたNotebookLMを、レポートスタイルのタスクで評価しました。300文書コーパスを使用し、TikTokに関する米国の訴訟と政策に関するドキュメントを収集しました。

研究者は、プロンプトの特異性と提供されたドキュメントの数を変化させ、結果を分析しました。全出力の30%に少なくとも1つのホールユーションが含まれており、ChatGPTとGeminiはそれぞれ40%のホールユーション率を示しました。一方、NotebookLMは13%のエラー率しか示しませんでした。

研究者は、モデルが事実やエンティティを発明するのではなく、解釈上の過信を示したことを観察しました。モデルは、サポートされていない特性を追加し、帰属された意見を一般的な声明に変えました。

理論と方法

ホールユーションの正確な原因は論争されています。ほとんどの理論は、データの品質と/または分布がトレーニング時の要因であることを同意していますが、LLMの出力の100%が本質的にホールユーションであるという提案もあります。

著者は、次のように述べています。

「技術的な観点から、ホールユーションはLLMが真実を理解せずにパターンに従ったテキストを生成する能力から生じます。この特性により、現実を反映していない信頼性の高い回答が生成されます。例えば、LLMによって作成された架空の判例法が論文に含まれることがあります。」

TikTok

研究者は、ジャーナリズムにおけるホールユーションの影響を評価するために、現実のニュースルームワークフローと基準を反映した評価を実施しました。フロンティアモデルをテストし、共通のプロンプト戦略とドキュメントグラウンド設定を使用しました。

分析は、研究ベースのジャーナリズムと調査ジャーナリズムで典型的なドキュメントベースのクエリに焦点を当てました。著者は、米国でのTikTok禁止の法的努力をテーマに、300文書コーパスをキュレーションしました。

ドキュメントは、ワシントン・ポストニューヨーク・タイムズProQuestWestlawから収集され、5つの学術論文、150のニュース記事、145の法的提出文書で構成されました。

対象者

3つのツールがテストされ、それぞれがドキュメントベースのクエリに異なるアプローチを反映しています。ChatGPT-5は、プロジェクト機能を使用して評価されました。Google Gemini 2.5 Proは、1ミリオントークンのコンテキストウィンドウを使用して、923,000トークンのフルコーパスを直接処理しました。Google NotebookLMは、各サンプルに対して専用のノートブックを使用してテストされました。

データとテスト

初期テストでは、12個のモデル応答のうち40%に少なくとも1つのホールユーションが含まれており、ツールごとのホールユーション率は、ChatGPTとGeminiで40%、NotebookLMで13%でした。

著者は、次のように述べています。

「これは、ほとんどの応答がホールユーションを含まないこと、ツールの選択が同じドキュメントコーパスとクエリセットの結果に違いをもたらすことを示しています。」

結論

3つのモデルそれぞれに長所と短所があります。NotebookLMは、ChatGPTやGeminiよりも引用においてはるかに優れていますが、UXの洗練度は他の2つのプラットフォームに比べ劣ります。ただし、NotebookLMは、ChatGPTのプロジェクト機能やGeminiのコンテキスト処理よりも、より信頼性の高いグラウンドを提供します。

これらのシステムの出力は、特に情報ベースのワークフローでは、人間によるチェックが必要です。ジャーナリズム、法務、科学研究などの分野では、LLMの現在の限界を超える、より良いツールの必要性があります。

現在、LLMの出力は、人間によるチェックが必要です。ジャーナリズム、法務、科学研究などの分野では、LLMの現在の限界を超える、より良いツールの必要性があります。

* Google Cloudは、このトピックについて興味深い概要を提供しています。

著者のインライン引用をハイパーリンクに変換しました。

2025年10月1日初版。2025年10月2日修正:TL;DRのエラーを修正し、最初の段落のスタイリストエラーを修正しました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai