Andersonの視点
ChatGPT-5とGemini 2.5は40%のニュースルームクエリでホールユーションを起こす

新しい研究によると、ChatGPT-5とGoogle Geminiはニュース編集室を想定した質問の40%でハルシネーションを起こし、検証可能な事実に裏付けられない断定的な主張を頻繁に作り出しました。NotebookLMは13%と比較的良好でしたが、それでも記者なら解雇されかねない水準です。モデルは意見を事実に変え、出典を取り除くことで資料を歪めており、ジャーナリズムでの利用には危険があります。著者らは、この用途に特化したより優れたツールを求めています。
大規模言語モデルはジャーナリズムに急速に導入されています。この業界では、デジタルジャーナリズムが2000年代初頭から続く止めがたい変化の中で200年の伝統を崩して以来、コスト、予算、人員の削減が続いてきました。
メディアは1980年代のデジタル組版の混乱を伴う導入、さらに以前のラジオやテレビの登場以来、「革新」による雇用削減に慣れていました。
しかしAIの編集室への進出にも挫折があります。人間をAIに置き換えた企業の55%が後悔し、Gartnerは2年以内にAI導入計画が大幅に縮小されると予測しています。機械学習の深刻で時に恥ずかしい欠点が明らかになり、一部の報道機関はAIに置き換えた記者を再雇用しました。
誤りは人間だけのものではない
正確な引用が重要な法律、研究、ジャーナリズムでは、ハルシネーションが大問題です。米国の新研究は、ジャーナリズムにおける機械学習の課題が予想以上に広いことを示しました。
研究者は、米国のTikTok訴訟と政策に関する300文書のコーパスを使い、ChatGPT、Google Gemini、引用重視のNotebookLMを報道形式の課題で評価しました。
プロンプトの具体性と文書数を変え、ハルシネーションの種類と重大度を分類しました。全出力の30%に少なくとも1件のハルシネーションがあり、ChatGPTとGeminiはそれぞれ40%、NotebookLMは13%でした。
モデルは事実や固有名を捏造するより、解釈上の過信を示しました。裏付けのない特徴付けを加え、出典が明示された意見を一般的な断定に変えたのです。
「多くの誤りは架空の固有名や数字ではなく、根拠のない出典の特徴付けを加え、帰属のある意見を一般論へ変える解釈上の過信だった。」
「これは根本的な認識論的不一致を示す。ジャーナリズムはすべての主張に明示的な出典を求めるが、LLMは証拠の有無に関係なく権威ある文章を生成する。」
「編集室向けの有効なツールには、流暢さではなく正確な出典表示を強制する設計が必要だ。」
5ページの論文はNot Wrong, But Untrue: LLM Overconfidence in Document-Based Queriesと題され、Northwestern UniversityとUniversity of Minnesotaの研究者3名が執筆しました。
理論と手法
ハルシネーションの正確な原因*には議論があります。ほぼすべての理論が、学習時のデータ品質や分布を要因とみなします。LLMの出力は100%本質的にハルシネーションで、その一部が現実と一致するだけだという説さえあります。
著者らは次のように述べます†。
「技術的には、LLMが真実を理解せず一般的なパターンに沿った文章を生成できるため、ハルシネーションが生じる。たとえば、LLMが捏造した判例が法廷の主張に入り込む。」
「過去5年で能力は劇的に向上したが、ハルシネーションは残り、モデルがより高性能になるほど増える場合もある。」
対策は三つに分かれます。第一のコンテキストでは、データベース、文書、ウェブなど外部資料にモデルを接地します。資料が完全で信頼できれば有効ですが、欠落、古さ、低品質は誤りを生み、モデルが資料以上のことを断定する場合もあります。
第二のプロンプトとデコーディングでは、証拠の確認、タスク分割、厳格な形式、自己レビュー、複数回答の比較を指示します。一部の誤りを見つけますが費用が増え、微妙な誤りを逃すため、検証負担は利用者に残ります。
第三のモデルとツールでは検索、計算機、出典付き学習データ、引用機能を与えます。これも資料の質、指針の明確さ、人間の監督に依存します。
TikTok
研究は実際の編集業務と基準を反映し、一般的なプロンプト戦略と文書接地で最先端モデルを評価しました。対象は調査報道に典型的な文書検索で、中小編集室のプロジェクトに似ながら十分複雑な米国のTikTok禁止をめぐる法的動きを選びました。
Washington Post、New York Times、ProQuest、Westlawから、学術論文5件、ニュース150件、裁判資料145件、計300件を収集しました。全資料は研究者向けにリポジトリで提供されます。
質問は一般的な禁止問題から特定裁判の証言まで5段階で、各モデルに10件、100件、または全300件を与え、主要2文書を必ず含めました。モデルごとに15回答を作り、ChatGPTのみ10回答に制限されました。
比較対象
ChatGPT-5は100文書制限のProjects、Gemini 2.5 Proは100万トークン窓で全300文書、計923,000トークンを処理しました。引用検索を内蔵するNotebookLMは標本ごとの専用ノートを使いました。
いずれも記者が利用できる実在ツールです。2023年の研究の分類法を使い、方向(歪曲か敷衍)、分類、重大度(軽度・中度・警戒)を記録しました。1人の著者が全文章を確認し、分類外の誤りはその他としてジャーナリズム固有の分類作成に用いました。
データとテスト
最初の試験では40回答中12件に少なくとも1件のハルシネーションがありました。ChatGPTとGeminiは各40%、NotebookLMは13%でした。

各ツールの総ハルシネーション率。GeminiとChatGPTは誤りを含む回答の割合が最も高い。 出典:https://arxiv.org/pdf/2509.25498
「大半の回答にはハルシネーションがないものの、同じ文書と質問でもツールの選択で差が生じる。」
ハルシネーションは単独ではほぼ起きません。誤った回答1件あたりGeminiは平均4件、NotebookLMは3件、ChatGPTは1.5件でした。大半は中度でしたが14%は警戒レベルでした。ChatGPTが資料にないTikTok禁止の報復動機を作った例もあります。
「ChatGPTはTikTok禁止を中国の政策に対する米議員の相互措置と説明したが、引用文書には全く存在しない主張だった。」
ハルシネーション回答の64%が事実誤認や脱線を加え、この種の情報作業でLLMが本当に時間を節約するか疑問を生みました。
偽の引用や略語の誤展開など、多くは既存分類に入りませんでした。NotebookLMの低い率は、引用型RAGがChatGPT ProjectsやGeminiのコンテキスト処理より特定文書に安定して接地することを示唆します。
質的には事実の捏造より解釈の行き過ぎが主因でした。
「モデルは文書の目的、読者、話者の意図を根拠なく断定し、暫定的または帰属付きの記述を確定的主張に変えた。」
過信は、文書の対象や目的への根拠なき断定と、帰属された意見を事実らしい記述へ変える形で現れました。全ツールに見られ、ほとんどは捏造より過剰解釈でした。
出典の欠落や曖昧な資料説明は、明確な出典が必須のジャーナリズムで既存分類が重要な誤りを見逃すことを示します。モデルは文書が裏付けない分析を自信満々に加え、重要な帰属を取り除きます。
結論
三つのモデルにはそれぞれ長短があります。NotebookLMは引用で大幅に優れますが、そのために設計されたにもかかわらず、記者、研究者、弁護士なら職を失いかねない誤り率です。研究ツールとして、他の二つほど洗練された執筆機能もありません。
ただしNotebookLMは、類似文書の一般的な傾向から中身を推測するChatGPTの危険な習慣とは違い、アップロード文書を実際に読むようです。ChatGPTにメタデータや推測ではなく全文を読ませるのは困難な場合があります。
法律、ジャーナリズム、科学研究のように来歴と引用が重要な分野で、現在の主要LLMには、指定された情報を正確に抽出し扱う能力の限界を改善するネイティブ訓練機能がありません。
単なるシステムプロンプトやMCP設定より良い補助システムが現れるまで、重要分野の出力は高価で面倒でも必要な人間がすべて確認しなければなりません。
* Google Cloudによる詳しい解説はこちらです。
† 著者の文中引用をハイパーリンクに変換しました。
2025年10月1日水曜日初出。10月2日に要約の誤りと冒頭段落の文体を修正。












