Anderson 视角
ChatGPT-5 和 Gemini 2.5 在 40% 的新闻编辑室查询中产生幻觉

一项新研究发现,ChatGPT-5 和 Google Gemini 在 40% 的新闻编辑室风格的查询中产生幻觉,经常编造出听起来令人信服的说法,但没有可验证的事实作为依据。Google 的 NotebookLM 的表现更好,只有 13% 的错误率——即使这样,也足以让任何记者失去工作。研究发现,这些模型经常通过将意见转化为事实并去掉引用来源来歪曲来源,使得它们成为新闻工作中不靠谱的工具。研究人员呼吁开发更好、更专门的工具来完成这些任务。
大型语言模型近年来在新闻业中得到快速采用,在新闻业成本、预算和员工不断削减的工作环境中,这种趋势尤其明显。自从数字新闻 颠覆了两个世纪的传统 以来,新闻业已经经历了一场 不可逆转的过程,这场过程始于 21 世纪初。
事实上,媒体已经习惯了通过 “创新” 来裁员,至少从 20 世纪 80 年代数字排版的 动荡引入 开始,以及更早的 广播 和 电视 的挑战。
人工智能在新闻编辑室和媒体机构中的普及之路并非一帆风顺;在一个 55% 的公司后悔 用人工智能取代人类的背景下,高德纳预测,组织将在两年内大幅削减人工智能采用的计划。一些新闻机构已经 重新雇佣 被人工智能取代的记者,因为机器学习替代品的严重且经常 令人尴尬 的缺陷变得明显。
错误不仅仅是人类的特征
虽然 幻觉 已经被证明是需要准确引用的事业中的一个巨大问题(尤其是在 法律、研究 和 新闻 领域引起了显著的公众关注),一项新美国研究发现,新闻业中的机器学习面临着比预期更广泛的挑战。
研究人员评估了 ChatGPT、Google Gemini 和更侧重于引用来源的 NotebookLM,使用的是一个 300 个文档的语料库,重点关注美国的 TikTok 诉讼和政策。
研究人员改变了提示的具体性和提供的文档数量,然后使用一种旨在捕捉幻觉类型和严重程度的分类法来分析结果。
在所有输出中,30% 含有至少一个幻觉,而 ChatGPT 和 Gemini 各自显示了 40% 的幻觉率——比 NotebookLM 的 13% 错误率高出三倍多。
研究人员指出,模型通常不会编造事实或实体,而是表现出 解释性过度自信,添加不支持的特征并将归因的意见转化为一般性陈述:
‘从质上讲,大多数错误并不涉及编造的实体或数字;相反,我们观察到解释性过度自信——模型添加了不支持的来源特征,并将归因的意见转化为一般性陈述。 ‘
‘这些模式揭示了一个基本的认识论差异:虽然新闻业需要对每个说法进行明确的引用,但大型语言模型会生成听起来有权威的文本,无论是否有证据支持。 ‘
‘我们提议新闻业特定的现有幻觉分类法扩展,并认为有效的新闻编辑室工具需要架构来强制准确的归因,而不是优化流畅度。’
这项 新研究 是一篇引人入胜但简短的文章,仅五页,题为 不正确,但不真实:大型语言模型在基于文档的查询中的过度自信,由来自西北大学和明尼苏达大学的三位研究人员撰写。
理论与方法
幻觉的确切原因存在争议;尽管几乎所有理论都同意,数据质量和/或分布在训练期间是一个 贡献因素,甚至有人 提出,100% 的大型语言模型输出本质上是幻觉(除了其中一些幻觉碰巧与现实相吻合)。
研究人员观察到:
‘从技术角度来看,幻觉源于大型语言模型生成文本的能力,这些文本遵循常见的模式,但不具备对真相的理解。这种特性导致了听起来合理的回应,但不反映现实——例如,大型语言模型编造的案例法可能 进入辩论。 ‘
‘而大型语言模型的能力在过去五年中有了显著的提高,幻觉仍然是一个问题,在某些情况下甚至随着模型变得 更 强大 而增加。’
研究领域已经探索了几种减少或更好地理解大型语言模型幻觉的方法,这些方法通常分为三个主要领域:首先,在 上下文 中,模型可以通过外部来源(如数据库、文档集合或网络内容)来支持其说法。
这在材料可靠且完整时效果很好,但空白、过时的信息或质量差的数据仍然会导致错误;模型也经常做出自信的陈述,超出了来源实际所说的话。
第二,提示和解码 指的是使用仔细的指令来引导模型。这可以涉及要求模型检查其证据,分解任务为较小的步骤,或遵循更严格的格式。有时,模型甚至被指示检查其自己的工作或比较多个响应。
这些技术可以捕捉错误,但它们也增加了成本,并且经常无法检测到微妙的错误;因此,缺乏可靠的证据检查,验证的负担仍然落在用户身上。
第三,模型和工具 指的是为大型语言模型提供可以支持验证的资源,例如搜索引擎或计算器——尽管准确性也可以通过在精心来源的数据上训练模型或内置引用功能来提高。
然而,这些措施并非万无一失,仍然依赖于来源的质量、指南的清晰度和人类的监督,以防止虚假信息的传播。
TikTok
为了了解哪些方法可能对记者真正有用,研究人员进行了评估,以反映真实的新闻编辑室工作流程和标准,在典型的报道任务中检查幻觉。
前沿模型使用常见的提示策略和文档接地设置进行测试,以便可以衡量幻觉错误的频率和类型,以及这些错误对将人工智能集成到新闻编辑室的影响。
分析重点关注的是基于文档的查询,这在研究型和调查性新闻中很常见。研究人员旨在策划一个语料库,以反映典型的小型至中型新闻编辑室项目,同时仍然足够大,以捕捉现实世界报道的复杂性;为此,他们选择了美国 禁止使用 TikTok 的正在进行的法律努力。
从 华盛顿邮报、纽约时报、ProQuest 和 Westlaw 收集的文档,结果形成了一个 300 个文档的集合,包括五篇学术论文、150 篇新闻文章和 145 个法律文件(完整的编译可通过项目的 存储库 向学术研究人员提供)。
由于大型语言模型的响应严重依赖于提示的措辞和提供的上下文,研究人员设计了五个查询,从非常广泛到非常具体——从关于禁止使用 TikTok 的一般性问题到详细的提示,要求提供特定法庭案件的证词。
为每个模型提供的文档数量各不相同,分别为 10、100 或全部 300 个文档,从完整的语料库中选取,每个样本中都包含两个关键文档,以确保一致性。每个模型生成了 15 个响应,除了 ChatGPT 仅限于 10 个响应。
竞争者
测试了三种工具,每种工具代表了对基于文档的查询的不同方法:ChatGPT-5 使用 项目 功能进行评估,该功能限制了 100 个文档的上传;Google Gemini 2.5 Pro 能够在上下文中处理全部 300 个文档(使用其 100 万令牌的上下文窗口直接处理 923,000 个令牌);Google NotebookLM 提供了内置的引用检索,使用专门为每个样本创建的笔记本进行测试。
虽然这些文档处理方法不同,但所有三种都代表了目前可用的真实工具;此外,当前的状态更为实验性,而不是同质化,不同的产品在功能和范围方面存在差异。
为了捕捉可能的幻觉行为,研究人员使用了来自 2023 年之前的工作 的分类法,幻觉根据 方向(扭曲与阐述)、类别(错误类型)和 程度(严重程度,分别为 轻微、中等 或 惊人)进行编码。
所有模型输出都由一个人类作者注释,该作者审查了每个句子并应用了这些代码。未被分类法涵盖的错误被标记为 杂项,并稍后分析以开发新闻特定的类别。
数据和测试
在初始测试中,40 个模型响应中有 12 个被发现至少包含一个幻觉,不同工具之间的结果存在显著差异。ChatGPT 和 Gemini 各自在 40% 的输出中产生幻觉,而 NotebookLM 只在 13% 的情况下产生幻觉:

每种工具的总体幻觉率,Gemini 和 ChatGPT 产生了最高比例的包含错误的响应。 来源:https://arxiv.org/pdf/2509.25498
关于这些结果,研究人员评论说:
‘这表明,虽然大多数响应在所有工具中都没有幻觉,但工具的选择确实对相同的文档语料库和查询集产生了影响。’
幻觉很少单独出现,论文指出;Gemini 的平均值为每个有缺陷的响应四个,NotebookLM 为三个,ChatGPT 为 1.5。其中大多数是中等严重程度的,但 14% 被归类为 惊人。在一个案例中,ChatGPT 编造了一个关于禁止使用 TikTok 的报复动机,这在来源文档中并不存在:
‘在一个查询中,ChatGPT 将可能的禁止使用 TikTok 案例框定为美国立法者对中国政策的回应措施,这一说法完全不存在于引用的来源文档中。’
总体而言,64% 的产生幻觉的响应引入了事实错误或离题,这可能会引发人们对在这种基于信息的工作流程中使用大型语言模型是否真正节省时间的质疑。
在此初始测试中,大多数幻觉不符合现有的分类法类别,通常涉及编造的引语或不正确的首字母缩写,表明当前的框架对于新闻使用可能过于狭窄。
NotebookLM 较低的幻觉率,研究人员观察到,表明其基于引用的 RAG 系统提供了比 ChatGPT 的项目功能或 Gemini 的上下文处理更可靠的接地,特别是当必须引用特定文档时。
关于观察到的幻觉的定性特征的研究,研究人员观察到:
‘模型添加了关于文档目的、受众和演讲者意图的自信特征,这些听起来很有权威,但在实际文本中没有任何依据。它们将犹豫或归因的陈述转化为确定的说法。’
过度自信表现为两种形式:首先,模型添加了关于文档受众或目的的不支持的说法,例如将一篇文章标记为“为公众撰写”或一份文件为“针对律师”。
第二,它们将归因的意见 转化为类似事实的陈述,模糊了原始来源并破坏了来源评估。
这些行为出现在所有工具中,并不局限于一种架构——大多数错误并不是编造,而是 过度解读。
大多数幻觉被标记为 杂项,因为它们不符合现有的类别,模糊了错误类型之间的关键差异。频繁出现的问题,例如 缺乏归属 和模糊的来源描述,表明当前的分类法忽略了新闻中最重要的错误类型,在新闻中,清晰的来源至关重要。
研究人员观察到 ‘模型添加了文档不支持的自信分析,并去掉了关键的归属。’
结论
任何人如果尝试过这篇新论文中研究的三个模型,都会知道每个模型都有其优缺点。虽然 NotebookLM 在引用方面的表现远远优于 ChatGPT 或 Gemini,但考虑到它是专门为此功能而设计的,它仍然具有足以让大多数记者、研究人员或律师失去工作的错误率。
另外,NotebookLM 作为一个研究框架,缺乏使其他两个平台更容易使用的用户体验改进。
然而,至少 NotebookLM 看起来确实会阅读上传的文档,而不是陷入 ChatGPT 那种破坏性的习惯,即根据其对类似文档的一般分布推断上传文档可能会说什么。很难让任何版本的 ChatGPT 进行上传材料的全文阅读,而不是依赖于元数据或其自身的推断/幻觉。
在需要来源和引用标准至关重要的领域,例如法律、新闻和科学研究,目前市场领先的大型语言模型中似乎没有任何 本地训练 的设施可以改进其有限的能力,以准确提取和处理用户指示的信息。
就目前而言,直到出现可以为大型语言模型提供比简单的 系统提示 或 MCP 设置 更好的接口的辅助系统到来之前,对于这些任务至关重要的领域,所有这些系统的输出仍然需要由那些昂贵、笨拙且通常很麻烦的人类来检查。
* Google Cloud 提供了一个关于这个话题的合理有趣且详细的概述,可以在 这里 找到。
† 我将作者的内联引用转换为超链接。
首次发布于 2025 年 10 月 1 日星期三。2025 年 10 月 2 日星期四修改,以纠正 TL;DR 中的错误并修改第一段的风格错误。












