AI 基础

为什么您的生物医学 RAG 会隐藏矛盾之处

mm
将 Unite.AI 添加到您在 Google 上的首选来源

标准生物医学 RAG 在大约四分之三的查询中默默地解决冲突证据。解决方案是结构性的,而不是信息性的——大多数上游复杂性团队添加的内容都没有帮助。

向一个增强型临床助手提出一个简单的问题——褪黑素是否有助于时差症?——它检索的文献将不会自相矛盾。

Cochrane 评论得出结论,褪黑素非常有效,十个纳入的试验中有八个显示了跨越五个或更多时区的航班时差减少。美国精神病学杂志上发表的一项关于 257 名挪威医生的 随机、双盲试验发现任何褪黑素方案都没有益处。

这两份文件都是真实的。两者在方法论上都是严谨的。任何决定要推荐什么的临床医生都需要知道它们存在分歧。

在受控测试中,综合通常没有这样做。它生成了一个流畅、正确引用的段落,站在其中一边,从不表明另一边的存在。

这就是矛盾盲点。在一个矛盾配对的生物医学基准上,它发生在 72.6% 的查询中(95% CI 0.697-0.755)。输出读起来正常。引用正确解析。标准质量检查通过。分歧只是消失了。

看似成功的故障模式

虽然在生物医学相关证据中没有直接收敛,但研究表明,观察性研究与随机对照试验(RCT)之间存在冲突结果,以及不同患者人群使用的方法不同;然而,一项研究也可能同时包含强有力的和弱有力的方法论,这似乎具有相同的权重。

这不是一个独特的案例。Ioannidis 的 对高度引用的临床研究的分析发现,16% 的最常引用的研究后来被直接驳斥,而且观察性研究比随机试验更容易被驳斥或其效果被修订——六分之五,相比之下是三十九分之九。因此,问题不仅仅是研究之间的分歧,而是文献本身的结构性部分。

因此,作为任何生物医学 检索增强生成系统的关键功能,生成关于研究之间分歧的证据应该是一个主要目标。然而,大多数系统都未能完成这一任务。使用 HealthContradict基准的 920 个矛盾配对示例表明,标准检索增强生成(RAG)在大约 73% 的测试对中未能生成分歧。问题不在于检索。系统检索到两边。然后,它默默地解决冲突,偏向其中一方。

手动检查 50 个分层故障案例产生了一个我所说的 认识论扁平化 模式。两个文件都被模型分别引用,其对冲突的渲染以置信度梯度(“轶事证据… 科学研究表明…”)的方式描述,好像没有冲突一样。这些故障案例中不到 5% 使用了“矛盾”、“冲突”或“分歧”等词。生成的输出的引用准确率为 0.99。这正是关键: 引用准确率并不意味着矛盾意识。一个系统可以完美地归属每个句子,但仍然告诉临床医生一些证据基础不支持的东西。

RAG 的“综合”有三个特征,会产生一个危险的临床环境。

反转价值主张。 RAG 的目的是向临床医生展示相关证据。因此,通过删除临床医生审查最重要的证据方面,实际上实现了其相反的目的。

制造不可见性。 由于没有边缘、截断或格式化伪影;“扁平化”的综合和忠实的综合在屏幕上看起来是无法区分的。

沉默地复合。 标准评估套件中没有任何内容可以标记它,因此系统可以在生产中运行几个月,而每个冲突查询都会默默地以一个方向解决。

信息不是杠杆

这个问题的一个明显解决方案是告知模型。显然,如果故障模式是模型未能识别两个文件冲突,则可以简单地向检索到的每个文件添加“支持”或“矛盾”立场标签。这显然应该提高模型的性能。它没有。

在一个实验中,我们向模型添加了立场标签(通过注释)以明确向模型提供两个文件冲突的信息,我们发现显式立场注释将矛盾盲点从未注释的对照组的 93.8% 移动到 91.4% ——一个重叠的置信区间和没有实际意义的差异。尽管模型收到了两个文件冲突的信息,但其默认响应分布保持不变。

理解机制在这里很有用。被动地向提示添加信息不会改变模型的默认响应分布。对于充满矛盾的生物医学问题来说,这个分布强烈地偏向于一个整合的立场。立场标签变成了额外的标记——通常被回收到部分标题中——而正文恢复到类型中。

结构是杠杆

有效的方法是结构性的,而不是信息性的;与其向模型提供所有关于文件的事实或正确信息,不如要求综合构建在可能的分歧(协议、分歧、证据质量、结论)中。具有框架的提示向模型提供的信息并不比未注释的控制更多。唯一的区别在于模型必须做什么。

在没有重新训练、没有管道修改、没有延迟增加和没有每个查询成本增加的情况下,矛盾盲点大约减少了 19 倍——从 93.8% 到 4.9%。这不是提高推理能力。这只是强制分配。一旦模型必须提供一个“分歧”部分,它就会回到最初检索的文件中寻找一些内容来包含在这个部分中。

结构化提示更像是对模型生成行为的轻量化管理,而不是增强模型的推理能力。它迫使模型在分歧上分配一些输出空间(信息之间的差异是可用的,需要出现在输出中以满足要求)。

受控消融下的矛盾盲点在三个综合条件下。添加立场信息将比率移动 2.4 个点;改变所需的输出结构将其移动 86.5 个点。

这改变了一个常见的架构假设。大多数拟议的 RAG 增强功能会向上下文添加信息:更多文件、检索分数、立场标签、证据级别元数据。除非综合提示具有特定的信息结构要求,否则大多数不会改变模型行为。 改变输入在边缘移动质量;改变所需的输出结构直接改变分布

为什么预期的帮助者不起作用

两个被认为是矛盾意识生物医学 RAG 所必需的元素在经过受控消融测试后几乎没有提供任何帮助。

1) PICO 分解。 PICO(人群、干预、比较、结果)是将临床问题分解为组成部分以用于循证医学的有组织方式。假设将主张分解为 PICO 字段将限制范围漂移并在异构证据中改善矛盾检测。移除此级别的结果是输出几乎与完整系统生成的输出无法区分。虽然 PICO 可以在临床决策中组织思维很有用;作为分析时的推断输入以支持矛盾检测,它没有任何可衡量的贡献。

2) 显式立场分类。 与 PICO 移除相比,显式立场分类的表现较差,但不同。在干净的学术语料库上,它在某些指标上产生了小的收益。但是,当分析嘈杂的网络文本时——这通常是面向消费者的健康应用程序访问信息的方式——分类器返回大多数文档的结果为 NOT_ENOUGH_INFO,主要是因为面向消费者的健康内容作者通常不会使用分类器期望的声明性语言来声明他们的立场。因此,这些标签作为无信息被传播到综合上下文中作为噪音。对于嘈杂的语料库,移除此阶段略微改善了矛盾检测。

真正的瓶颈是上游信号质量

本研究最重要的结论是,识别来源中的矛盾的能力受到关于这些来源的信息(数据)准确性的限制,而不是它们的构建或结构方式。

证据质量利用率——综合在两者都可用时更倾向于引用更高质量的来源的比例——在干净的科学摘要上为 0.83,降至嘈杂的网络检索下 0.15。语义引用忠实度遵循相同的模式,从摘要上的 0.66 到消费者健康内容上的 0.45。

相同的管道,不同的语料库。矛盾处理受到源文件中信号的明确性的限制。

这有一个结构上的原因。实际检索的文件通常缺乏任何分类器或加权机制所依赖的提示:出版类型元数据、显式立场陈述、方法描述。同行评议文章的摘要以特定人群、方法和结果的方式声明断言。在消费者健康文章中,以轶事、说服和含糊的语言方式做出相同的断言。因此,相同的系统根据输入的不同会产生截然不同的行为。

这也得到了迄今为止发布的最大医疗 RAG 专家评估的支持,其中 十八位医疗专家贡献了 80,502 个注释,跨越 800 个模型输出。只有 22% 的前 16 个检索段落相关。标准 RAG 相对于非 RAG 基线降低了事实性和完整性。检索和证据选择,而不是生成,是主要的故障点——这是医疗 RAG 基准工作两年来一直报告的内容的回声。

虽然这一发现在应用方面的影响相对有限,但可以肯定地说,当系统从 PubMed 摘要检索时,识别矛盾的能力不能转移到面向消费者的网站,无论系统的其他部分有多先进。

评估的盲点

衡量矛盾处理比看起来更困难,即使标准方法也存在问题。

LLM-judge 评分代表了对开阔式 RAG 输出进行矛盾处理评分的最常见方式,也与结构性确认检查在开发方式上有所不同。组织综合成 PICO 字段的提示策略从法官那里获得高分,同时在明确确认测试中完全失败。这是预期的:LLM 法官已被记录为偏爱更长、更详细的回应,也会将结果部分中的一个埋藏的免责声明视为周密,当正文级别没有引用冲突时。

检索策略引入了第二个陷阱。随机检索产生的矛盾盲点率为零——综合不能未能承认检索集中不存在的矛盾。 最大边缘相关性检索,另一方面,将语义引用忠实度降低到 0.11。每一个在单一矛盾处理指标下看起来都是可以接受的,但在配对评估下都有所欠缺。

所以配对指标。 在每个综合中运行三个检查:一个确定性结构检查以确认语言中存在冲突;一个 LLM 法官用于深度和平衡;以及一个语义引用检查以确认引用的内容与其来源匹配。每一个都可以识别出其他无法识别的内容。没有一个可以单独作为矛盾处理的基准来信任。

本季度的四项行动

  1. 测试您的基准。 每个生产中的生物医学、临床、监管 RAG 系统都必须在进一步部署之前测试其矛盾盲点。要执行此测试,您需要一个矛盾配对测试集和一个每个查询检查,以检查输出是否表明实质性分歧。72.6% 的基准不是一个四舍五入错误。
  2. 实施结构化综合提示。 四个(必需)部分——协议、分歧、证据质量、结论——强制输出带宽在分歧上。没有新基础设施的要求;没有训练的要求;没有每个查询的成本;一个改变产生了 19 倍的减少!
  3. 不要使用 MMR 检索进行矛盾敏感查询。 虽然 MMR 使用多样化的文件进行主题覆盖,但它不针对立场覆盖进行优化——当目标是检索分歧的两边时这是不正确的。因此,bm25 加上嵌入检索应该作为一个更安全的默认值。但是,立场感知多样化将是这项工作指向的方向。
  4. 配对您的评估指标。 退役单个 LLM 法官评分。将其与一个结构检查结合起来,以确认在确认标题下存在实质性内容;以及一个语义引用检查,以验证引用的证据支持声明的断言。

更广泛的观点

RAG 开发的主导直觉是加法的:更好的检索器、更好的重新排名、更丰富的元数据、更长的上下文窗口。关于 为什么 RAG 管道仍然在生产中失败的行业对话基本上遵循了相同的形状。对于矛盾处理,有效的方法是减法的——限制系统允许输出的内容,而不是扩展给它的内容。一个四部分的综合提示优于一个五级管道。它通过改变模型必须产生的内容来实现,而不是改变模型可以看到的内容。

这并不使架构变得无关紧要。检索设置了一个上限,随机检索使综合变得毫无意义,而证据质量限制了所有下游内容。但是,决定是否将冲突证据表示为冲突的因素出现在管道的后面,并且比许多其他组件更容易更改,这意味着可以更快地进行更改以提高可靠性。

更昂贵的工作——更好的矛盾数据集、显式的分歧训练信号、立场敏感检索、矛盾本地基准——仍然需要完成,并且需要更长的时间。

因此,如果您想知道您的系统是否将矛盾的证据表明为矛盾,您应该问自己一个不舒服的问题,并在本周找到答案: 您的系统是否告诉用户其证据相矛盾?

Himanshu Goel 是一位专门从事高风险领域检索增强生成的 AI/ML 研究员,包括生物医学、金融和监管文档工作流。