AI 模型与平台

少即是多:为什么检索较少的文档可以提高AI答案的质量

mm
将 Unite.AI 添加到您在 Google 上的首选来源

检索增强生成(Retrieval-Augmented Generation,RAG)是一种结合语言模型和外部知识源的AI系统构建方法。简单来说,AI首先搜索与用户查询相关的文档(如文章或网页),然后使用这些文档生成更准确的答案。这种方法因帮助大型语言模型(LLM)保持事实性和减少幻觉而受到赞扬,因为它们将回答建立在真实数据之上。

直观上,人们可能认为,AI检索的文档越多,其答案就越好。然而,最近的研究表明了一个令人惊讶的转折:在向AI提供信息时,有时少即是多。

较少的文档,较好的答案

耶路撒冷希伯来大学的研究人员进行了一项新研究,探讨了RAG系统中提供给AI的文档数量对其性能的影响。关键是,他们保持了总文本量不变——如果提供的文档较少,则这些文档会稍微扩大以填充与许多文档相同的长度。这样,任何性能差异都可以归因于文档数量,而不是简单地因为输入较短。

研究人员使用了一个问题答案数据集(MuSiQue),其中包含琐事问题,每个问题最初与20个维基百科段落相关(其中只有少数包含答案,其他都是干扰项)。通过将文档数量从20减少到仅2-4个真正相关的文档——并用一点额外的上下文来维持一致的长度——他们创建了场景,其中AI有较少的材料来考虑,但仍然有大致相同数量的单词来阅读。

结果令人惊讶。在大多数情况下,当AI被给予较少的文档而不是全部文档时,AI模型的答案更准确。性能有了显著的提高——在某些情况下,准确率提高了多达10%(F1评分),当系统仅使用少量支持文档而不是大量集合时。这种违反直觉的提升在多个开源语言模型中都观察到了,包括Meta的Llama变体等,表明这种现象并非特定于某个AI模型。

其中一个模型(Qwen-2)是一个值得注意的例外,它可以处理多个文档而不会降低评分,但几乎所有测试的模型都在整体上表现得更好,使用较少的文档。换句话说,添加超过关键相关文档的参考材料实际上更常地损害了它们的性能,而不是有所帮助。

来源:Levy等人

为什么这会令人惊讶?通常,RAG系统的设计假设检索更广泛的信息只能帮助AI——毕竟,如果答案不在前几个文档中,它可能在第十或第二十个文档中。

这项研究颠覆了这种说法,证明了无差别地添加更多文档可能会适得其反。即使总文本长度保持不变,多个文档的存在(每个文档都有其自己的上下文和怪癖)使得AI的问答任务更加具有挑战性。看来,超过某个点后,每个额外的文档引入的噪音比信号多,混淆了模型并损害了其提取正确答案的能力。

为什么RAG中少即是多

这种“少即是多”的结果在我们考虑到AI语言模型如何处理信息时是有道理的。当AI仅被给予最相关的文档时,它看到的上下文是专注的,免受干扰,就像一个学生被交给了正确的页面来学习一样。

在研究中,模型在被给予仅支持文档且不相关材料被移除时表现得更好。剩余的上下文不仅更短,而且更干净——它包含直接指向答案的事实,除此之外什么都没有。由于文档较少,模型可以将其全部注意力集中在相关信息上,使其不太可能被分散注意力或混淆。

另一方面,当检索到很多文档时,AI必须筛选相关和不相关的内容。这些额外的文档通常是“相似但无关”的——它们可能与查询共享主题或关键词,但实际上并不包含答案。这种内容可能会误导模型。AI可能会浪费精力尝试在不实际指向正确答案的文档之间建立联系,或者更糟糕的是,它可能会错误地合并来自多个来源的信息。这种情况增加了幻觉的风险——AI生成的答案听起来很合理,但并没有任何单一来源作为依据。

本质上,向模型提供过多的文档可能会稀释有用的信息并引入相互冲突的细节,使得AI更难判断什么是真实的。

有趣的是,研究人员发现,如果额外的文档明显不相关(例如,随机无关的文本),模型更擅长忽略它们。真正的麻烦来自于看似相关的干扰数据:当所有检索的文本都在相似的主题上时,AI假设它应该使用所有这些文本,并且可能难以判断哪些细节实际上很重要。这与研究的观察一致,即“随机干扰项比现实干扰项引起的混淆较少”。AI可以过滤掉明显的无稽之谈,但微妙地离题的信息是一个巧妙的陷阱——它以相关性为借口潜入并破坏答案。通过将文档数量减少到仅必要的文档,我们可以避免最初设置这些陷阱。

还有一种实际的好处:检索和处理较少的文档可以降低RAG系统的计算开销。每个被拉取的文档都必须被分析(嵌入、读取和被模型关注),这需要时间和计算资源。消除多余的文档使得系统更加高效——它可以更快、更低成本地找到答案。在准确性通过关注较少的来源而提高的场景中,我们获得了双赢:更好的答案和更精简、更高效的流程。

来源:Levy等人

重新思考RAG:未来方向

这种质量往往优于数量的检索结果对依赖外部知识的AI系统的未来具有重要的影响。它表明,RAG系统的设计者应该优先考虑智能过滤和文档排名,而不是简单地依靠文档数量。与其检索100个可能的段落并希望答案被埋藏在某个地方,不如检索仅最相关的前几项。

研究作者强调了检索方法需要“在相关性和多样性之间取得平衡”的必要性,以便为模型提供信息。换句话说,我们希望提供足够的主题覆盖范围来回答问题,但又不能提供太多以至于核心事实被大量无关紧要的文本淹没。

在未来,研究人员可能会探索技术,以帮助AI模型更优雅地处理多个文档。一个方法是开发更好的检索系统或重新排名系统,以确定哪些文档真正增加了价值,哪些文档只引入了冲突。另一个角度是改进语言模型本身:如果一个模型(如Qwen-2)能够处理多个文档而不会失去准确性,研究它的训练或结构可能会提供线索,以使其他模型更加强大。也许未来的大型语言模型将纳入机制,以识别何时两个来源说的是同一件事(或相互矛盾),并专注于此。目标将是使模型能够利用多种来源的丰富信息,而不会陷入混淆——有效地同时获得信息的广度和关注的清晰度。

值得注意的是,随着AI系统获得更大的上下文窗口(一次可以阅读更多文本的能力),简单地将更多数据转储到提示中并不是万能的解决方案。更大的上下文并不自动意味着更好的理解力。这项研究表明,即使AI可以技术上一次读取50页,如果给它50页混合质量的信息,可能不会产生良好的结果。模型仍然从精心策划的相关内容中受益,而不是不加区别的数据转储。事实上,智能检索可能会在巨大上下文窗口时代变得更加重要——以确保额外的容量被用于有价值的知识,而不是噪音。

这项研究的发现《更多文档,相同长度》(这篇恰如其分的论文标题)鼓励我们重新审视AI研究中的假设。有时,将我们所有的数据都提供给AI并不像我们想象的那样有效。通过专注于最相关的信息,我们不仅提高了AI生成答案的准确性,还使系统更加高效、更容易被信任。这是一个违反直觉的教训,但带有令人兴奋的影响:未来RAG系统可能会同时变得更聪明、更精简,通过仔细选择较少、更好的文档来检索。

Alex McFarland 是一名人工智能记者和作家,探索最新的人工智能发展。他曾与世界各地的众多人工智能初创公司和出版物合作。