AI 模型与平台
顶级AI模型在长文档中迷失方向
来自慕尼黑大学、慕尼黑机器学习中心和Adobe Research的研究人员的一项新研究揭示了AI语言模型的一个弱点:它们难以理解长文档,方式可能会让你感到惊讶。研究团队的发现表明,即使是最先进的AI模型也难以在无法依赖简单的词匹配时连接信息。
AI阅读技能的隐藏问题
试想一下,你要在一篇长的研究论文中找到一个特定的细节。你可能会浏览它,创建心智联系来连接不同的部分以获取所需的信息。然而,许多AI模型并不是这样工作的。相反,它们经常严重依赖于找到确切的词匹配,类似于在你的电脑上使用Ctrl+F。
研究团队开发了一项新的基准测试NOLIMA(无字面匹配),用于测试各种AI模型。结果显示,当AI模型处理超过2000个词的文本时,其性能会大幅下降。到大约32000个词(约6000个字)时,大多数模型的性能仅为其通常能力的一半。这包括测试像GPT-4o、Gemini 1.5 Pro和Llama 3.3 70B这样的主要模型。
考虑一个医疗研究人员使用AI分析患者记录,或者一个法律团队使用AI审查案件文件的情景。如果AI因为相关信息使用的词语与搜索查询不同而错过了关键的联系,后果可能会很严重。
为什么词匹配不够
当前的AI模型使用一种称为注意力机制的东西来处理文本。这种系统帮助AI关注文本的不同部分以理解词语和想法之间的关系。在处理较短的文本时,这种方法足够有效。然而,研究表明,这种机制在文本变长时会变得不知所措,特别是当它不能依赖于确切的词匹配时。
NOLIMA测试通过要求AI模型回答需要理解上下文而不是找到匹配词的题目来揭示这一限制。结果很有启发性。虽然模型在短文本中表现良好,但随着文本长度的增加,它们建立这些联系的能力大大降低。即使是专门为推理任务设计的模型,在处理较长的文档时也只能达到50%的准确率。
没有词匹配的依赖,AI模型难以:
- 连接使用不同术语的相关概念
- 遵循多步骤的推理路径
- 找到在关键上下文之后出现的相关信息
- 忽略不相关部分中的误导性词匹配
数据讲述了故事
研究结果描绘了AI模型处理较长文本的明显图景。GPT-4o表现最强,能够在大约8000个标记(约6000个字)处保持有效性。然而,即使这个顶级模型在处理较长文本时也表现出显著的下降。其他大多数模型,包括Gemini 1.5 Pro和Llama 3.3 70B,在2000到8000个标记之间经历了急剧的性能下降。
当任务需要多步骤的推理时,性能下降变得更加明显。例如,如果一个模型需要进行两个逻辑连接——例如,理解一个角色住在一个地标附近,而这个地标在一个特定的城市——成功率会大大降低。研究表明,这种多步骤的推理在文本超过16000个标记时变得特别具有挑战性,即使使用了旨在提高推理的技术,例如链式思维提示。
这些发现之所以特别值得注意,是因为它们挑战了关于AI模型处理长上下文的能力的说法。虽然许多模型宣称支持广泛的上下文窗口,但NOLIMA基准测试表明,有效的理解会在达到这些理论限制之前大大下降。

来源:Modarressi等
AI迷失在树林中
这些限制对我们在实际应用中使用AI有着严重的影响。考虑一个法律AI系统搜索案件法规的情景。它可能会因为相关的先例使用的术语与搜索查询不同而错过相关的先例。系统可能会专注于不太相关的案件,这些案件碰巧与搜索词有更多的词语匹配。
对搜索和文档分析的影响尤其令人担忧。当前的AI驱动的搜索系统经常依赖于一种称为检索增强生成(RAG)的技术。即使这些系统成功检索到包含正确信息的文档,AI也可能会因为文档中的词语与查询不同而无法识别其相关性。相反,AI可能会倾向于不太相关的文档,这些文档与搜索词有表面上的相似性。
对于AI用户,这些发现表明了几个重要的考虑因素:
首先,较短的查询和文档可能会产生更可靠的结果。当处理较长的文本时,将它们分解为较小、更有针对性的段落可能有助于保持AI的性能。
其次,用户在要求AI分析较长的文本时应该特别小心。研究表明,AI模型在需要将信息从不同部分连接起来时遇到最大的困难,尤其是当这种联系不是通过共享词汇明显的。
最后,这些限制凸显了人类监督的持续重要性。虽然AI可以成为处理和分析文本的有力工具,但它不应该被视为识别复杂文档中的重要联系的唯一手段。人类在维持上下文和跨长文本建立概念联系方面的能力仍然优于当前的AI能力。
这些发现提醒我们,尽管AI技术进步迅速,但这些系统仍然以与人类非常不同的方式处理信息。了解这些限制对于有效使用AI工具和知道何时人类判断仍然至关重要是非常重要的。
接下来是什么
了解当前AI模型处理长文本的限制为AI开发的未来提出了重要的问题。NOLIMA基准测试背后的研究表明,我们目前的AI文本处理方法可能需要重大改进,特别是在模型处理较长段落的信息方面。
当前的解决方案只取得了部分成功。链式思维提示技术可以通过鼓励AI模型将其推理分解为步骤来提高性能。例如,使用这种技术,Llama 3.3 70B表现出更好的处理较长上下文的能力。然而,这种方法在处理超过16000个标记的文本时仍然不够,表明我们需要更根本的解决方案。
形成当前AI模型处理文本的基础的注意力机制需要重新思考。可以把它想象成在一个拥挤的房间里进行对话——对话越长,跟踪所有重要点就越困难。我们的当前AI模型面临着类似的挑战,但规模要大得多。
展望未来,研究人员正在探索几个有前途的方向。一个方法涉及开发新的方法来组织和优先处理长文本中的信息,超越简单的词匹配来理解更深层次的概念联系。这可能会像人类创建信息的心理地图一样工作,基于意义而不是仅仅基于共享词汇来连接想法。
另一个发展领域集中于改进AI模型处理所谓的“潜在跳跃”(latent hops)的方式——连接不同信息片段所需的逻辑步骤。当前的模型在较长的文本中,尤其是在处理这些连接时遇到困难,但新的架构可能有助于弥合这一差距。
对于今天使用AI工具的人来说,这些发现表明了几个实际的方法:
在使用AI时,考虑将较长的文档分解为有意义的段落。这有助于创建逻辑部分以保留重要的上下文。例如,如果分析一篇研究论文,你可能会将方法和结果部分保持在一起,因为它们通常包含相关信息。
当要求AI分析较长的文本时,请具体说明您希望它建立的联系。不要提出广泛的问题,而是引导AI朝着您感兴趣的特定关系发展。这有助于弥补模型当前在独立建立这些联系方面的局限性。
最重要的是,保持对AI处理长文本的能力的现实期望。虽然这些工具可以在许多任务中非常有帮助,但它们不应该被视为替代人类分析复杂文档的唯一手段。人类在维持上下文和跨长文本建立概念联系方面的能力仍然优于当前的AI能力。
在这个领域的AI开发之路既具有挑战性,又令人兴奋。随着我们更好地理解这些限制,我们可以朝着真正理解长文本而不是仅仅处理它们的AI系统努力。与此同时,有效地使用AI意味着要与其当前的局限性一起工作,同时也要欣赏其优势。












