نماذج ومنصات الذكاء الاصطناعي
اختبار ميشيلانجلو من ديب مايند: كشف حدود النماذج اللغوية الطويلة السياق
随着人工智能(AI)的不断发展,处理和理解长序列信息的能力变得越来越重要。目前,AI系统被用于复杂任务,如分析长文档、跟踪长时间的对话和处理大量数据。然而,许多当前模型在长上下文推理方面存在困难。随着输入的增长,它们经常失去对重要细节的跟踪,导致结果不够准确或连贯。
这个问题在医疗保健、法律服务和金融行业尤其突出,这些领域的AI工具必须处理详细的文档或长时间的讨论,同时提供准确、上下文感知的响应。一个常见的挑战是上下文漂移,即模型在处理新输入时失去对早期信息的跟踪,导致结果不够相关。
为了解决这些局限性,DeepMind开发了米开朗基罗基准测试(Michelangelo Benchmark)。该工具严格测试AI模型管理长上下文推理的能力。受米开朗基罗的启发,米开朗基罗基准测试有助于发现AI模型从大型数据集中提取有意义的模式的能力。通过确定当前模型的缺陷,米开朗基罗基准测试可以带来AI在长上下文推理方面的未来改进。
了解AI中的长上下文推理
长上下文推理是指AI模型在长文本、代码或对话序列中保持连贯性和准确性的能力。像GPT-4和PaLM-2这样的模型在短或中等长度的输入中表现良好,但在长上下文中需要改进。随着输入长度的增加,这些模型经常失去对早期部分的重要细节的跟踪,导致理解、总结或决策错误。这个问题被称为上下文窗口限制。模型保留和处理信息的能力会随着上下文的增长而降低。
这个问题在现实世界应用中很重要。例如,在法律服务中,AI模型分析合同、案例研究或法规,这些文档可以有几百页长。如果这些模型不能有效地保留和推理这些长文档,它们可能会错过重要的条款或误解法律术语。这可能导致不准确的建议或分析。在医疗保健中,AI系统需要综合患者记录、医疗史和治疗计划,这些计划可以跨越数年甚至数十年。如果模型不能准确地回忆早期记录中的关键信息,它可能会推荐不恰当的治疗或误诊患者。
尽管人们已经努力改进模型的标记限制(如GPT-4处理多达32,000个标记,大约50页文本),长上下文推理仍然是一个挑战。上下文窗口问题限制了模型可以处理的输入量,并影响了它在整个输入序列中保持准确理解的能力。这导致了上下文漂移,即模型逐渐忘记早期的细节,随着新信息的引入。这种情况降低了模型生成连贯和相关输出的能力。
米开朗基罗基准测试:概念和方法
米开朗基罗基准测试通过测试LLM在需要保留和处理长序列信息的任务中来解决长上下文推理的挑战。与早期基准测试不同,早期基准测试关注短上下文任务,如句子完成或基本问答,米开朗基罗基准测试强调需要模型跨长数据序列推理的任务,通常包括干扰或不相关的信息。
米开朗基罗基准测试使用潜在结构查询(LSQ)框架来挑战AI模型。该方法需要模型在大型数据集中找到有意义的模式,同时过滤掉不相关的信息,类似于人类从复杂数据中提取重要信息的过程。基准测试关注两个主要领域:自然语言和代码,引入了测试不仅仅是数据检索的任务。
一个重要的任务是潜在列表任务。在这个任务中,模型被给予一系列Python列表操作,如追加、删除或排序元素,然后它需要产生正确的最终列表。为了使任务更具挑战性,任务中包括不相关的操作,例如反转列表或取消前面的步骤。这测试了模型专注于关键操作的能力,模拟了AI系统处理具有混合相关性的大型数据集的方式。
另一个关键任务是多轮共指解析(MRCR)。该任务衡量模型在长时间的对话中跟踪引用,尤其是在话题重叠或不清楚时的能力。模型的挑战是将对话后期的引用与早期的点联系起来,即使这些引用被不相关的细节掩盖。这一任务反映了现实世界的讨论,话题经常转变,AI必须准确跟踪和解析引用以保持连贯的沟通。
此外,米开朗基罗基准测试还包括IDK任务,该任务测试模型识别何时没有足够的信息来回答问题的能力。在这个任务中,模型被呈现可能不包含相关信息来回答特定查询的文本。模型的挑战是识别正确的响应是“我不知道”而不是提供一个合理但不正确的答案。这一任务反映了AI可靠性的一个关键方面,即识别不确定性。
通过这样的任务,米开朗基罗基准测试超越了简单的检索,测试模型推理、综合和管理长上下文输入的能力。它引入了一个可扩展、合成和未泄露的基准测试,以更精确地衡量LLM的当前状态和未来潜力。
对AI研究和开发的影响
米开朗基罗基准测试的结果对AI的发展具有重要的影响。基准测试表明,当前的LLM需要更好的架构,特别是在注意力机制和内存系统方面。目前,大多数LLM依赖于自注意力机制,这对于短任务是有效的,但在上下文增长时会遇到困难。这就是我们看到上下文漂移的问题,即模型忘记或混淆早期的细节。为了解决这个问题,研究人员正在探索增强内存的模型。这些模型可以存储对话或文档早期部分的重要信息,使AI能够在需要时回忆和使用它。
另一个有前途的方法是分层处理。这种方法使AI能够将长输入分解为较小、可管理的部分,这有助于它在每一步关注最相关的细节。这样,模型可以更好地处理复杂任务,而不会被过多的信息所淹没。
改进长上下文推理将产生重大影响。在医疗保健中,它可能意味着更好的患者记录分析,AI可以跟踪患者的历史并提供更准确的治疗建议。在法律服务中,这些进步可能会导致AI系统能够更准确地分析长合同或案例法,提供更可靠的见解给律师和法律专业人士。
然而,随着这些进步而来的是重要的道德问题。随着AI变得更擅长保留和推理长上下文,存在泄露敏感或私人信息的风险。这是一个真正的担忧,尤其是在医疗保健和客户服务等行业中,保密性至关重要。
如果AI模型保留太多来自之前交互的信息,它们可能会无意中在未来的对话中泄露个人细节。另外,随着AI变得更擅长生成令人信服的长篇内容,存在使用它创建更先进的虚假信息或误导信息的风险,这将进一步复杂化围绕AI监管的挑战。
结论
米开朗基罗基准测试揭示了AI模型管理复杂长上下文任务的能力,突出了它们的优势和局限性。该基准测试推动了AI的创新,鼓励更好的模型架构和改进的内存系统。将AI应用于诸如医疗保健和法律服务等行业的潜力令人兴奋,但也带来了道德责任。
随着AI变得更擅长处理大量信息,必须解决隐私、虚假信息和公平性问题。AI的发展必须专注于为社会带来有益的影响,并以负责任的方式进行。












