نماذج ومنصات الذكاء الاصطناعي

اختبار ميشيلانجلو من ديب مايند: كشف حدود النماذج اللغوية الطويلة السياق

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

随着人工智能(AI)的不断发展,处理和理解长序列信息的能力变得越来越重要。目前,AI系统被用于复杂任务,如分析长文档、跟踪长时间的对话和处理大量数据。然而,许多当前模型在长上下文推理方面存在困难。随着输入的增长,它们经常失去对重要细节的跟踪,导致结果不够准确或连贯。

这个问题在医疗保健、法律服务和金融行业尤其突出,这些领域的AI工具必须处理详细的文档或长时间的讨论,同时提供准确、上下文感知的响应。一个常见的挑战是上下文漂移,即模型在处理新输入时失去对早期信息的跟踪,导致结果不够相关。

为了解决这些局限性,DeepMind开发了米开朗基罗基准测试(Michelangelo Benchmark)。该工具严格测试AI模型管理长上下文推理的能力。受米开朗基罗的启发,米开朗基罗基准测试有助于发现AI模型从大型数据集中提取有意义的模式的能力。通过确定当前模型的缺陷,米开朗基罗基准测试可以带来AI在长上下文推理方面的未来改进。

了解AI中的长上下文推理

长上下文推理是指AI模型在长文本、代码或对话序列中保持连贯性和准确性的能力。像GPT-4和PaLM-2这样的模型在短或中等长度的输入中表现良好,但在长上下文中需要改进。随着输入长度的增加,这些模型经常失去对早期部分的重要细节的跟踪,导致理解、总结或决策错误。这个问题被称为上下文窗口限制。模型保留和处理信息的能力会随着上下文的增长而降低。

这个问题在现实世界应用中很重要。例如,在法律服务中,AI模型分析合同、案例研究或法规,这些文档可以有几百页长。如果这些模型不能有效地保留和推理这些长文档,它们可能会错过重要的条款或误解法律术语。这可能导致不准确的建议或分析。在医疗保健中,AI系统需要综合患者记录、医疗史和治疗计划,这些计划可以跨越数年甚至数十年。如果模型不能准确地回忆早期记录中的关键信息,它可能会推荐不恰当的治疗或误诊患者。

尽管人们已经努力改进模型的标记限制(如GPT-4处理多达32,000个标记,大约50页文本),长上下文推理仍然是一个挑战。上下文窗口问题限制了模型可以处理的输入量,并影响了它在整个输入序列中保持准确理解的能力。这导致了上下文漂移,即模型逐渐忘记早期的细节,随着新信息的引入。这种情况降低了模型生成连贯和相关输出的能力。

米开朗基罗基准测试:概念和方法

米开朗基罗基准测试通过测试LLM在需要保留和处理长序列信息的任务中来解决长上下文推理的挑战。与早期基准测试不同,早期基准测试关注短上下文任务,如句子完成或基本问答,米开朗基罗基准测试强调需要模型跨长数据序列推理的任务,通常包括干扰或不相关的信息。

米开朗基罗基准测试使用潜在结构查询(LSQ)框架来挑战AI模型。该方法需要模型在大型数据集中找到有意义的模式,同时过滤掉不相关的信息,类似于人类从复杂数据中提取重要信息的过程。基准测试关注两个主要领域:自然语言和代码,引入了测试不仅仅是数据检索的任务。

一个重要的任务是潜在列表任务。在这个任务中,模型被给予一系列Python列表操作,如追加、删除或排序元素,然后它需要产生正确的最终列表。为了使任务更具挑战性,任务中包括不相关的操作,例如反转列表或取消前面的步骤。这测试了模型专注于关键操作的能力,模拟了AI系统处理具有混合相关性的大型数据集的方式。

另一个关键任务是多轮共指解析(MRCR)。该任务衡量模型在长时间的对话中跟踪引用,尤其是在话题重叠或不清楚时的能力。模型的挑战是将对话后期的引用与早期的点联系起来,即使这些引用被不相关的细节掩盖。这一任务反映了现实世界的讨论,话题经常转变,AI必须准确跟踪和解析引用以保持连贯的沟通。

此外,米开朗基罗基准测试还包括IDK任务,该任务测试模型识别何时没有足够的信息来回答问题的能力。在这个任务中,模型被呈现可能不包含相关信息来回答特定查询的文本。模型的挑战是识别正确的响应是“我不知道”而不是提供一个合理但不正确的答案。这一任务反映了AI可靠性的一个关键方面,即识别不确定性。

通过这样的任务,米开朗基罗基准测试超越了简单的检索,测试模型推理、综合和管理长上下文输入的能力。它引入了一个可扩展、合成和未泄露的基准测试,以更精确地衡量LLM的当前状态和未来潜力。

对AI研究和开发的影响

米开朗基罗基准测试的结果对AI的发展具有重要的影响。基准测试表明,当前的LLM需要更好的架构,特别是在注意力机制和内存系统方面。目前,大多数LLM依赖于自注意力机制,这对于短任务是有效的,但在上下文增长时会遇到困难。这就是我们看到上下文漂移的问题,即模型忘记或混淆早期的细节。为了解决这个问题,研究人员正在探索增强内存的模型。这些模型可以存储对话或文档早期部分的重要信息,使AI能够在需要时回忆和使用它。

另一个有前途的方法是分层处理。这种方法使AI能够将长输入分解为较小、可管理的部分,这有助于它在每一步关注最相关的细节。这样,模型可以更好地处理复杂任务,而不会被过多的信息所淹没。

改进长上下文推理将产生重大影响。在医疗保健中,它可能意味着更好的患者记录分析,AI可以跟踪患者的历史并提供更准确的治疗建议。在法律服务中,这些进步可能会导致AI系统能够更准确地分析长合同或案例法,提供更可靠的见解给律师和法律专业人士。

然而,随着这些进步而来的是重要的道德问题。随着AI变得更擅长保留和推理长上下文,存在泄露敏感或私人信息的风险。这是一个真正的担忧,尤其是在医疗保健和客户服务等行业中,保密性至关重要。

如果AI模型保留太多来自之前交互的信息,它们可能会无意中在未来的对话中泄露个人细节。另外,随着AI变得更擅长生成令人信服的长篇内容,存在使用它创建更先进的虚假信息或误导信息的风险,这将进一步复杂化围绕AI监管的挑战。

结论

米开朗基罗基准测试揭示了AI模型管理复杂长上下文任务的能力,突出了它们的优势和局限性。该基准测试推动了AI的创新,鼓励更好的模型架构和改进的内存系统。将AI应用于诸如医疗保健和法律服务等行业的潜力令人兴奋,但也带来了道德责任。

随着AI变得更擅长处理大量信息,必须解决隐私、虚假信息和公平性问题。AI的发展必须专注于为社会带来有益的影响,并以负责任的方式进行。

الدكتور أسعد عباس، أستاذ مساعد متفرغ في جامعة كومساطس إسلام آباد، باكستان، حصل على دكتوراه من جامعة نورث داكوتا الحكومية، الولايات المتحدة الأمريكية. يركز بحثه على التكنولوجيا المتقدمة، بما في ذلك الحوسبة السحابية، وحوسبة الضباب، وحوسبة الحافة، وتحليل البيانات الكبيرة، والذكاء الاصطناعي. قدم الدكتور عباس مساهمات كبيرة من خلال المنشورات في المجلات العلمية والمؤتمرات ذات السمعة الطيبة. وهو أيضًا مؤسس MyFastingBuddy.