思想领袖
LLM 基准测试
了解基准测试在 LLM 性能评估中的作用和局限性。探索开发强大的 LLM 的技术。
大型语言模型(LLM)近年来获得了巨大的欢迎。我是说,你已经看到了。LLM 在理解人类语言命令方面的卓越能力使其成为企业的完美集成,支持关键工作流程和自动化任务以实现最大效率。此外,超出普通用户的理解范围,LLM 还可以做更多的事情。随着我们对其的依赖程度的增加,我们确实需要更加关注确保所需的准确性和可靠性的措施。这是一个全球性的任务,涉及整个机构,但在企业领域,已经有几个基准测试可以用来评估 LLM 的性能在各个领域。这些基准测试可以测试模型在理解、逻辑构建、数学等方面的能力,并且结果将决定是否将 LLM 部署到企业中。
在本文中,我已经收集了一个全面列表,列出了最流行的 LLM 评估基准测试。我们将详细讨论每个基准测试,并看看不同 LLM 在评估标准方面的表现。但首先,让我们更详细地了解 LLM 评估。
什么是 LLM 评估?
像其他 AI 模型一样,LLM 也需要根据特定的基准测试进行评估,这些基准测试评估语言模型性能的各个方面:知识、准确性、可靠性和一致性。标准通常涉及:
- 理解用户查询:评估模型准确理解和解释广泛用户输入的能力。
- 输出验证:验证 AI 生成的响应与可信的知识库,以确保它们是正确和相关的。
- 鲁棒性:衡量模型在模糊、不完整或嘈杂输入下的性能。
LLM 评估为开发人员提供了识别和解决限制的能力,从而提高整体用户体验。如果 LLM 被彻底评估,它将足够准确和强大,以处理不同实际应用,甚至包括具有模糊或意外输入的应用。
基准测试
LLM 是迄今为止最复杂的技术之一,可以支持甚至最棘手的应用。因此,评估过程必须同样复杂,测试其思维过程和技术准确性。
基准测试使用特定的数据集、指标和评估任务来测试 LLM 的性能,并允许比较不同 LLM 并衡量其准确性,从而推动行业的进步和提高性能。
以下是 LLM 性能的一些最典型的方面:
- 知识:模型的知识需要在各个领域进行测试。这就是知识基准测试的目的。它评估模型如何有效地从不同领域(如物理学、编程、地理等)回忆信息。
- 逻辑推理:意味着测试模型“一步一步思考”和推导出逻辑结论的能力,通常涉及选择最合理的继续或解释,基于日常知识和逻辑推理。
- 阅读理解:模型必须擅长自然语言解释并生成相应的响应。测试看起来像基于段落回答问题,以衡量理解、推理和细节保留。
- 代码理解:这需要衡量模型在理解、编写和调试代码方面的熟练程度。这些基准测试为模型提供编码任务或问题,模型必须准确解决,通常涵盖广泛的编程语言和范式。
- 世界知识:为了评估模型对世界的一般知识的掌握。这些数据集通常具有需要广泛、百科全书式知识才能正确回答的问题,这使它们与更具体、更专业的知识基准测试有所不同。
“知识”基准测试
MMLU(多模态语言理解)
该基准测试旨在测试 LLM 在各个主题(如人文、社会科学、历史、计算机科学和法律)方面的知识掌握。57 个问题和 15,000 个任务都旨在确保模型具有良好的推理能力。这使得 MMLU 成为评估 LLM 事实知识和推理能力的良好工具,尤其是在处理不同主题时。
最近,它已成为评估 LLM 在上述领域的关键基准测试。开发人员始终希望优化他们的模型,以便在此基准测试中超越其他模型,这使得它成为评估高级推理和知识的 LLM 的事实标准。大型企业级模型在此基准测试中表现出色,包括 GPT-4-omni(88.7%)、Claude 3 Opus(86.8%)、Gemini 1.5 Pro(85.9%)和 Llama-3 70B(82%)。小型模型通常在此基准测试中表现不佳,通常不超过 60-65%,但最近 Phi-3-Small-7b 的表现(75.3%)值得注意。
然而,MMLU 并非完美无缺:它存在已知问题,例如模糊的问题、不正确的答案和缺乏上下文。此外,许多人认为其中一些任务对于适当的 LLM 评估来说过于简单。
我想澄清,像 MMLU 这样的基准测试并不能完美地反映现实世界的场景。如果 LLM 在此基准测试中获得高分,并不意味着它已经成为某一领域的专家。基准测试的范围有限,通常依赖多项选择题,这永远无法完全捕捉现实世界交互的复杂性和背景。真正的理解需要知道事实并动态地应用这些知识,这涉及批判性思维、问题解决和背景理解。因此,LLM 需要不断被改进和更新,以保持基准测试的相关性和有效性。
GPQA(研究生级谷歌证明问答基准测试)
该基准测试评估 LLM 在逻辑推理方面的能力,使用一个包含 448 个问题的数据集,涵盖生物学、物理学和化学等主题。该数据集由领域专家开发,具有以下验证过程:
- 主题专家回答问题并提供详细反馈。
- 问题作者根据反馈修改问题。
- 第二位专家回答修改后的问题。
此过程确保问题是客观的、准确的和具有挑战性的,即使对于语言模型来说也是如此。即使经验丰富的博士学者也只能在这些问题上达到 65% 的准确率,而 GPT-4-omni 只达到 53.6%,突出了人类和机器智能之间的差距。
由于资格要求很高,该数据集相对较小,这限制了其在比较准确率方面的统计能力,并需要大效应大小。创建和验证这些问题的专家来自 Upwork,因此可能引入了基于他们的专业知识和所涵盖主题的偏见。
代码基准测试
HumanEval
HumanEval 包含 164 个编程问题,用于测试 LLM 的编码能力。它使用 pass@k 指标来评估生成的代码的功能准确性,输出至少一个前 k 个 LLM 生成的代码样本通过测试用例的概率。
虽然 HumanEval 数据集包括函数签名、文档字符串、代码体和多个单元测试,但它并未涵盖现实世界编码问题的全部范围,因此不能充分测试模型在多样场景下的编码能力。
MBPP(大多数基本 Python 编程)
MBPP 基准测试由 1,000 个众包的 Python 编程问题组成,重点是基本编程技能。它使用少量学习和微调方法来评估模型性能,大型模型通常在此数据集上表现更好。然而,由于数据集包含主要是入门级程序,因此仍然不能完全代表现实世界应用的复杂性和挑战。
数学基准测试
虽然大多数 LLM 在结构标准响应方面表现出色,但数学推理对于它们来说是一个更大的问题。为什么?因为它需要与问题理解、逻辑推理和推导正确答案相关的技能。
“链式思维”(CoT)方法旨在评估 LLM 在数学相关基准测试方面的能力,涉及提示模型解释其解决问题的逐步推理过程。这种方法有几个好处:它使推理过程更加透明,帮助识别模型逻辑中的缺陷,并允许对问题解决技能进行更细致的评估。通过将复杂问题分解为一系列更简单的步骤,CoT 可以提高模型在数学基准测试方面的性能,并提供对其推理能力的更深入的见解。
GSM8K:一种流行的数学基准测试
评估 LLM 数学能力的著名基准测试之一是 GSM8K 数据集。GSM8K 由 8,500 个中学校数学问题组成,需要几步才能解决,解决方案主要涉及执行一系列基本计算。通常,大型模型或专门为数学推理训练的模型在此基准测试中表现更好,例如 GPT-4 模型的得分为 96.5%,而 DeepSeekMATH-RL-7B 的得分为 88.2%。
虽然 GSM8K 对于评估模型处理初级数学问题的能力很有用,但它可能无法完全捕捉模型解决更高级或多样化数学挑战的能力,因此其作为数学能力的全面衡量指标的有效性有限。
数学数据集:一种综合替代方案
数学数据集解决了基准测试(如 GSM8K)存在的缺陷。该数据集更为广泛,涵盖从小学算术到高中甚至大学水平的问题。它还与人类进行比较,一位不擅长数学的计算机科学博士生达到 40% 的准确率,而一位金牌得主达到 90% 的准确率。
它提供了对 LLM 数学能力的更全面评估。它确保模型在基本算术和复杂领域(如代数、几何和微积分)方面都具有熟练程度。但是,问题的增加的复杂性和多样性可能会使模型难以达到高准确率,尤其是那些没有在广泛的数学概念上进行过明确训练的模型。此外,数学数据集中的问题格式的多样性可能会引入模型性能的不一致性,使得很难对模型的整体数学熟练程度做出明确的结论。
将“链式思维”方法与数学数据集结合使用可以增强评估,因为它揭示了 LLM 在广泛的数学挑战中逐步推理的能力。这种综合方法确保了对 LLM 的数学能力进行更强大和更详细的评估。
阅读理解基准测试
阅读理解评估评估模型理解和处理复杂文本的能力,这对于应用(如客户支持、内容生成和信息检索)至关重要。有几个基准测试旨在评估这种技能,每个基准测试都有其独特的特征,有助于对模型的能力进行全面评估。
RACE(来自考试的阅读理解数据集)
RACE 基准测试包含近 28,000 个段落和 100,000 个问题,收集自为 12 至 18 岁的中国学生准备的英语考试。它不限制问题和答案必须从给定的段落中提取,使任务更加具有挑战性。
它涵盖了广泛的主题和问题类型,使评估更加全面,并包括不同难度级别的问题。RACE 中的问题专门设计用于测试人类的阅读技能,并由领域专家创建。
然而,该基准测试存在一些缺点。由于它是基于中国教育材料开发的,因此可能引入了不反映全球背景的文化偏见。此外,一些问题的高难度水平并不代表典型的现实世界任务,因此性能评估可能不够准确。
DROP(段落离散推理)
另一个重要方法是 DROP(段落离散推理),它要求模型在段落上执行离散推理。它包含 96,000 个问题,用于测试 LLM 的推理能力,这些问题来自维基百科和亚马逊 Mechanical Turk。DROP 问题通常要求模型根据段落中的信息执行数学运算,如加法、减法和比较。
问题具有挑战性,需要模型在段落中定位多个数字并将它们相加或相减以得到最终答案。大型模型(如 GPT-4 和 Palm)在 DROP 数据集上达到 80% 和 85% 的准确率,而人类达到 96% 的准确率。
常识基准测试
在语言模型中测试常识是一个有趣的方面,但也至关重要,因为它评估模型做出符合人类推理的判断和推理的能力。与我们不同,我们通过实践经验开发了一个全面世界模型,而语言模型是在没有内在理解上下文的情况下在大型数据集上训练的。这意味着模型在需要直觉理解日常情况、逻辑推理和实际知识的任务中挣扎,这些对于强大可靠的 AI 应用程序至关重要。
HellaSwag(具有对抗性生成的更难结束、更长上下文和低射击活动的困难口语)
Hellaswag 由 Rowan Zellers 和同事在华盛顿大学和艾伦人工智能研究所开发。它旨在测试模型预测给定场景最合理的继续的能力。该基准测试使用对抗性过滤(AF)构建,其中一系列判别器迭代地选择对抗性机器生成的错误答案。这种方法创建了一个数据集,对于人类来说很简单,但对于模型来说具有挑战性,结果是一个“黄金地带”的难度级别。
虽然 Hellaswag 曾经对早期模型具有挑战性,但最先进的模型(如 GPT-4)已经达到接近人类的准确率,表明 AI 能力方面取得了显著进步。然而,这些结果表明需要不断演化的基准测试,以跟上 AI 能力的进步。
Openbook
Openbook 数据集包含 5,957 个小学科学多项选择题。这些问题来自开放书考题,旨在评估人类对该学科的理解。
Openbook 基准测试需要超越信息检索的推理能力。GPT-4 达到了 95.9% 的最高准确率。
OpenbookQA 模仿开放书考题,包含 5,957 个小学科学多项选择题。这些问题旨在探测对 1,326 个核心科学事实及其在新情况下的应用的理解。
与 Hellaswag 类似,早期模型在 OpenbookQA 上面临挑战,但现代模型(如 GPT-4)已经达到接近人类的性能水平。这一进步凸显了继续开发更复杂、更细致的基准测试以推动 AI 理解的边界的重要性。
基准测试是否足以评估 LLM 的性能?
是的,虽然它们提供了一种标准化的评估 LLM 性能的方法,但它们也可能具有误导性。Large Model Systems 组织表示,一个好的 LLM 基准测试应该是可扩展的,能够使用相对较少的试验评估新模型,并为所有模型提供一个独特的排名顺序。但是,有几个原因说明为什么基准测试可能不够:
基准测试泄漏
这是一个常见的问题,当训练数据与测试数据重叠时,就会发生这种情况,从而导致误导性的评估。如果模型在训练过程中已经遇到了一些测试问题,其结果可能不准确地反映其真正的能力。理想的基准测试应该尽量减少记忆,并反映现实世界的场景。
评估偏差
LLM 基准测试排行榜用于比较不同 LLM 在各种任务上的性能。然而,仅依赖这些排行榜来比较模型可能具有误导性。简单地改变基准测试,如改变问题的顺序,可以将模型的排名改变多达八个位置。此外,LLM 可能根据评分方法的不同而表现不同,这凸显了考虑评估偏差的重要性。
开放性
现实世界中的 LLM 交互涉及设计提示以生成所需的 AI 输出。LLM 的输出取决于提示的有效性,基准测试旨在测试 LLM 的上下文感知能力。虽然基准测试旨在测试 LLM 的上下文感知能力,但它们并不总是直接转化为现实世界的性能。例如,模型在基准测试数据集上达到 100% 的准确率(如 LSAT),并不保证在实际应用中达到相同的准确率。这凸显了在 LLM 评估中考虑现实世界任务的开放性质的重要性。
强大的 LLM 的有效评估
现在您已经知道基准测试并不总是最佳选择,因为它们不能总是推广到所有问题。但是,有其他方法可以实现这一点。
自定义基准测试
这些基准测试非常适合在特定场景中测试特定的行为和功能。例如,如果 LLM 是为医疗官员设计的,则从医疗环境中收集的数据集将有效地代表现实世界的场景。这些自定义基准测试可以关注特定领域的语言理解、性能和独特的上下文要求。通过将基准测试与可能的现实世界场景对齐,您可以确保 LLM 在一般情况下表现良好,并且在其预期的特定任务中表现出色。这可以帮助识别和解决模型能力中的任何差距或弱点。
数据泄漏检测管道
如果您希望评估显示“完整性”,则具有无数据泄漏的基准测试管道至关重要。数据泄漏发生在基准测试数据包含在模型的预训练语料库中时,导致人为高的性能分数。为了避免这种情况,基准测试应该与预训练数据进行交叉引用,并采取措施避免任何以前看到的信息。这可能涉及使用专有或新创建的数据集,这些数据集与模型的训练管道分开,这将确保性能指标反映模型的泛化能力。
人类评估
自动化指标本身无法捕捉模型性能的全部范围,特别是在语言理解和生成的细致和主观方面。人类评估在这里提供了更好的评估:
- 聘用专业人员,他们可以提供详细和可靠的评估,特别是在专业领域。
- 众包!像亚马逊 Mechanical Turk这样的平台允许您快速、廉价地收集多样的人类判断。
- 社区反馈:使用像LMSYS排行榜竞技场这样的平台,用户可以投票和比较模型,添加了对模型性能的额外洞察层。LMSYS聊天机器人竞技场硬版尤其有效地通过用户交互和投票突出了顶级模型之间的微妙差异。
结论
没有评估和基准测试,我们将无法知道LLM处理现实世界任务的能力是否像我们认为的那样准确和可行。但是,如我所说,基准测试并不是评估LLM的完全可靠方法,因为它们可能导致性能上的差距,并可能减慢真正强大的LLM的开发速度。
这是理想世界中应该发生的事情。LLM理解用户查询,识别提示中的错误,按照指示完成任务,并生成可靠的输出。结果已经很好了,但还不理想。这就是任务特定基准测试、人类评估和检测基准测试泄漏的帮助之处。通过使用这些,我们有机会生产真正强大的LLM。












