AI 模型与平台

小型推理模型的崛起:紧凑的AI能否匹配GPT级别的推理?

mm
将 Unite.AI 添加到您在 Google 上的首选来源

近年来,人工智能领域被大型语言模型(LLMs)的成功所吸引。最初设计用于自然语言处理,这些模型已经演变成强大的推理工具,能够以人类般的步骤处理复杂问题。然而,尽管它们具有出色的推理能力,但LLMs也带来了显著的缺点,包括高计算成本和慢的部署速度,使得它们在资源受限的环境中(如移动设备或边缘计算)不切实际。这导致了对开发更小、更高效的模型的兴趣日益增长,这些模型可以提供类似的推理能力,同时最小化成本和资源需求。本文探讨了这些小型推理模型的崛起、潜力、挑战和对AI未来的影响。

观念的转变

在人工智能的近期历史中,该领域遵循了“扩展定律”的原则,该定律表明模型的性能会随着数据、计算能力和模型大小的增加而可预测地提高。虽然这种方法已经产生了强大的模型,但也导致了显著的权衡,包括高基础设施成本、环境影响和延迟问题。不所有的应用都需要大型模型的全部能力。许多实际情况下(例如,设备上的助手、医疗保健和教育),较小的模型可以实现类似的结果,如果它们可以有效地推理。

理解AI中的推理

AI中的推理是指模型遵循逻辑链、理解因果关系、推断含义、规划过程步骤和识别矛盾的能力。对于语言模型,这通常意味着不仅检索信息,还要操纵和推断信息通过结构化的、步骤式的方法。这一水平的推理通常是通过对LLMs进行多步骤推理的微调来实现的。虽然这种方法有效,但它们需要大量的计算资源,并且部署速度慢且昂贵,引发了人们对其可及性和环境影响的担忧。

理解小型推理模型

小型推理模型旨在复制大型模型的推理能力,但具有更高的计算效率、内存使用率和延迟。这些模型通常采用一种称为知识蒸馏的技术,其中较小的模型(“学生”)从较大的预训练模型(“老师”)中学习。蒸馏过程涉及将较小的模型训练在较大的模型生成的数据上,目标是转移推理能力。然后对学生模型进行微调以提高其性能。在某些情况下,应用了强化学习和专门的领域特定奖励函数,以进一步增强模型的任务特定推理能力。

小型推理模型的崛起和发展

小型推理模型发展中的一个显著里程碑是DeepSeek-R1的发布。尽管DeepSeek-R1是在相对较小的旧GPU集群上训练的,但它在MMLU和GSM-8K等基准测试中实现了与较大模型(如OpenAI的o1)相当的性能。这一成就导致了对传统扩展方法的重新评估,该方法假设较大的模型本质上更好。

DeepSeek-R1的成功可以归因于其创新的训练过程,该过程结合了大规模强化学习,而不依赖于早期阶段的监督微调。这一创新导致了DeepSeek-R1-Zero的创建,该模型展示了令人印象深刻的推理能力,与大型推理模型相比。进一步的改进,例如使用冷启动数据,增强了模型的连贯性和任务执行,特别是在数学和编码等领域。

此外,蒸馏技术已被证明是开发较小、更高效的模型的关键。例如,DeepSeek发布了其模型的蒸馏版本,参数数量从15亿到70亿不等。使用这些模型,研究人员训练了一个相对较小的模型DeepSeek-R1-Distill-Qwen-32B,该模型在各种基准测试中超越了OpenAI的o1-mini。这些模型现在可以使用标准硬件部署,使其成为广泛应用的可行选择。

小型模型能否匹配GPT级别的推理

为了评估小型推理模型(SRMs)是否能够匹配大型模型(LRMs)如GPT的推理能力,需要评估它们在标准基准测试中的性能。例如,DeepSeek-R1模型在MMLU测试中获得了约0.844的分数,相当于较大的模型如o1。在GSM-8K数据集上,DeepSeek-R1的蒸馏模型实现了顶级性能,超越了o1和o1-mini。

在编码任务中,例如LiveCodeBench和CodeForces上的任务,DeepSeek-R1的蒸馏模型的性能与o1-mini和GPT-4o相当,展示了强大的编程推理能力。然而,较大的模型仍然在需要更广泛的语言理解或处理长上下文窗口的任务中具有优势,因为较小的模型往往更具任务特异性。

尽管小型模型具有优势,但它们在面对扩展推理任务或离群数据时可能会遇到困难。例如,在LLM国际象棋模拟中,DeepSeek-R1比较大的模型犯了更多错误,表明其在长时间内保持专注和准确性的能力有限。

权衡和实际影响

比较SRMs和GPT级别的LRMs时,模型大小和性能之间的权衡至关重要。较小的模型需要更少的内存和计算能力,使其适合边缘设备、移动应用或需要离线推理的情况。这一效率导致了较低的运营成本,例如DeepSeek-R1比较大的模型如o1便宜了多达96%。

然而,这些效率收益是以一些妥协为代价的。较小的模型通常针对特定任务进行微调,这可能会限制其与较大模型相比的多功能性。例如,虽然DeepSeek-R1在数学和编码方面表现出色,但它缺乏多模态能力,例如解释图像的能力,这是较大模型如GPT-4o所具备的。

尽管存在这些限制,小型推理模型的实际应用是巨大的。在医疗保健领域,它们可以为标准医院服务器上的诊断工具提供动力。在教育领域,它们可以用于开发个性化的辅导系统,为学生提供逐步的反馈。在科学研究中,它们可以帮助数据分析和假设测试,特别是在数学和物理等领域。像DeepSeek-R1这样的开源模型也促进了合作,并使AI技术民主化,使较小的组织能够从先进技术中受益。

结论

语言模型演变为较小的推理模型是人工智能领域的一项重大进步。虽然这些模型可能还不能完全匹配大型语言模型的广泛能力,但它们在效率、成本效益和可及性方面提供了关键优势。通过在推理能力和资源效率之间取得平衡,较小的模型将在各个应用中发挥至关重要的作用,使人工智能更加实用和可持续地应用于现实世界。

Dr. Tehseen Zia 是 COMSATS University Islamabad 的终身副教授,拥有来自奥地利维也纳科技大学的人工智能博士学位。专攻人工智能、机器学习、数据科学和计算机视觉,他在著名的科学期刊上发表了重要贡献。 Dr. Tehseen 还作为首席调查员领导了各种工业项目,并担任人工智能顾问。