AI 模型与平台

Phi-4 推理如何重新定义 AI 推理,挑战“越大越好”的神话

mm
将 Unite.AI 添加到您在 Google 上的首选来源

微软最近发布的 Phi-4 推理 挑战了构建能够进行推理的 AI 系统的关键假设。自 2022 年引入链式推理以来,研究人员认为高级推理需要非常大的语言模型,具有数百亿个参数。然而,微软的新 14 亿参数模型 Phi-4 推理质疑了这种观点。使用数据中心方法而不是依赖于纯计算能力,该模型实现了与更大系统相当的性能。这一突破表明,数据中心方法可以像传统 AI 训练一样有效地用于训练推理模型。它为更小的 AI 模型通过改变 AI 开发人员训练推理模型的方式,实现高级推理打开了可能性,转变为“更好的数据是更好的”方法。

传统推理范式

链式推理 已成为解决复杂问题的 AI 标准。这种技术引导语言模型通过一步一步的推理,分解难以解决的问题为较小、可管理的步骤。它模仿人类的思考方式,让模型在自然语言中“大声思考”然后给出答案。

然而,这种能力带来了一个重要的限制。研究人员一致发现 链式推理提示 只有在语言模型非常大时才有效。推理能力似乎直接与模型大小相关,较大的模型在复杂推理任务中表现更好。这一发现导致了建造大型推理模型的竞争,公司专注于将其大型语言模型转变为强大的推理引擎。

将推理能力纳入 AI 模型的想法主要来自于大型语言模型可以进行 上下文学习 的观察。研究人员 观察到 ,当模型被展示如何一步一步解决问题的示例时,它们会学习如何遵循这种模式来解决新问题。这导致了这样的信念:更大的模型在大量数据上训练,自然会发展出更高级的推理。模型大小和推理性能之间的强烈联系成为公认的智慧。团队投入了巨大的资源来扩大推理能力,使用 强化学习 ,相信计算能力是高级推理的关键。

理解数据中心方法

数据中心 AI 的兴起挑战了“越大越好”的心态。这一方法将焦点从模型架构转移到仔细工程化用于训练 AI 系统的数据。与其将数据视为固定的输入,数据中心方法将数据视为可以改进和优化以提高 AI 性能的材料。

Andrew Ng,这个领域的领导者, 提倡 建立系统的工程实践来提高数据质量,而不是仅仅调整代码或扩大模型。这种哲学认识到,数据质量和策划通常 比模型大小更重要 。采用这种方法的公司表明,即使训练在小型、精心策划的数据集上,小型模型也可以超越更大的模型。

数据中心方法提出一个不同的问题:“我们如何改进我们的数据?”而不是“我们如何使模型更大?”这意味着创建更好的训练数据集,提高数据质量,并开发系统的数据工程。在数据中心 AI 中,重点是了解什么使数据对特定任务有效,而不仅仅是收集更多的数据。

这种方法在训练小型但强大的 AI 模型方面显示出巨大的希望,使用小型数据集和更少的计算。微软的 Phi 模型是使用数据中心方法训练小型语言模型的好例子。这些模型使用 课程学习 进行训练,这主要是受儿童通过逐渐困难的示例学习的方式启发的。最初,模型在简单的示例上进行训练,然后逐渐用更难的示例替换。微软从教科书中构建了一个数据集,如他们的论文 《教科书就是你需要的》 中所述。这帮助 Phi-3 在语言理解、常识、初中数学问题和医疗问答等任务中超越了 Google (GOOGL ) 的 Gemma 和 GPT 3.5 模型。

尽管数据中心方法取得了成功,但推理通常仍然是大型 AI 模型的特征。这是因为推理需要复杂的模式和知识,而大型模型更容易捕获这些模式。然而,这种信念最近被 Phi-4 推理模型的发展所挑战。

Phi-4 推理的突破策略

Phi-4 推理展示了如何使用数据中心方法训练小型推理模型。该模型是通过在精心选择的“可教”提示和使用 OpenAI 的 o3-mini 生成的推理示例上对基础 Phi-4 模型进行监督微调而构建的。重点是质量和特异性,而不是数据集大小。该模型使用大约 140 万个高质量的提示进行训练,而不是数十亿个通用提示。研究人员筛选了示例,以涵盖不同的难度级别和推理类型,确保多样性。这种仔细的策划使每个训练示例都具有目的,教模型特定的推理模式,而不是仅仅增加数据量。

在监督微调中,模型使用完整的推理示例进行训练,涉及完整的思维过程。这些一步一步的推理链帮助模型学习如何构建逻辑论证和系统地解决问题。为了进一步提高模型的推理能力,它还使用大约 6000 个高质量的数学问题和经过验证的解决方案进行强化学习。这表明,即使是少量的专注强化学习,也可以显著提高推理能力,当应用于精心策划的数据时。

超出预期的性能

结果证明这种数据中心方法是有效的。Phi-4 推理超越了更大的开源模型,如 DeepSeek-R1-Distill-Llama-70B ,并且几乎与完整的 DeepSeek-R1 相匹配,尽管它的参数数量要小得多。在 AIME 2025 测试(美国数学奥林匹克资格赛)中,Phi-4 推理超越了 DeepSeek-R1,该模型具有 671 亿个参数。

这些收益不仅限于数学问题,还包括科学问题解决、编码、算法、规划和空间任务。精心策划的数据带来的改进可以很好地转移到一般基准上,表明这种方法建立了基本的推理技能,而不是特定任务的技巧。

Phi-4 推理挑战了高级推理需要大量计算的观念。一个 14 亿参数的模型可以在训练数据精心策划的情况下匹配更大模型的性能。这一效率对在资源有限的情况下部署推理 AI 有重要的影响。

对 AI 开发的影响

Phi-4 推理的成功标志着 AI 推理模型构建方式的转变。团队不再仅仅专注于增加模型大小,而是可以通过投资数据质量和策划来获得更好的结果。这使得高级推理更容易被没有巨大计算预算的组织所采用。

数据中心方法还开辟了新的研究途径。未来的工作可以专注于找到更好的训练提示、创建更丰富的推理示例和了解哪些数据最能帮助推理。这些方向可能比仅仅构建更大的模型更有成效。

更广泛地说,这可以帮助民主化 AI。如果小型模型在精心策划的数据上训练可以匹配大型模型,高级 AI 将变得更加容易被更多的开发人员和组织所采用。这也可以加速 AI 在大型模型不切实际的领域的采用和创新。

推理模型的未来

Phi-4 推理为推理模型开发设定了新的标准。未来 AI 系统可能会平衡仔细的数据策划和架构改进。这一方法承认,数据质量和模型设计都很重要,但改进数据可能会带来更快、更具成本效益的收益。

这也使得专用推理模型能够在特定领域的数据上进行训练。团队可以通过有针对性的数据策划构建专注于特定领域的模型,而不是通用型巨型模型。这将为特定用途创建更高效的 AI。

随着 AI 的进步,Phi-4 推理的经验教训将不仅影响推理模型的训练,而且将影响整个 AI 的发展。数据策划战胜规模限制的成功表明,未来的进步在于将模型创新与智能数据工程相结合,而不是仅仅构建更大的架构。

结论

微软的 Phi-4 推理改变了人们对高级 AI 推理需要非常大的模型的常见信念。相反,该模型使用数据中心方法,使用高质量、精心选择的训练数据。Phi-4 推理仅有 14 亿个参数,但在困难的推理任务中,其性能与更大的模型相当。这表明,专注于更好的数据比仅仅增加模型大小更为重要。

这种新的训练方法使得高级推理 AI 更加高效、更容易被没有大量计算资源的组织所采用。Phi-4 推理的成功指向了 AI 开发的一个新方向,专注于提高数据质量、智能训练和仔细的工程,而不是仅仅使模型更大。

这种方法可以帮助 AI 进步更快、减少成本,并使更多的人和公司能够使用强大的 AI 工具。在未来,AI 很可能会通过将更好的模型与更好的数据相结合,在许多专门领域中变得更加有用,实现高级 AI。

Dr. Tehseen Zia 是 COMSATS University Islamabad 的终身副教授,拥有来自奥地利维也纳科技大学的人工智能博士学位。专攻人工智能、机器学习、数据科学和计算机视觉,他在著名的科学期刊上发表了重要贡献。 Dr. Tehseen 还作为首席调查员领导了各种工业项目,并担任人工智能顾问。