AI 模型与平台
规模时代的终结:为什么算法突破比模型大小更重要

在过去的十年中,人工智能的进步主要由规模驱动。更大的数据集、更多的参数和更强大的计算能力成为成功的公式。团队竞争创建更大的模型,衡量进步以万亿参数和百万字节的训练数据。我们称之为规模时代。它推动了我们今天看到的大部分人工智能进步,但我们现在正接近一个极限,在那里仅仅使模型更大已经不是最有效、最聪明或最可持续的方法。因此,焦点从原始规模转移到算法突破。
模型规模的边际效应定律
规模时代建立在坚实的经验基础上。研究人员观察到,增加模型和数据集的大小可以带来可预测的性能增益。这一模式被称为规模定律。这些定律迅速成为领先的AI实验室的游戏规则,推动了建设更大系统的竞争。这一竞争催生了大型语言模型和基础模型,它们现在为许多当今的AI提供动力。然而,像每个指数曲线一样,这种AI规模正在开始平坦化。开发甚至更大模型的费用正在迅速增加。训练一个最先进的系统现在消耗的能量与一个小镇一样多,引发了严重的环境问题。财务成本如此之高,以至于只有少数组织能够竞争。同时,我们正在观察到明显的边际效应递减的迹象。将参数数量加倍不再能加倍能力。改进也只是增量式的,仅仅改进现有的知识,而不是解锁新的能力。每花费一美元和一瓦特的价值收益正在减少。规模策略正在达到其经济和技术极限。
新的前沿:算法效率
规模定律的极限已经推动研究人员重新关注算法效率。他们不再依赖蛮力,而是开始专注于设计更聪明的算法,以更有效地利用资源。最近的进展展示了这一转变的力量。例如,Transformer架构,由其注意力机制驱动,多年来一直主导着人工智能。但是,注意力机制有一个弱点:其计算需求随着序列长度的增加而迅速增长。状态空间模型(SSM),例如Mamba,正在作为一种替代Transformer的有前途的选择。通过实现更高效的选择性推理,SSM可以匹配更大Transformer的性能,同时运行速度更快,使用的内存更少。
算法效率的另一个例子是混合专家(MoE)模型的崛起。与其为每个输入激活整个巨大的网络,MoE系统仅将任务路由到最相关的较小网络子集,或“专家”。模型可能具有数十亿个参数,但每次计算仅使用其中的一小部分。这就像拥有一个巨大的图书馆,但每次只打开需要回答问题的几本书,而不是每次都读整个图书馆。结果是,拥有一个巨型模型的知识容量,但具有一个较小模型的效率。
将这些想法结合起来的另一个例子是DeepSeek-V3,一种混合专家模型,增强了多头潜在注意力(MLA)。MLA通过压缩关键值状态来改进传统注意力,使模型能够高效地处理长序列,就像SSM一样,同时保留Transformer的优势。DeepSeek-V3具有236亿个参数,但每次任务仅激活其中的一小部分,提供了顶级性能,例如编码和推理,同时比同样大的模型更易访问、更节能。
这些并不是孤立的例子。它们代表着一种更广泛的趋势,即朝着更聪明、更高效的设计发展。研究人员现在专注于如何使模型更快、更小、更少数据饥渴,而不牺牲性能。
为什么这一转变很重要
从依赖规模转向专注于算法突破对人工智能领域有着重大影响。首先,它使人工智能对每个人都更容易访问。成功不再仅仅依赖于拥有最强大的计算机。一个小型研究团队可以创建一个新的设计,以超越拥有更大预算的模型。这改变了创新,从资源竞争转变为思想和专业知识驱动的竞争。因此,大学、初创公司和独立实验室现在可以发挥更大的作用,不仅仅是大型科技公司。
其次,它有助于使人工智能在日常环境中更有用。一个具有500亿参数的模型在研究中可能看起来令人印象深刻,但其巨大的规模使其难以使用和昂贵。相比之下,高效的选项,如Mamba或混合专家模型,可以在标准硬件上运行,包括网络边缘的设备。这种易用性对于将人工智能引入常见应用(如医疗保健中的诊断工具或智能手机上的即时翻译功能)至关重要。
第三,它解决了可持续性问题。建造和运行巨型人工智能模型的能源需求正在成为环境的重大挑战。通过强调效率,我们可以大幅减少人工智能工作的碳排放。
接下来是什么:智能设计时代
我们正在进入智能设计时代。问题不再是如何使模型更大,而是如何设计一个本质上更智能、更高效的模型。
这一转变将在人工智能研究的几个核心领域带来创新。我们可以期待进步的一个领域是人工智能模型架构。像状态空间模型这样的新模型可能会改变神经网络处理数据的方式。例如,受动态系统启发的架构在实验中已经证明更强大。另一个重点将是训练方法,使模型能够使用更少的数据有效学习。例如,少样本学习和零样本学习的进展使人工智能更数据高效,同时像激活引导这样的技术可以在无需重新训练的情况下实现行为改进。后训练改进和使用合成数据也以惊人的速度减少了训练需求,有时甚至可以减少10,000倍。
我们还将看到对混合模型的兴趣日益增长,例如神经符号人工智能。神经符号人工智能正在成为2025年的一种主要趋势,它结合了神经学习的模式识别和符号系统的逻辑优势,以实现更好的可解释性和更少的数据依赖。AlphaGeometry 2和AlphaProof等示例使Google DeepMind能够在2025年国际数学奥林匹克竞赛中获得金牌。目标是开发出不仅可以基于统计数据预测下一个单词,还能以人类般的方式理解和推理世界的系统。
结论
规模时代对于人工智能的成长至关重要,并带来了显著的增长。它扩大了可能性的界限,并提供了我们今天依赖的基础技术。然而,像任何成熟的技术一样,最初的策略最终会耗尽其潜力。前方的重大突破不会来自于堆叠更多层,而是来自于重新设计整个堆叠。
未来属于那些在算法、架构和机器学习基本科学方面进行创新的人。它是一个衡量智能不再是参数数量,而是设计的优雅性的未来。创造更聪明的算法的驱动力才刚刚开始。这一转变为更易访问、更可持续和真正智能的人工智能打开了大门。












