AI 模型与平台

DeepSeek 如何以 560 万美元突破成本壁垒

mm
将 Unite.AI 添加到您在 Google 上的首选来源

传统的 AI 智慧认为,构建 大型语言模型 (LLM) 需要深厚的钱袋 —— 通常需要数十亿美元的投资。但是,DeepSeek,一家中国 AI 初创公司,刚刚以他们最新的成就打破了这一范式:仅以 560 万美元开发出了一流的 AI 模型。

DeepSeek 的 V3 模型可以与行业巨头如 Google 的 Gemini (GOOGL )OpenAI 的最新产品 竞争,同时使用的计算资源仅为传统模型的几分之一。这种成就引起了许多行业领袖的关注,特别值得注意的是,公司尽管面临美国的出口限制,限制了他们对最新 Nvidia 芯片 (NVDA ) 的访问,但仍然取得了这一成就。

高效 AI 的经济学

数字讲述了一个关于效率的有力故事。大多数高级 AI 模型需要在 16,000 到 100,000 个 GPU 上训练,而 DeepSeek 只需要 2,048 个 GPU 运行 57 天。模型的训练消耗了 278 万个 GPU 小时的 Nvidia H800 芯片 —— 对于一个 671 亿参数的模型来说,这是一个非常谦逊的数字。

为了更好地理解这一点,Meta 需要大约 3080 万个 GPU 小时 —— 大约 11 倍的计算能力 —— 来训练其 Llama 3 模型,而 Llama 3 模型的参数甚至少于 DeepSeek 的模型。DeepSeek 的方法类似于在约束条件下的优化大师课。使用为中国市场设计的 H800 芯片 —— 一种具有降低功能的 AI 芯片 —— 公司将潜在的限制转化为创新。他们没有使用现成的解决方案来处理处理器通信,而是开发了自定义的解决方案来最大限度地提高效率。

虽然竞争对手继续在假设大量投资是必要的基础上运作,DeepSeek 正在展示,聪明才智和高效的资源利用可以使竞争环境变得更加公平。

图片来源:Artificial Analysis

不可能的工程

DeepSeek 的成就在于其创新的技术方法,展示了有时最有影响力的突破来自于在约束条件下工作,而不是将无限的资源投入到问题中。

在这一创新背后,是一种叫做“辅助损失自由负载平衡”的策略。可以把它想象成一个大规模的并行处理系统,传统上,你需要复杂的规则和惩罚来保持一切顺利运行。DeepSeek 颠覆了这种传统智慧,开发出了一种系统,它可以在没有传统方法的开销的情况下自然保持平衡。

该团队还开创了所谓的“多令牌预测”(MTP)技术 —— 一种允许模型预测多个令牌的技术。在实践中,这意味着在各种主题中,这些预测的接受率高达 85-90%,从而实现了比以前方法快 1.8 倍的处理速度。

技术架构本身就是效率的大师杰作。DeepSeek 的 V3 采用了混合专家方法,总共 671 亿个参数,但聪明的地方在于,它只为每个令牌激活 37 亿个参数。这意味着他们可以获得大型模型的好处,同时保持实际的效率。

他们选择使用 FP8 混合精度训练框架是另一个飞跃。与其接受降低精度的传统限制,他们开发了自定义解决方案,以保持准确性同时显著降低内存和计算需求。

AI 生态系统中的涟漪效应

DeepSeek 成就的影响远远超出了单一成功模型的范畴。

对于欧洲的 AI 开发来说,这一突破尤其重要。许多高级模型由于公司如 Meta 和 OpenAI 无法或不愿适应 EU AI 法案 而无法进入欧盟。DeepSeek 的方法表明,构建尖端 AI 不一定需要大量的 GPU 集群 —— 更重要的是高效地利用现有的资源。

这种发展也展示了出口限制如何实际上推动创新。DeepSeek 有限的高端硬件访问迫使他们跳出思维定势,结果产生了可能在资源丰富的环境中永远不会出现的软件优化。这一原则可能会重塑我们对全球 AI 开发的方法。

民主化的影响非常深远。虽然行业巨头继续烧钱,DeepSeek 创造了一个高效、成本有效的 AI 开发蓝图。这可能为之前由于资源限制而无法竞争的小型公司和研究机构打开大门。

然而,这并不意味着大规模计算基础设施变得过时。行业正在转向推理时间的扩展 —— 模型生成答案所需的时间。随着这一趋势的继续,计算资源可能会变得更加必要,甚至会随着时间的推移而增加。

但 DeepSeek 已经从根本上改变了这场对话。长期的影响是明确的:我们正在进入一个时代,在这个时代,创新思维和高效的资源利用可能比纯粹的计算能力更重要。对于 AI 社区来说,这意味着不仅要关注我们拥有的资源,还要关注我们如何创造性地和高效地利用这些资源。

Alex McFarland 是一名人工智能记者和作家,探索最新的人工智能发展。他曾与世界各地的众多人工智能初创公司和出版物合作。