AI 模型与平台

Z.ai 在中国芯片上构建吉瓦数据中心

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Z.ai,中国AI开发商,前身为Zhipu,已经完成了一个仅使用中国芯片的数据中心的建设,并开始运行其中的一部分,根据一位熟悉该项目的人士向彭博社透露。该网站的设计是消耗大约一吉瓦的电力,大约相当于供应75万户家庭,并训练公司的GLM模型,而无需使用美国出口管制禁止其获得的Nvidia硬件。

同一位人士在匿名的情况下表示,Z.ai现在运营或已建造了几个计算集群,每个集群包含超过10,000个芯片。该吉瓦中心的位置以及其中的具体加速器没有被披露,这个说法基于单一来源,而不是许可证、文件或签署的电力合同。方向已经足够明确:中国最强大的模型构建者之一正在建立超大规模的训练能力,完全跳过了美国的硅。

什么是一吉瓦的真正含义

一吉瓦是一个严肃的数字。它将这个校园与美国正在建设的最大的AI站点置于同一重量级,并使电力,而不是芯片,成为限制因素——这也是整个行业向更高效的计算方式转变的驱动力。建立如此大量的电力、冷却和网络是一个难题;采购处理器几乎是容易的部分。

原始的兆瓦也使得比较更加有利。中国的国内加速器——以华为的Ascend系列为首,挑战者包括Cambricon和Moore Threads——在每瓦性能方面落后于Nvidia的当前Blackwell世代。因此,一吉瓦的中国芯片产生的可用训练计算量比一吉瓦的Nvidia系统少:实验室必须消耗更多的电力,并连接更多的芯片,以达到相同的有效吞吐量。几个包含10,000多个芯片的集群意味着加速器的数量以万计;在这种规模下,瓶颈从芯片本身转移到连接它们的网络和内存——正是中国零件最落后的地方。这种惩罚是走向国内的真正代价。

为什么Z.ai没有Nvidia可买

对于Z.ai来说,几乎没有选择的余地。2025年1月,美国商务部将Zhipu添加到其出口黑名单,切断了该公司通过合法渠道购买高级Nvidia零件的途径。华盛顿此后放松了一些限制,重新允许Nvidia将缩减的芯片出售给中国,同时禁止其最强大的芯片——但这些都无法到达被列入黑名单的实验室。完全使用中国芯片的建设是Z.ai唯一的合法途径。

该公司已经朝这个方向发展了几个月。Zhipu表示,最近的GLM模型是在华为的Ascend加速器上使用华为的MindSpore软件训练的,这项工作被描述为首个完全在国内堆栈上构建的主要开源模型。华盛顿的制裁原本旨在减缓中国的AI发展,但实际上却加速了中国的芯片自给自足——新的数据中心是这一赌注的工业规模版本。

北京的国内芯片赌注

这一建设符合更广泛的政策推动。北京已经敦促国有运营商在新的AI数据中心中填充国产芯片,这是自给自足驱动的一个部分,旨在使中国的大部分AI计算在几年内国内化。旗舰实验室的吉瓦国内容量是政策一直试图达到的证明点。

这也发生在中国模型涌向前沿的时候。Z.ai的GLM系统和Moonshot等实验室的对手开源模型因以远低于西方系统的成本匹配西方系统而引起了关注,中国是否能够在自己的硬件上训练和提供这些模型是计算的一半,其更广泛的推动是设定AI时代的条款。

目前,关键细节尚未得到确认。没有独立方验证过芯片数量,命名加速器,或显示一吉瓦的电力来自哪里——这些问题将一个工作的AI工厂与一个新闻稿区分开来。如果Z.ai的集群按照所描述的规模运行,中国将有其最明确的迹象,证明它可以在没有Nvidia的情况下构建前沿计算能力。如果不是这样,那么完成的壳体和一吉瓦的活训练之间的距离正是此类项目容易停滞的地方。

Theo Nash 是 Unite.AI 的 AI 生成专家,负责报道 AI 基础设施、计算和支持现代人工智能的硬件系统。他的工作重点是大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接起来的软件栈。具有分析和工程驱动的视角,Theo 检视 GPU、定制硅、内存架构和分布式系统的进步如何使新一代 AI 模型成为可能。他特别关注性能权衡、能效、可扩展性和实际约束,这些约束影响了 AI 基础设施的现实世界部署。 Theo Nash 撰写的文章由 Unite.AI 的编辑团队审查,以确保技术准确性、清晰度和对快速演变的 AI 计算领域的负责任报道。