AI 模型与平台

人工智能的真正瓶颈:电力、冷却和规模的物理学

mm
将 Unite.AI 添加到您在 Google 上的首选来源

过去十年中,人工智能以惊人的速度发展。更快的GPU、更大的集群和革命性的架构已经解锁了曾经似乎不可能的突破。然而,随着行业推动向 trillion 参数模型和超大规模 AI 工厂,下一个障碍与算法无关。今天的真正瓶颈是物理的:电力、冷却和维持计算在全球规模的基础设施。

问题不再是你可以制造多少芯片,而是你是否可以提供足够的电力、水和传输线来操作它们。基础设施,而不是硅,是未来几年人工智能发展的决定因素。

千瓦与浮点运算

OpenAI 的“星门”项目,由 Oracle (ORCL ) 和 SoftBank 建立,目标是在美国校园中实现近 7 千瓦的容量,相当于多个核反应堆。在这个规模上,主要挑战不是生产 GPU,而是确保电厂和变电站来保持它们的运行。

Microsoft (MSFT ) 的需求同样惊人。其 AI 工作负载预计将 需要与整个新英格兰地区一样多的电力,到 2030 年。这有助于解释为什么该公司已经在可再生能源项目上投资了数十亿美元,并正在探索更实验性的选择,例如核聚变和先进核反应堆。

这种动态已经波及能源政策。在 PJM 互联中,管理超过 6500 万人在 13 个州和华盛顿特区的电网的区域传输组织中,公用事业公司正在探索 数据中心的削减机制,在峰值需求期间。主要技术公司正在游说反对此类限制,但监管机构甚至考虑这些限制表明,人工智能已经成为电网规划的核心。

冷却挑战

提供电力只是问题的一半。一旦电力到达机架,下一个挑战是热量。每个高端 GPU 消耗大约 700 瓦特,而机架上有数百个 GPU,密度达到每机架 100 到 600 千瓦。空气冷却,几十年来一直是行业标准,在大约每机架 40 千瓦的水平上变得不可行,因为气流效率低下和循环再利用。

因此,液体冷却已经从小众转变为主流。NVIDIA (NVDA ) 最新的 液体冷却 Blackwell 平台 专为超大规模 AI 集群设计,提供 25 倍更好的能效和 300 倍更好的水效率,超过空气冷却机架。该公司还与 Vertiv 合作开发了一种 参考架构,可以处理每机架超过 130 千瓦的功率,使得密集的 GPU 部署成为可能。

初创公司也在创新。Corintis,一家将微通道直接嵌入芯片基板的瑞士公司,最近获得了 2400 万美元的资金,并且已经拥有了包括 Microsoft 在内的客户。Microsoft 自己的研究团队已经展示了 微流体通道刻入芯片封装,将 GPU 的峰值温度降低了多达 65%,并将效率提高了 3 倍,超过传统的冷板。这些技术使得在不熔化数据中心的情况下保持 GPU 全速运行成为可能。

水作为战略变量

液体冷却引入了另一个变量:水耗。蒸发式和冷却水系统在扩展到数百兆瓦的校园时可能需要大量的水。在菲尼克斯,数据中心群可能需要 每天数亿加仑的水,在干旱地区引发了担忧。

这已经促进了零水和闭环冷却系统的发展。 IEEE Spectrum 已经记录了诸如密封介电浸没浴、干式冷却器和无水制冷机等策略,可以将饮用水的使用量减少到几乎为零。同时,一些运营商正在尝试利用废热。像 AquasariDataCool 这样的项目已经展示了如何使用热水冷却回路来为建筑供暖系统或吸收式制冷机提供能量,从而回收了原本会丢失的能量的大部分。

权衡往往在水和电力之间:闭环或干式系统消耗更多的能量,而蒸发式设计节省了电力,但大量消耗水。在水资源紧张的地区,政策越来越倾向于水资源保护,即使这意味着更高的能耗。

基础设施和电网

即使拥有电力和冷却解决方案,最后的瓶颈是基础设施。选址决定现在决定了人工智能竞赛的赢家和输家。

Microsoft 的 800 亿美元 威斯康星州 Fairwater 校园 说明了战略位置已经变得多么重要。该址占地 315 英亩,拥有数十万个 GPU,并且由于其接近变电站、光纤线和地下水而被选中。设计还强调了闭环冷却,以最小化水的影响。

为了支持其日益增长的负载,Microsoft 已经与 Brookfield 达成了一项具有里程碑意义的协议,到 2030 年将 增加 10.5 千瓦的可再生能量。同时,它还支持更实验性的项目,例如 Helion Energy 正在建设的核聚变电站,计划于 2028 年为数据中心供电,以及 20 年协议重新启动宾夕法尼亚州的三里岛核电站

亚马逊和谷歌也正在采取类似的步骤,确保位于核电站旁边的场地,并开发自己的清洁能源投资组合。在爱尔兰,数据中心已经消耗了 所有家庭的电力总和,监管机构已经冻结了新批准,直到至少 2028 年,这凸显了即使是最有资金的项目也可能因政治和许可而受阻。

更智能的运营:人工智能管理人工智能

有趣的是,人工智能本身正在被用来管理基础设施的负担。 强化学习 已经在生产数据中心中部署,以优化冷却系统,产生 14 到 21% 的能耗节约,而不损害安全性。数字孪生和预测建模也被用于预测热点、预冷设备和将工作负载转移到较冷的时间或可再生能源过剩的时期。

谷歌已经展示了如何使用 机器学习 将数据中心的冷却需求降低 40%,其他运营商也正在采用类似的系统。随着电力和冷却成本的增加,这些运营节约变得至关重要。

战略展望

轨迹很明显。 人工智能的需求预计将使全球数据中心的电力使用量在 2030 年之前翻倍,到 2050 年,人工智能工作负载将占全球总电力消耗的中单位百分比。虽然 NVIDIA 和其他芯片制造商继续推动硅性能的发展,但人工智能的实际边界将由公用事业公司能够建设新发电、传输和冷却基础设施的速度来定义。

对于构建人工智能产品的公司来说,这意味着路线图越来越多地与现有容量相关联。对于投资者来说,最有价值的游戏可能是公用事业公司、传输开发商和冷却初创公司,而不仅仅是 GPU 供应商。对于政策制定者来说,人工智能的辩论正在从伦理和数据治理问题转向兆瓦、水和电网现代化的问题。

人工智能的未来不仅将在研究实验室和芯片制造厂决定,还将在变电站、冷却回路和发电厂决定。规模的物理学——而不仅仅是算法的数学——将决定人工智能在未来十年中的速度和范围。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。