合作伙伴

基础设施合作伙伴和翡翠AI推出“柔性就绪数据中心”以解决AI的电力瓶颈

mm
将 Unite.AI 添加到您在 Google 上的首选来源

人工智能的快速扩张正在将电力基础设施推向极限。训练和运行大规模人工智能模型需要巨大的计算集群,这些集群消耗了大量的电力,往往比当地电网能够扩张得更快。为了应对这一挑战,基础设施合作伙伴翡翠AI宣布了一项合作伙伴关系,旨在从根本上重新思考人工智能数据中心如何与电网交互,详细信息请参阅白皮书

这两家公司推出了一个名为柔性就绪数据中心的新架构,将基础设施合作伙伴的模块化基础设施设计与翡翠AI的编排软件相结合。目标是将数据中心从静态的电力消费者转变为动态的电网参与者,能够实时调整其电力需求。

与其将能耗视为固定的,这种方法允许设施根据电网条件、可再生能源的可用性和电价来调整计算工作负载,从而解锁额外的容量并提高整体电网稳定性。

为什么人工智能基础设施正在制造电力危机

人工智能工作负载是全球电力需求增长最快的来源之一。与合作伙伴关系同时发布的白皮书强调了数据中心如何成为现代电力系统中最集中的和增长最快的负载之一。

同时,电网扩张正在落后。输电建设、劳动力短缺和供应链限制意味着新设施可能需要等待多年才能获得电网互联。同时,可再生能源(尤其是风能和太阳能)的增加引入了供应的波动性,使得实时平衡发电和需求更加复杂。

这种动态创造了一个结构性的不匹配:人工智能基础设施需要更多的电力,但电网无法快速扩张以提供它。

白皮书认为,解决方案可能不仅仅是建设更多的电网容量。相反,它提议数据中心本身可以成为灵活的资源,帮助稳定电力系统,吸收过剩的可再生能源或在峰值电网压力期间减少需求。

柔性就绪数据中心蓝图

合作伙伴关系整合了两个核心技术:

  • 基础设施合作伙伴的升级数据中心架构,旨在支持人工智能硬件的连续几代,而无需进行重大重新设计。
  • 翡翠AI的翡翠指挥家平台,一种编排计算工作负载、设施系统和电网信号的软件层。

它们共同形成了所谓的柔性就绪数据中心,从一开始就被设计为参与能源市场和电网管理。

根据白皮书,这种集成使数据中心能够支持人工智能的增长,同时提高电网的可靠性,减少排放,并通过电网计划解锁新的经济价值。

与其在以后改造灵活性,这种架构从第一天起就将能源意识整合到设施运营中。

数据中心灵活性的三个维度

设计的核心是一个将数据中心灵活性划分为三个相互作用的层的框架:时间灵活性、空间灵活性和资源灵活性

时间灵活性

时间灵活性专注于随时间调整电力需求。与其连续以满负荷运行工作负载,不如根据电力可用性、定价或电网压力水平来安排计算作业。

技术包括:

  • 推迟非紧急的人工智能训练工作负载
  • 动态地限制IT电力消耗
  • 调整冷却系统操作
  • 与现场能量存储协调

这种方法使数据中心能够在峰值电网需求期间减少负载,同时在可再生能源发电丰富时增加消耗。

空间灵活性

空间灵活性将概念扩展到单个设施之外。

大型人工智能运营商经常在各个地区运行多个数据中心。通过在各个地点之间智能地移动工作负载,运营商可以将计算任务路由到电力更便宜、更清洁或更容易获得的位置。

在实践中,这意味着人工智能工作负载可以跟随可再生能源发电或避免电网拥堵的地区。

资源灵活性

第三个层面涉及协调数据中心内的所有可控基础设施。

这包括:

  • GPU和IT系统
  • 冷却基础设施
  • 不间断电源(UPS)
  • 电池存储系统
  • 现场发电

当这些资产被协调在一起时,它们使设施能够在保持可靠性和服务级别协议的同时调整电力消耗。

翡翠指挥家:编排计算、设施和电网

实现这些功能的编排层是翡翠AI的翡翠指挥家平台。

该系统作为一个分层控制平台,跨越三个操作层:

1. IT层

在计算层,翡翠指挥家与工作负载调度器和系统遥测集成,以调整计算强度。预测模型识别出可以在不违反服务级别协议的情况下推迟或重塑的工作负载。

人工智能训练、批处理和其他非延迟关键工作负载成为灵活调度的候选者。

2. 设施层

该平台还连接到数据中心的建筑管理系统(BMS),从冷却基础设施、电力分配设备、UPS系统和电池中获取遥测数据。

这使软件能够动态调整操作参数、调度存储的能量或协调冷却策略,同时尊重安全边距和冗余要求。

DC柔性就绪执行摘要白皮书…

3. 电网接口层

在外部级别,翡翠指挥家连接数据中心到电网信号,包括需求响应事件、批发电价和可靠性警报。

这些信号被转换为IT和设施基础设施上的协调操作,实现自动参与电力市场计划和电网稳定服务。

基础设施合作伙伴的升级数据中心架构

虽然翡翠AI提供编排层,但基础设施合作伙伴则专注于物理基础设施的设计和建设。

升级数据中心架构旨在解决人工智能硬件快速演进的问题。

现代GPU和加速器通常需要新的电力密度、冷却技术和基础设施布局,每隔几年就会发生变化。传统数据中心难以适应,导致昂贵的改造或闲置容量。

基础设施合作伙伴的设计引入了可互换的电力和冷却架构,能够在无需重大重新设计的情况下支持多代硬件。

该公司还大量依赖于工厂化建设,其中约80%的设施在现场部署之前就已经在工厂中组装和测试。这种制造优先的模式减少了建设时间表,同时提高了质量控制和可重复性。

设施可以从5兆瓦部署到千兆瓦级别的校园,允许运营商在人工智能需求增长时扩大容量。

在基础设施层集成灵活性

合作伙伴关系通过深度遥测和控制集成将两个系统集成在一起。

基础设施合作伙伴的建筑管理系统将实时操作数据(包括电力、冷却和能源系统指标)流入翡翠指挥家的优化引擎。

然后,编排平台确定工作负载、基础设施系统和能源资产如何响应电网条件。

由于基础设施的设计考虑到了灵活性,该系统可以在不损害可靠性或正常运行时间要求的情况下安全地调整操作。

这种集成还使数据中心能够参与电网计划,例如:

  • 需求响应
  • 批发能源市场
  • 电网可靠性服务

这些计划创造了新的收入来源,同时帮助公用事业公司管理电力需求。

人工智能基础设施的新模型

随着人工智能在各个行业中继续扩张,能源可用性正成为技术增长的主要约束因素之一。

柔性就绪数据中心模型表明,扩大计算基础设施的方法可以不同。与其将数据中心视为电网上的被动负载,不如将其视为能源系统中的活跃参与者,能够协调计算需求与电力可用性。

如果这种架构被广泛采用,它可能有助于加速人工智能部署,同时减轻电力基础设施的压力——随着人工智能模型变得越来越大、越来越耗能,这是一个日益重要的挑战。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。