AI 模型与平台

AMD Instinct MI430X GPU 与 EPYC CPU 为价值 €387.8M 的 LUMI-AI 超级计算机提供动力

mm
将 Unite.AI 添加到您在 Google 上的首选来源

欧盟高性能计算联合企业已与法国供应商 Bull 签署了一份价值 €387.8 million 的采购合同,以交付 LUMI-AI,这是一款下一代超级计算机,于 2026 年 8 月 31 日宣布,采用 AMD Instinct MI430X GPU 和第 6 代 AMD EPYC 256 核处理器提供动力。该系统将在芬兰卡亚尼的 CSC – IT Center for Science 新数据中心安装,计划于 2027 年下半年部署。

该合同涵盖系统的采购、交付、安装和维护。资金由 EuroHPC JU 与六国 LUMI AI Factory 联盟(芬兰、捷克、丹麦、爱沙尼亚、挪威和波兰)各承担一半,根据 EuroHPC JU 的说法。该系统将归 EuroHPC JU 所有,并由联盟托管。

预期性能与系统架构

项目背后的组织表示,LUMI-AI 预计将提供相当于当前 LUMI 超级计算机 AI 能力的十倍,以及几乎两倍的高性能计算能力。官方 LUMI 发布 将这两项提升的差距归因于更新的 GPU 架构,称其在 AI 驱动任务中性能显著提升,而传统计算性能则指用于科学模拟的高精度浮点运算。

该液冷系统将基于 Bull 的 BullSequana XH3500 架构,Bull 描述该架构是专为高级 AI 工作负载打造的。其他技术合作伙伴包括提供基于 IBM Storage Scale 的存储解决方案的 IBM,以及在 Bull 的 BXI 互连之外提供数据中心网络专长的 Nokia,Bull 描述其 BXI 是欧洲唯一为 HPC 与 AI 环境设计的高带宽、低延迟互连。

根据 AMD 产品页面,Instinct MI430X 旨在用于科学 HPC 与主权 AI,融合了用于模拟和建模的 FP64 精度以及用于推理、训练和微调的 AI 能力。AMD 列出该 GPU 的硬件峰值理论 FP64 性能最高可达 288 TFLOPs,FP4 峰值理论性能最高可达 9.2 PFLOPs,集成 HBM4 内存容量最高为 432 GB,峰值理论内存带宽最高为 23.3 TB/s。AMD 表示 MI430X 支持开放的 ROCm 软件平台,预计将在 2027 年上市,届时美国能源部在橡树岭国家实验室的 Discovery 系统以及欧洲的 Alice Recoque 和 Herder 系统也计划部署该芯片。

“欧洲下一波 AI 创新将依赖于开放、高效且可信赖的基础设施,” AMD 全球公共部门与战略合作高级副总裁 Thomas Zacharia 说道。

在 LUMI AI Factory 中的角色

LUMI-AI 将作为 LUMI AI Factory 的计算骨干,支持工业 AI 创新、学术研究、AI 训练与推理以及大规模科学模拟。EuroHPC JU 表示,该系统将支持以大规模、动态且常常保密数据集为特征的下一代 AI 工作流。

自 2025 年 4 月起,LUMI AI Factory 已向欧洲中小企业和初创公司提供 AI 计算资源和服务,利用现有的 LUMI 超级计算机在制造、健康与生命科学以及通信技术与网络等领域,同时服务于气候研究、材料科学和语言技术社区。EuroHPC JU 表示,LUMI-AI 主要面向初创公司和中小企业的研究与创新,也将向更广泛的研究社区开放,超级计算资源将由 EuroHPC JU 与联盟根据各自投资共同分配。这是 EuroHPC JU 为下一代 AI 优化超级计算机签署的第六份 AI Factory 采购合同。

计算环境将由 LUMI-IQ(由 IQM Quantum Computers 提供的量子计算机)补充。LUMI 联盟表示,LUMI-IQ 将位于同一数据中心,并与 LUMI-AI 紧密集成,形成一个结合 HPC、AI 与量子计算的混合平台。

场址、建设与能源设计

LUMI-AI 将位于 CSC 位于卡亚尼 Renforsin Ranta 商业园的新数据中心,坐落在原纸厂址上。CSC 表示,扩建工程于 2026 年 1 月启动,预计 2027 年夏季完工,且当前的 LUMI 超级计算机已于 2022 年在卡亚尼落成。

各组织表示,LUMI-AI 将完全由可再生能源供电,其液冷设计将捕获多余热量用于卡亚尼的区域供热网络。Bull 称其专利的直接液体冷却技术使用温水为系统降温,LUMI 联盟表示,此方法将显著提升利用 CSC 数据中心余热产生的区域供热比例。

Bull 是在 EuroHPC JU 于 2025 年 5 月发起的招标后被选中的,芬兰则于 2024 年 12 月被确定为主办地点。EuroHPC JU 表示,系统预计将在 2027 年安装并向用户开放。

Theo Nash 是 Unite.AI 的 AI 生成专家,负责报道 AI 基础设施、计算和支持现代人工智能的硬件系统。他的工作重点是大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接起来的软件栈。具有分析和工程驱动的视角,Theo 检视 GPU、定制硅、内存架构和分布式系统的进步如何使新一代 AI 模型成为可能。他特别关注性能权衡、能效、可扩展性和实际约束,这些约束影响了 AI 基础设施的现实世界部署。 Theo Nash 撰写的文章由 Unite.AI 的编辑团队审查,以确保技术准确性、清晰度和对快速演变的 AI 计算领域的负责任报道。