访谈
肯·克拉菲,VDURA 首席执行官 – 采访系列:回归对话

肯·克拉菲,VDURA 首席执行官和总裁,是一位经验丰富的客户导向型商业和产品领导者,具有深厚的云计算和企业基础设施、硬件和软件开发以及战略增长驱动的产品、运营和市场功能的专业知识。在他的职业生涯中,他建立和领导了高绩效的全球团队,执行企业战略,推动盈利的收入增长和产品创新,并扭转了业绩不佳的业务。在加入 VDURA 之前,克拉菲在希捷科技公司担任高级领导职务,担任企业系统和利润负责的高级副总裁,并在 Xyratex、Adaptec 和 Eurologic 等公司担任领导职务,拥有数十年的企业存储和高性能计算经验。
(STX )VDURA 是一家软件定义数据基础设施公司,构建现代存储解决方案,针对人工智能和高性能计算工作负载进行优化,遵循“速度与耐用性”的格言。该公司的旗舰 VDURA 数据平台将闪存优先的并行文件系统性能与对象存储的弹性结合在一个统一的架构中,该架构可以线性扩展到数千个客户端和节点,同时简化操作并降低总拥有成本。最初以 Panasas 的名义成立并于 2024 年更名,VDURA 的平台支持本地、云端和混合环境,具有高级自动化、元数据加速和可扩展性能,旨在为企业、研究和任务关键型人工智能和高性能计算用例提供 GPU 集群和数据保护。
您在高性能计算和企业存储领域的经历如何塑造了您对存储成为人工智能基础设施的决定性约束的看法?
在为世界上一些最苛刻的计算环境构建存储系统的过程中,您会对瓶颈的实际位置和人们所假设的位置发展出一种直觉。在 Xyratex 和希捷的 ClusterStor 项目中,我们正在解决超级计算机的存储问题,物理学毫不留情。如果您不能提供计算资源,就无法提供计算资源。
我现在看到的人工智能基础设施中的同一个基本约束,只是经济学不同。Neocloud 市场中的 GPU 热潮是可以理解的。NVIDIA (NVDA ) 创造了一个稀缺且变革性的资源。但是,存储会轻松且廉价地随之扩展的假设最终会破灭。它已经破灭了。存储现在占人工智能基础设施预算的 20% 至 30%,在所有闪存部署中增长速度比任何其他组件都快。当您花了一辈子看着存储成为每个大规模计算环境中的约束时,您就不会对市场最终意识到这一现实而感到惊讶。
为什么在 Neocloud 基础设施抢占过程中,存储规划被降级?
几个结构性假设在错误的时刻汇聚在一起。首先,闪存价格暂时有利。NVMe SSD 便宜且丰富到可以让所有闪存部署感觉像是一个合理的默认设置。这不是架构上的智慧,而是经济窗口的产物,运营商将其误认为是永久的条件。
其次,竞争格局奖励 GPU 数量而不是其他一切。Neocloud 市场正在根据可以安装的 NVIDIA 芯片数量来评估。存储大约是一个 10% 的项目,很容易在没有深入审查的情况下通过采购。第三,所有闪存的决定感觉安全,因为它消除了复杂性。一个层级,一个媒体类型,很容易采购和操作。问题是“简单”和“经济可持续”在 NAND 供应紧张和价格飙升的那一刻停止了成为同一件事。到那时,基础设施决策已经被锁定。
当运营商看到存储如何影响其 GPU 使用率时,他们会感到最惊讶的是什么?
这种关系比大多数运营商意识到的更直接,直到他们面对空闲的 GPU。具有频繁检查点的训练运行会产生突发式写入需求,如果存储层无法快速 enough 地吸收这些需求,就会阻塞计算。预处理和摄取的数据管道会产生持续的读取吞吐量需求,如果不能满足这些需求,GPU 就会被剥夺工作。
NVIDIA 自己的 DGX 指南量化了这一点:基于文本的 LLM 训练大约需要每个 GPU 0.5 GB/s 的读取吞吐量,而物理 AI 和可视化工作负载大约需要每个 GPU 4 GB/s 的读取和 2 GB/s 的写入。如果您的存储架构无法提供这些内容,您就不会以满负荷运行 GPU。您将以存储允许的分数运行它们。
架构在集群规模上至关重要。一个存储系统在驱动器和客户端之间插入中间件可能会在单个驱动器上显示出可比的标题吞吐量,但在规模上,您可能最终需要三倍的驱动器来饱和相同的 GPU 舰队。三倍的 SSD,三倍的功耗,三倍的机架空间。利用率的数学运算很快就会叠加起来。
仅从 SSD 选择和架构设计来看,成本差异可能会有多大,即使标题吞吐量指标看似相似?
这就是运营商陷入困境的地方,因为标题数字可能非常具有误导性。让我们考虑一个代表性的例子。一个 122.88 TB 的 QLC NVMe SSD 的成本大约为 27,000 美元。同一代产品的 7.68 TB 驱动器以大约 1,800 美元的价格提供了可比的顺序吞吐量。对于一个 4,096 个 GPU 的集群,基于 NVIDIA 的增强规格,这个单一容量选择决定会产生从 60 万美元到 960 万美元不等的闪存账单。吞吐量基本上是相同的。唯一的变量是您选择将多少冷数据存储在提供额外性能优势的高级介质上。
此外,架构设计决定了集群规模的驱动器数量。一个大约每个 SSD 提供 5.8 GB/s 的读取吞吐量的架构需要大约 353 个驱动器来饱和一个 4,096 个 GPU 的集群。一个由于中间件开销而每个 SSD 提供大约 1.9 GB/s 的架构需要超过 1,000 个驱动器。在每个 30 TB 驱动器 12,000 美元的价格下,这个差异不是一个小数点错误——这是一个商业模式问题。
随着闪存价格上涨和 NAND 供应保持受限,运营商应该如何重新思考所有闪存与分层存储?
起点是接受所有闪存人工智能基础设施背后的经济前提始终是有条件的,而不是基础性的。菲松的首席执行官将 NAND 生产能力描述为有效地分配到 2026 年。高盛预测 DRAM 价格将在同一时期每季度增加两位数。所有闪存的默认设置在闪存便宜且丰富时是有意义的。它不再是这样了。
(GS )正确的框架是问闪存实际上是为了什么。闪存是一种性能介质。它应该被调整为饱和 GPU 吞吐量要求,无需更多。其他一切,包括冷数据、不被积极读取的检查点和存档的训练集,都属于高密度硬盘驱动器,它们每 TB 的成本要低几个数量级。
运营商陷入的陷阱是将分层视为附加组件:购买一个所有闪存的主层,添加一个单独的对象存储用于冷数据,并使用外部数据移动器将它们连接起来。这引入了第二个软件栈,第二个数据平面,网络复杂性和运营开销。超大规模云供应商的方法是在同一个软件栈中运行 SSD 和 HDD,具有本地高性能分层和无外部数据移动器,保持存储接近基础设施预算的 10%,同时仍然饱和每个 GPU。
Neocloud 层可以从超大规模云存储设计选择中吸取什么教训?
最重要的教训是,Google (GOOGL ) 、Meta 和 Microsoft (MSFT ) 不运行所有闪存,他们拥有比任何人都多的人工智能工作负载经验。他们部署混合分层架构,具有智能分层:足够的 NVMe 闪存来饱和 GPU 吞吐量,然后快速将冷数据排出到高密度硬盘驱动器。这不是一个哲学上的偏好。这是一个由人工智能工作负载物理学清晰理解驱动的经济必然性。
第二个教训是架构集成。超大规模云供应商不通过将单独的系统连接在一起来解决分层问题。他们在同一个软件栈中运行 SSD 和 HDD,同一个数据平面,分层作为存储系统内的第一类操作,而不是由单独的工具管理的批处理作业。这种集成是使他们能够在巨大的规模上保持经济的存储同时保持 GPU 舰队所需的性能保证的原因。
第三个教训是耐用性担保。AWS S3 提供 11 个 9 的耐用性。Azure Blob 提供 12 个或更多。遗留的 HPC 存储架构建立在本地 RAID 上,可以在规模上远远低于 5 个 9,取决于驱动器故障率和重建窗口,可能每年在十亿文件的语料库中丢失数千个文件。现代网络擦除编码具有多级保护,可以超过 11 个 9。两个现实之间的差距是存储系统可以真正担保 SLA 和不能担保 SLA 之间的差距。
基础设施团队应该如何量化存储可用性对 GPU 舰队的经济影响?
当您诚实地运行数学运算时,结果很令人清醒。共享存储故障不会产生比例的 SLA 不足。它在连接到该存储的每个 GPU 机架上同时产生违约。一个 5,000 个 GPU 的集群,存储可用性为 98%,不会提供 2% 的性能损失。它每年产生 876,000 个 GPU 小时的丢失计算量。在代表性的 GPU 小时成本下,这转化为每年数百万美元的闲置计算量,再加上每个受影响的机架同时需要的 SLA 信用。
大型集群中存储故障的爆炸半径是整个集群。基础设施团队需要明确建模这一点:在当前存储可用性数字下,闲置计算的年度成本是多少,每个可用性等级的 SLA 信用义务是什么,以及 SLA 故障的客户流失风险是什么?CoreWeave (CRWV ) 和 Oracle (ORCL ) 已经提供了 99% 的机架级别的正常运行时间。无法匹配这一点的提供商正在失去交易,而且他们正在失去的交易是越来越多的高价值企业合同,这些合同是 Neocloud 市场需要证明其长期经济效益的交易。
不同存储架构在功率受限环境中如何比较性能每瓦?
这几乎在每次严肃的基础设施对话中都会出现,差异并不是边际上的。这是乘法上的。基于已发布的规格和可比配置,提供大约 1,340 GB/s 的读取吞吐量,一种架构消耗 55 千瓦,而另一种架构在大约 16 千瓦下实现了类似的输出。这是一个 3.4 倍的性能每瓦的差异。在一个数据中心中,人工智能工作负载消耗 40 到 250 千瓦每个机架,对固定电网连接,浪费的存储瓦特是无法部署的 GPU。NVIDIA 自己的 BlueField-4 文档明确指出,电力可用性是扩展人工智能工厂的主要约束。
还有一个运营商经常忽略的二阶效应。一些存储架构需要每个 GPU 节点 5 GB 的 DRAM 和 1 到 4 个专用 CPU 核心才能实现峰值存储性能。在一个 500 个节点的集群中,这意味着 2.5 TB 的 DRAM 和多达 2,000 个 CPU 核心永久不可用于人工智能工作负载。当您为每个 GPU 支付 30,000 美元或更多时,每个被盗的核心和每个被锁定的千兆字节都是对计算投资的直接税,这个计算投资本应是基础设施的全部目的。
存储架构如何直接影响 SLA 竞争力,当正常运行时间保证接近 99% 时?
存储是任何 GPU 集群中最大的爆炸半径,这使得它成为任何诚实的 SLA 承诺中最重要的变量。SemiAnalysis ClusterMAX 2.0 评级系统,这已经成为 Neocloud 采购中的一个有影响力的基准,在定价谈判中使 SLA 成为一个明确的因素。没有具有竞争力的 SLA 的提供商现在正在失去交易。
耐用性维度同样重要,但讨论得较少。企业客户已经被 AWS S3 和 Azure Blob 条件化为期望 11 到 12 个 9 的耐用性。遗留的 HPC 存储架构建立在本地 RAID 上,可以在规模上远远低于 5 个 9,取决于驱动器故障率和重建窗口,可能每年在十亿文件的语料库中丢失数千个文件。现代网络擦除编码具有多级保护,可以超过 11 个 9。两个现实之间的差距是存储系统可以真正担保 SLA 和不能担保 SLA 之间的差距。
哪些存储功能最有可能决定 Neocloud 的长期生存能力通过整合?
那些解决整个基础设施栈的总拥有成本方程的运营商将会生存下来,而不仅仅是 GPU 采购方程。其中包括几个特定的功能。
首先,统一的软件定义架构运行闪存和磁盘在同一个数据平面上,具有本地高性能分层,无外部数据移动器,无第二个软件栈,无操作复杂性引入通过连接单独的系统。其次,存储可以独立于闪存和磁盘的成本曲线运行,因为这些市场将独立地移动。第三,自愈系统可以在没有专门的管理员在 3 点进行手动恢复的情况下保持高可用性。操作复杂的存储是随着规模扩大而复合的隐性成本。第四,耐用性可以在超大规模云基准的 SLA 中得到可信的担保。
更广泛的观点是,整合浪潮正在区分为第一天的基准和第三年经济的基础设施。H100 租赁价格已从峰值下降了 60% 以上。市场不再奖励 GPU 积累。它要求对投资资本的回报进行证明。存储架构是这一证明的所在,因为它是 GPU 利用率、SLA 承诺、功率效率和长期成本结构的汇聚点。
您想对今天正在评估其存储策略的 Neocloud 运营商说什么?
不要让存储决策成为您默认做出的决定。基础设施栈的每个其他部分都经过了严格的工程和财务审查。存储不应该有所不同。那些将在三年后仍然存在的运营商是那些对真正的每个有用计算的 GPU 小时成本进行了深入审查、了解了其真实的可用性态度并确保其针对工作负载进行了调整而不是针对采购捷径进行了调整的运营商。
窗口正在关闭。整合已经开始,经济学是无情的。但是,对于愿意以与 GPU 选择相同的严谨性重新思考存储层的运营商来说,VDURA 的机会是巨大的。存储做得对不仅可以降低成本,还可以解锁机架中每个 GPU 的全部价值。












