AI 模型与平台
PyTorch 基金会整合 Ray,一种分布式计算框架,构建统一的 AI 基础设施栈

开源 AI 生态系统今天迈出了决定性的步伐,PyTorch 基金会 宣布 Ray,一种最初由 Anyscale 开发的分布式计算框架,正式加入其行列。这一举动标志着一个重要的步骤,朝着统一、互操作和生产就绪的 AI 计算栈迈进——这一栈将 PyTorch(模型开发)、vLLM(分布式推理)和 Ray(大规模执行)等基础层紧密结合。
统一的开源 AI 基础
在 Linux 基金会的托管下,PyTorch 基金会作为开源 AI 技术的中心枢纽,旨在减少碎片化,促进整个 AI 开发过程中的协作。通过整合 Ray 与 PyTorch 和 vLLM,基金会提供了行业长期以来所需的东西——一个凝聚的、端到端的栈,用于构建、训练和部署大规模 AI。
Ray 的加入也代表了多年学术和工业演进的结晶。起源于 UC Berkeley 的 RISELab,Ray 被设计为简化 AI 和机器学习工作负载的分布式计算。它使开发者能够无缝地将作业从单台笔记本扩展到成千上万台机器,无需重写代码或管理复杂系统。截至今日,Ray 已拥有超过 39,000 个 GitHub 星标 和超过 2.14 亿次下载,使其成为世界上最广泛采用的分布式计算框架之一。
Ray 如何补充 PyTorch 和 vLLM
Ray 位于训练和推理框架(如 PyTorch、DeepSpeed 和 vLLM)与容器编排层(如 Kubernetes 或 Slurm)之间。这一位置使 Ray 能够高效地协调分布式工作负载,同时弥合模型训练和生产级部署之间的差距。
Ray 的关键能力包括:
- 多模式数据处理: 并行处理大量、多样化的数据集——文本、图像、音频和视频——最大化吞吐量和效率。
- 预训练和微调: 将 PyTorch 和其他框架扩展到成千上万个 GPU 上,用于预训练和微调任务。
- 分布式推理: 在生产环境中部署模型,具有高吞吐量和低延迟,动态管理异构集群中的工作负载突发。
这些功能使 Ray 成为“粘合剂”,将模型创建、优化和服务结合起来,有效地形成现代 AI 基础设施的分布式计算引擎层。
这对开发者和企业意味着什么
在今天的 AI 驱动经济中,组织面临着巨大的挑战,包括扩展、供应商锁定和计算效率。专有系统经常碎片化工作流程,减缓创新。随着 Ray 加入 PyTorch 基金会,开发者获得了一个完全开源、互操作的计算栈,消除了许多这些痛点。
正如 Matt White,Linux 基金会 AI 总经理所解释的,这次合作 “联合了构建下一代 AI 系统所需的关键组件。” 统一允许团队开发高级 AI 系统——从大型语言模型到多模式应用——而无需依赖封闭、专有的基础设施。相反,开发者可以使用可扩展、模块化和社区驱动的生态系统训练和部署 AI 模型。
对开源 AI 的更广泛影响
PyTorch、vLLM 和 Ray 之间的合作预示着开源计算互操作性的新时代。在 Linux 基金会提供中立治理的情况下,AI 行业获得了开发共享基础设施的可持续模式——类似于 Kubernetes 标准化云编排。
行业领袖也回应了这一观点。Cloud Native Computing Foundation 的 Chris Aniszczyk 指出,“Ray 和 Kubernetes 是自然互补的,”结合编排和分布式计算的优势,推动下一代 AI 系统。Uber 的工程总监 Zhitao Li 补充说,Ray 已经是他们 AI 平台的 “核心部分”, 支持大规模训练和数据处理。而 PyTorch 基金会董事会成员、Meta 的 Joe Spisak 称 Ray 的加入是一个 “开源 AI 的重要里程碑”, 强调了它如何创建一个统一、社区驱动的计算栈。
展望未来
Anyscale 的联合创始人 Robert Nishihara 总结了这一里程碑:
“我们的目标是使分布式计算像编写 Python 代码一样简单。加入 PyTorch 基金会确保 Ray 继续成为开发者的开源、社区驱动的骨干。”
开发者和贡献者可以通过 Ray 的 GitHub 仓库或参加 Ray Summit 2025 在旧金山的会议进一步参与该项目,届时社区将更深入地探讨这一新的开源基础设施对 AI 可扩展性和可及性的未来意义。
本质上,Ray 的加入填补了开源 AI 生态系统中缺失的层次——将建模、推理和分布式执行整合到一个基础设施中。这是一个至关重要的步骤,朝着一个未来迈进,在那里,AI 基础设施不仅更加强大,而且更加开放、高效和开发者友好。












