AI 模型与平台
规模化 AI 推理:探索 NVIDIA Dynamo 的高性能架构
随着 人工智能 (AI) 技术的进步,高效和可扩展的推理解决方案的需求迅速增长。预计,AI 推理将变得比训练更重要,因为公司将重点关注快速运行模型以进行实时预测。这一转变强调了需要一个强大的基础设施来处理大量数据并最小化延迟的必要性。
推理在诸如 自动驾驶汽车、欺诈检测和实时医疗诊断等行业中至关重要。然而,它具有独特的挑战,特别是在扩展以满足诸如视频流媒体、实时数据分析和客户洞察等任务的需求时。传统的 AI 模型难以高效地处理这些高吞吐量的任务,通常导致高成本和延迟。随着企业扩大其 AI 能力,它们需要解决方案来管理大量推理请求,而不牺牲性能或增加成本。
这就是 NVIDIA Dynamo (NVDA ) 的用途。Dynamo 是一种新的 AI 框架,旨在解决规模化 AI 推理的挑战。它帮助企业加速推理工作负载,同时保持强大的性能和降低成本。Dynamo 建立在 NVIDIA 的强大的 GPU 架构之上,并集成了诸如 CUDA、TensorRT 和 Triton 等工具,改变了企业管理 AI 推理的方式,使其更容易和更高效。
规模化 AI 推理的日益增长的挑战
AI 推理是使用预训练的 机器学习 模型从实时数据中进行预测的过程,对于许多实时 AI 应用程序至关重要。然而,传统系统通常难以处理对 AI 推理日益增长的需求,特别是在自动驾驶汽车、欺诈检测和医疗诊断等领域。
实时 AI 的需求正在迅速增长,驱动因素是快速、即时决策的需求。2024 年 5 月的一份 Forrester 报告发现,67% 的企业将 生成式 AI 集成到其运营中,突出了实时 AI 的重要性。推理是许多 AI 驱动任务的核心,例如使自驾车能够快速决策、检测金融交易中的欺诈和协助医疗诊断,如分析医疗图像。
尽管有这样的需求,传统系统仍难以处理这些任务的规模。其中一个主要问题是 GPU 的利用不足。例如,许多系统中的 GPU 利用率仍然在 10% 至 15% 之间,这意味着大量计算能力被浪费。随着 AI 推理工作负载的增加,会出现额外的挑战,例如内存限制和缓存抖动,这些问题会导致延迟和降低整体性能。
实现低延迟对于实时 AI 应用程序至关重要,但许多传统系统难以跟上,特别是在使用云基础设施时。 McKinsey 的一份报告显示,70% 的 AI 项目由于数据质量和集成问题而未能达到目标。这些挑战凸显了需要更高效和可扩展的解决方案的必要性,这就是 NVIDIA Dynamo 的用途。
使用 NVIDIA Dynamo 优化 AI 推理
NVIDIA Dynamo 是一个开源、模块化的框架,旨在优化大规模 AI 推理任务在分布式多 GPU 环境中的性能。它旨在解决生成式 AI 和推理模型中的常见挑战,例如 GPU 利用不足、内存瓶颈和请求路由效率低下。Dynamo 结合了硬件感知优化和软件创新来解决这些问题,提供了更高效的解决方案用于高需求的 AI 应用程序。
Dynamo 的一个关键特性是其分离的服务架构。这种方法将计算密集的预处理阶段与解码阶段分离,预处理阶段处理上下文处理,而解码阶段涉及令牌生成。通过将每个阶段分配给不同的 GPU 集群,Dynamo 允许独立优化。预处理阶段使用高内存 GPU 以实现更快的上下文摄取,而解码阶段使用延迟优化的 GPU 以实现高效的令牌流式传输。这种分离提高了吞吐量,使得像 Llama 70B 这样的模型速度提高了一倍。
它包括一个 GPU 资源规划器,该规划器根据实际利用率动态调度 GPU 分配,优化预处理和解码集群之间的工作负载,以防止过度分配和空闲周期。另一个关键特性是 KV 缓存感知智能路由器,它确保传入的请求被定向到持有相关键值 (KV) 缓存数据的 GPU,从而最小化冗余计算并提高效率。这种特性对于生成更多令牌的多步骤推理模型特别有益,因为这些模型比标准的大型语言模型生成更多的令牌。
NVIDIA 推理 TranXfer 库 (NIXL) 是另一个关键组件,实现了 GPU 和异构内存/存储层(如 HBM 和 NVMe)之间的低延迟通信。这种特性支持亚毫秒的 KV 缓存检索,对于时间敏感的任务至关重要。分布式 KV 缓存管理器还帮助卸载不经常访问的缓存数据到系统内存或 SSD 中,从而释放 GPU 内存用于活跃计算。这种方法提高了整体系统性能,尤其是对于像 DeepSeek-R1 671B 这样的大型模型,性能提高了多达 30 倍。
NVIDIA Dynamo 与 NVIDIA 的全栈集成,包括 CUDA、TensorRT 和 Blackwell GPU,同时支持流行的推理后端,如 vLLM 和 TensorRT-LLM。基准测试显示,对于 DeepSeek-R1 等模型,Dynamo 的每秒每 GPU 的令牌数量提高了多达 30 倍,运行在 GB200 NVL72 系统上。
作为 Triton 推理服务器的继任者,Dynamo 专为需要可扩展、成本效益高的推理解决方案的 AI 工厂而设计。它惠及自动系统、实时分析和多模型代理工作流。其开源和模块化设计还允许轻松定制,使其适用于多种 AI 工作负载。
现实世界应用和行业影响
NVIDIA Dynamo 已经在需要实时 AI 推理的行业中展示了其价值,提高了自动系统、实时分析和 AI 工厂的性能。
像 Together AI 这样的公司已经使用 Dynamo 来扩展推理工作负载,实现了在 NVIDIA Blackwell GPU 上运行 DeepSeek-R1 模型的容量提高了多达 30 倍。此外,Dynamo 的智能请求路由和 GPU 调度提高了大规模 AI 部署的效率。
竞争优势:Dynamo 与替代方案的比较
NVIDIA Dynamo 在几个方面优于替代方案,如 AWS Inferentia 和 Google (GOOGL ) TPUs。它旨在高效地处理大规模 AI 工作负载,优化 GPU 调度、内存管理和请求路由,以提高多个 GPU 的性能。与 AWS Inferentia 紧密绑定到 AWS 云基础设施不同,Dynamo 提供了灵活性,支持混合云和本地部署,帮助企业避免供应商锁定。
Dynamo 的一个主要优势是其开源和模块化的架构,允许公司根据自己的需求定制框架。它优化了推理过程的每一步,确保 AI 模型运行顺畅和高效,同时充分利用可用的计算资源。凭借其可扩展性和灵活性,Dynamo 适合于寻求高性能和成本效益的 AI 推理解决方案的企业。
结论
NVIDIA Dynamo 通过提供可扩展和高效的解决方案来应对企业在实时 AI 应用程序中面临的挑战,从而改变了 AI 推理的世界。其开源和模块化的设计允许优化 GPU 使用、更好地管理内存并更有效地路由请求,使其非常适合大规模 AI 任务。通过分离关键过程并允许 GPU 动态调整,Dynamo 提高了性能并降低了成本。
与传统系统或竞争对手不同,Dynamo 支持混合云和本地设置,为企业提供了更多的灵活性,并降低了对任何供应商的依赖。凭借其令人印象深刻的性能和适应性,NVIDIA Dynamo 为 AI 推理设定了新的标准,提供了先进、成本效益高和可扩展的解决方案,以满足企业的 AI 需求。












