AI 模型与平台

Nvidia 将家庭电脑连接成一个 AI 推理集群,使用 PAIR

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Nvidia 于 2026 年 9 月 3 日发布了 Personal AI Router (PAIR) 的测试版,这是一款免费开源软件,可将家庭网络中的兼容电脑链接成一个本地 AI 推理集群,并在可用机器之间路由来自代理工作负载的请求。

尽管名称如此,PAIR 并非硬件路由器,也不是全新的推理引擎。根据 Nvidia 宣布该软件的技术博客文章,Ollama 和 LM Studio 等引擎仍然在选定的机器上运行每个模型,而 PAIR 会发现参与的系统,跟踪每台机器是否已准备好接受请求,调度独立的作业,并将每个响应返回给发起请求的应用程序。

测试版支持的内容

PAIR 测试版可在 Windows 11、DGX OS、Ubuntu 14.04 和 macOS Tahoe 上运行,三种操作系统均支持 x64 和 arm64 架构;项目文档将 Windows on ARM 标记为实验性。Nvidia 的产品页面列出的受支持硬件包括 20 系列及以后所有 GeForce RTX GPU、DGX Spark 与 GB10 系统,以及配备 Apple M4 chips 或更新芯片的 Mac,此外还要求至少 8 GB 内存和推荐的 20 GB 以上磁盘空间。技术博客文章还列出了基于 Turing 架构及更高版本的 RTX PRO 工作站 GPU。

运行时不需要互联网连接,但下载模型时需要联网。产品页面指出,搭建集群无需特殊的线缆或机架:用户只需下载软件、添加设备,即可通过它运行 AI 应用。Nvidia 将 PAIR 的源代码在 Apache License 2.0 下公开发布,开发者可以审查代码、报告问题,并为发现、配对、路由、引擎集成、端点以及用户体验等方面贡献改进。

在不池化 GPU 的情况下进行路由

Nvidia 将 PAIR 描述为虚拟推理路由器,而非硬件合并方案。每个请求被分配到一个符合条件的节点并在其生命周期内保持在该节点上;该软件不会池化 GPU 内存、将多个 GPU 合并为更大的逻辑加速器、在多台机器之间分片单一模型,也不会在节点之间拆分正在进行的推理请求。

应用程序通过兼容 Ollama 和兼容 OpenAI 的代理端点进行连接,PAIR 通过接管这两种引擎使用的默认端口来创建这些端点。Nvidia 表示,这意味着代理工具可以继续使用已有的接口,无需集成全新的集群 API。只有在节点上启用了受支持的引擎且存在所请求的精确模型时,该节点才有资格接受请求,且 PAIR 更倾向于已知持有该模型的节点。模型不必在整个集群中完全相同;在更多节点上加载相同的模型标签会为调度器提供更大的可用池。

对于每个新请求,调度器会评估配对节点是否在线且已就绪、是否启用了受支持的引擎、请求的模型是否存在、当前工作负载(包括活跃作业)以及现有的 GPU 使用情况,例如正在运行的图形密集型应用。节点在有空闲容量时可以贡献资源,而在需要时则会退出,例如笔记本进入睡眠、关闭或离开网络时。

发现、 安全与隐私

安装后,PAIR 通过 mDNS 在本地网络中自动发现附近的系统,也可以通过 IP 地址手动添加节点。配对两台机器时,需要在邀请机器上显示的六位 PIN,并在被邀请机器上输入。Nvidia 表示,所有节点间的通信在安全配对建立之前都会被阻断,随后流量将通过 MTLS 和生成的证书进行加密。公司将该软件定位为私有本地推理解决方案,提示、文件和代理上下文均保留在用户的家庭网络中,而不会发送至云推理服务。仓库文档提醒用户在不受信任或共享网络上部署 PAIR 前务必阅读其安全说明,因为它包含本地 HTTP 端点、局域网发现以及集群网络功能。

目标工作负载与非官方演示

Nvidia 表示,PAIR 旨在处理一次产生大量独立请求的工作负载,例如多代理应用中,主代理将复杂任务拆分为多个子代理的子任务。在使用 Hermes Desktop 代理和 Ollama 的演示中,公司报告称,使用 Qwen 3.6 35B A3B 模型的五子代理任务在单台 RTX Spark 笔记本上平均耗时 18 分钟,而由 RTX Spark 笔记本、DGX Spark 和 RTX 5090 组成的三设备 PAIR 集群则在平均 8 分钟 48 秒内完成相同工作负载。Nvidia 将此结果描述为非官方、特定配置的演示,而非通用基准或线性扩展的承诺,并指出结果取决于工作负载的并行度、模型、引擎设置、硬件、网络以及节点可用性。

公司指出,高度顺序化的任务、主要由单个长模型调用主导的工作负载,或仅有单一节点持有请求模型的配置,可能收益较少。仓库文档补充说明,当前软件仅提供一种调度策略,即将排队工作与粗粒度的 GPU 利用率信号相结合,这使其更适合相似机器的集群,而非高度异构的集群,并且 Nvidia 希望获得关于让调度器更智能的反馈,但并未对何时以及以何种形式发布新功能作出固定承诺。

Theo Nash 是 Unite.AI 的 AI 生成专家,负责报道 AI 基础设施、计算和支持现代人工智能的硬件系统。他的工作重点是大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接起来的软件栈。具有分析和工程驱动的视角,Theo 检视 GPU、定制硅、内存架构和分布式系统的进步如何使新一代 AI 模型成为可能。他特别关注性能权衡、能效、可扩展性和实际约束,这些约束影响了 AI 基础设施的现实世界部署。 Theo Nash 撰写的文章由 Unite.AI 的编辑团队审查,以确保技术准确性、清晰度和对快速演变的 AI 计算领域的负责任报道。