AIモデルとプラットフォーム

Nvidia、PAIRで家庭内コンピュータを単一のAI推論クラスターに接続

mm
Unite.AI を Google の優先ソースに追加

Nvidiaは2026年9月3日に、Personal AI Router(PAIR)のベータ版をリリースしました。この無料のオープンソースソフトウェアは、ホームネットワーク上の対応デバイスを単一のクラスターに結び付け、ローカルでのAI推論を可能にし、エージェントワークロードからのリクエストを利用可能なマシンにルーティングします。

名前とは裏腹に、PAIRはハードウェアルーターでも新しい推論エンジンでもありません。Nvidiaの技術ブログ投稿によれば、OllamaやLM Studioといったエンジンは依然として各モデルを選択されたマシン上で実行しますが、PAIRは参加システムを検出し、各システムがリクエストに応答可能かを追跡し、独立したジョブをスケジュールし、すべての応答を元のアプリケーションに返します。

ベータ版がサポートする内容

PAIRベータはWindows 11、DGX OS、Ubuntu 14.04、macOS Tahoe上で動作し、3つのOSすべてでx64およびarm64アーキテクチャがサポートされています。プロジェクトのドキュメントでは、Windows on ARMは実験的と記載されています。Nvidiaの製品ページでは、サポート対象ハードウェアとして20シリーズ以降のすべてのGeForce RTX GPU、DGX SparkおよびGB10システム、そしてApple M4チップ以降を搭載したMacが挙げられ、最低8 GBのRAMと推奨ディスク容量20 GB以上が必要とされています。技術ブログ記事では、さらにTuringアーキテクチャ以降のRTX PROワークステーションGPUも対象に含まれています。

動作にはインターネット接続は不要ですが、モデルをダウンロードする際には必要です。製品ページでは、クラスターの構築に特別なケーブルやラックは不要であることが示されています:ユーザーはソフトウェアをダウンロードし、デバイスを追加してAIアプリケーションを実行します。NvidiaはPAIRのソースコードをApache License 2.0の下で公開しており、開発者はコードを検査し、問題を報告し、発見・ペアリング・ルーティング・エンジン統合・エンドポイント・ユーザー体験の改善に貢献できると述べています。

GPUをプールせずにルーティング

NvidiaはPAIRをハードウェアを統合する手段ではなく、仮想的な推論ルーターとして位置付けています。各リクエストは適格なノードに割り当てられ、そのノード上で完了するまで保持されます。ソフトウェアはGPUメモリをプールしたり、GPUを大規模な論理アクセラレータに結合したり、単一モデルを複数マシンに分割したり、実行中の推論リクエストをノード間で分割したりしません。

アプリケーションはOllama互換およびOpenAI互換のプロキシエンドポイントを通じて接続しますが、これらはPAIRが両エンジンが使用するデフォルトポートを取得して作成します。Nvidiaは、これによりエージェントは既存のインターフェースをそのまま使用でき、新たなクラスターAPIを統合する必要がないと述べています。ノードがリクエストの対象になるのは、対応エンジンが有効化され、要求された正確なモデルがそのノードに存在する場合のみで、PAIRは既にモデルを保持していることが分かっているノードを優先します。クラスター内のモデルは必ずしも同一である必要はなく、同じモデルタグを複数ノードにロードすれば、スケジューラはより大きな適格プールを利用できます。

新たなリクエストごとに、スケジューラはペアリングされたノードがオンラインで準備ができているか、対応エンジンが有効か、要求されたモデルが存在するか、アクティブジョブを含む現在のワークロード、そしてグラフィック負荷の高いアプリケーションが動作しているかなどのGPU使用率を考慮します。ノードは利用可能なときに容量を提供し、ノートパソコンがスリープ状態になる、閉じる、ネットワークから離れるといった必要に応じて容量を手放すことができます。

検出、セキュリティ、プライバシー

インストール後、PAIRはmDNSによるローカルネットワーク検出を使用して近隣のシステムを自動的に検出し、IPアドレスでノードを追加することも可能です。2台のマシンをペアリングする際は、招待側マシンに表示される6桁のPINを入力側マシンで入力します。Nvidiaは、セキュアなペアリングが確立されるまでノード間通信はすべてブロックされ、その後はMTLSと生成された証明書でトラフィックが保護されると述べています。同社はこのソフトウェアをプライベートなローカル推論向けに位置付けており、プロンプトやファイル、エージェントコンテキストはユーザーのホームネットワーク内に留まり、クラウド推論サービスへ送信されません。リポジトリのドキュメントは、ローカルHTTPエンドポイント、LAN検出、クラスター通信を含むため、信頼できないネットワークや共有ネットワーク上でPAIRを展開する前にセキュリティ注意事項を必ず読むよう警告しています。

対象ワークロードと非公式デモ

Nvidiaは、PAIRが多数の独立したリクエストを同時に処理するワークロード、例えばリードエージェントが複雑なタスクをサブエージェント向けの小さなジョブに分割するマルチエージェントアプリケーションを対象としていると述べています。Hermes DesktopエージェントとOllamaを用いたデモでは、Qwen 3.6 35B A3Bモデルを使用した5サブエージェントタスクが単一のRTX Sparkノートパソコンで平均18分かかったのに対し、RTX Sparkノートパソコン、DGX Spark、RTX 5090の3デバイスからなるPAIRクラスターでは同じワークロードが平均8分48秒で完了したと報告されました。Nvidiaはこの結果を一般的なベンチマークや線形スケーリングの保証ではなく、構成に依存した非公式デモと位置付け、結果はワークロードの並列性、モデル、エンジン設定、ハードウェア、ネットワーク、ノードの可用性に左右されると指摘しています。

同社は、極端にシーケンシャルなタスクや、単一の長時間モデル呼び出しが支配的なワークロード、または要求されたモデルを保持しているノードが1つだけの構成では効果が低減する可能性があると述べています。リポジトリのドキュメントでは、現在のソフトウェアはキューイングされた作業と粗いGPU使用率シグナルを組み合わせた単一のスケジューリングポリシーのみを提供しており、類似したマシン間では適合しやすいが、構成が大きく混在するクラスターには不向きであること、そしてNvidiaはスケジューラをより賢くするためのフィードバックを求めているが、具体的に何がいつ提供されるかについては固定した約束はないと付記しています。

テオ・ナッシュは、Unite.AIのAI生成専門家で、AIインフラストラクチャ、コンピューティング、そしてモダンな人工知能を支えるハードウェアシステムについて取り上げています。彼の仕事は、大規模なAIワークロードの背後にある技術的基礎に焦点を当てており、データセンター、加速器、ネットワーク、そしてそれらを結びつけるソフトウェアスタックを含みます。
分析的かつエンジニアリング主導の視点から、テオは、GPU、カスタムシリコン、メモリアーキテクチャ、分散システムの進歩が新しいAIモデルの世代をどのように可能にしているかを調査しています。彼は、パフォーマンスのトレードオフ、エネルギー効率、スケーラビリティ、そしてAIインフラストラクチャの現実世界での展開を形作る実用的制約に特に注意を払っています。
テオ・ナッシュによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって技術的正確性、明確性、そして急速に進化しているAIコンピューティング景観の責任ある報道を確保するためにレビューされています。