Modèles et plateformes d’IA

Nvidia connecte les ordinateurs domestiques en un seul cluster d’inférence IA avec PAIR

mm
Ajouter Unite.AI à vos sources préférées sur Google

Nvidia a publié le 3 septembre 2026 la version bêta du Personal AI Router (PAIR), un logiciel gratuit et open source qui relie les ordinateurs compatibles d’un réseau domestique en un seul cluster pour l’inférence IA locale, en acheminant les requêtes des charges de travail d’agents sur les machines disponibles.

Malgré son nom, PAIR n’est pas un routeur matériel et n’est pas un nouveau moteur d’inférence. Selon le billet technique de Nvidia annonçant le logiciel, des moteurs tels qu’Ollama et LM Studio exécutent toujours chaque modèle sur une machine sélectionnée, tandis que PAIR découvre les systèmes participants, vérifie la disponibilité de chacun pour une requête, planifie des tâches indépendantes et renvoie chaque réponse à l’application qui l’a générée.

Ce que la bêta prend en charge

La bêta PAIR fonctionne sous Windows 11, DGX OS, Ubuntu 14.04 et macOS Tahoe, avec les architectures x64 et arm64 prises en charge sur les trois systèmes d’exploitation ; la documentation du projet décrit Windows on ARM comme expérimental. La page produit de Nvidia répertorie le matériel pris en charge comme toutes les GPU GeForce RTX de la série 20 et suivantes, les systèmes DGX Spark et GB10, ainsi que les Mac équipés de puces Apple M4 ou plus récentes, avec un minimum de 8 Go de RAM et 20 Go ou plus d’espace disque recommandé. Le billet technique ajoute également les GPU de stations de travail RTX PRO basés sur l’architecture Turing et plus récents.

Aucune connexion Internet n’est requise pour le fonctionnement, bien qu’une connexion soit nécessaire pour télécharger les modèles. La page produit indique que la mise en place d’un cluster ne nécessite aucun câble ou rack: les utilisateurs téléchargent le logiciel, ajoutent leurs appareils et exécutent leurs applications IA via celui‑ci. Nvidia publie le code source de PAIR sous la licence Apache 2.0, et indique que les développeurs peuvent inspecter le code, signaler des problèmes et contribuer à l’amélioration de la découverte, de l’appairage, du routage, de l’intégration des moteurs, des points de terminaison et de l’expérience utilisateur.

Routage sans mise en commun des GPU

Nvidia décrit PAIR comme un routeur d’inférence virtuel plutôt que comme une méthode de fusion du matériel. Chaque requête est attribuée à un nœud éligible et y reste pendant toute sa durée ; le logiciel ne regroupe pas la mémoire GPU, ne combine pas les GPU en un accélérateur logique plus grand, ne répartit pas un même modèle sur plusieurs machines, ni ne divise une requête d’inférence en cours entre plusieurs nœuds.

Les applications se connectent via des points de terminaison proxy compatibles avec Ollama et OpenAI, que PAIR crée en prenant le contrôle des ports par défaut utilisés par les deux moteurs. Nvidia a déclaré que cela permet aux harness d’agents de continuer à utiliser l’interface qu’ils connaissent déjà, sans qu’il soit nécessaire d’intégrer une nouvelle API de cluster. Un nœud ne devient éligible à une requête que lorsqu’un moteur pris en charge est activé dessus et que le modèle exact demandé y est présent, et PAIR privilégie les nœuds dont il sait déjà qu’ils détiennent le modèle. Les modèles n’ont pas besoin d’être identiques sur l’ensemble du cluster ; charger la même étiquette de modèle sur plusieurs nœuds offre au planificateur un pool d’éligibles plus large.

Pour chaque nouvelle requête, le planificateur évalue si un nœud appairé est en ligne et prêt, si un moteur pris en charge est activé, si le modèle demandé est présent, la charge de travail actuelle incluant les tâches actives, ainsi que l’utilisation GPU existante, par exemple lorsqu’une application gourmande en graphismes tourne. Les nœuds peuvent apporter de la capacité lorsqu’ils sont disponibles et se retirer lorsqu’ils ne le sont plus, par exemple lorsqu’un ordinateur portable se met en veille, s’éteint ou quitte le réseau.

Découverte, sécurité et confidentialité

Après l’installation, PAIR utilise la découverte sur le réseau local via mDNS pour détecter automatiquement les systèmes à proximité, et un nœud peut également être ajouté par adresse IP. L’appairage de deux machines se fait à l’aide d’un code PIN à six chiffres affiché sur la machine invitante et saisi sur la machine invitée. Nvidia a indiqué que toute communication nœud‑à‑nœud est bloquée jusqu’à ce que l’appairage sécurisé soit établi, après quoi le trafic est protégé par MTLS et des certificats générés. L’entreprise positionne le logiciel pour une inference locale privée, les invites, fichiers et le contexte d’agent restant sur le réseau domestique de l’utilisateur plutôt que d’être envoyés à un service d’inférence cloud. La documentation du dépôt avertit les utilisateurs de lire les notes de sécurité avant de déployer PAIR sur un réseau non fiable ou partagé, car il comprend des points de terminaison HTTP locaux, la découverte LAN et la mise en réseau du cluster.

Charges de travail cibles et une démonstration non officielle

Nvidia a indiqué que PAIR vise les charges de travail qui exposent de nombreuses requêtes indépendantes simultanément, comme les applications multi‑agents où un agent principal décompose une tâche complexe en sous‑tâches pour des sous‑agents. Dans une démonstration utilisant l’agent Hermes Desktop et Ollama, l’entreprise a rapporté qu’une tâche à cinq sous‑agents utilisant le modèle Qwen 3.6 35B A3B a pris en moyenne 18 minutes sur un seul ordinateur portable RTX Spark, tandis qu’un cluster PAIR à trois appareils combinant un ordinateur portable RTX Spark, un DGX Spark et un RTX 5090 a achevé la même charge de travail en moyenne en 8 minutes 48 secondes. Nvidia a qualifié ce résultat de démonstration non officielle et spécifique à la configuration, plutôt que d’un benchmark général ou d’une promesse d’évolutivité linéaire, soulignant que les résultats dépendent du parallélisme de la charge, du modèle, des paramètres du moteur, du matériel, du réseau et de la disponibilité des nœuds.

L’entreprise a indiqué que les tâches très séquentielles, les charges de travail dominées par un appel de modèle long, ou les configurations où un seul nœud détient le modèle demandé pourraient offrir moins d’avantages. La documentation du dépôt ajoute que le logiciel propose actuellement une unique politique de planification combinant le travail en file d’attente avec un signal d’utilisation GPU grossier, ce qui le rend plus adapté à des machines similaires qu’à un cluster très hétérogène, et que Nvidia souhaite recueillir des retours pour rendre le planificateur plus intelligent, sans engagements fermes sur ce qui sera livré ou quand.

Théo Nash est un spécialiste généré par IA chez Unite.AI, couvrant l'infrastructure IA, le calcul et les systèmes matériels qui alimentent l'intelligence artificielle moderne. Son travail se concentre sur les fondements techniques des charges de travail IA à grande échelle, notamment les centres de données, les accélérateurs, les réseaux et les piles logicielles qui les relient.
Avec une perspective analytique et axée sur l'ingénierie, Théo examine comment les progrès des GPU, du silicium personnalisé, des architectures de mémoire et des systèmes distribués permettent de nouvelles générations de modèles IA. Il prête une attention particulière aux compromis de performance, à l'efficacité énergétique, à la scalabilité et aux contraintes pratiques qui façonnent le déploiement réel de l'infrastructure IA.
Les articles rédigés par Théo Nash sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude technique, la clarté et la couverture responsable du paysage de calcul IA en évolution rapide.