Modelos y plataformas de IA
Nvidia conecta ordenadores domésticos en un único clúster de inferencia de IA con PAIR

Nvidia, el 3 de septiembre de 2026, lanzó la versión beta del Personal AI Router (PAIR), un software gratuito y de código abierto que conecta ordenadores compatibles en una red doméstica en un único clúster para inferencia de IA local, dirigiendo solicitudes de cargas de trabajo de agentes a través de las máquinas disponibles.
A pesar de su nombre, PAIR no es un router de hardware ni un nuevo motor de inferencia. Según la publicación técnica del blog de Nvidia que anuncia el software, motores como Ollama y LM Studio siguen ejecutando cada modelo en una máquina seleccionada, mientras que PAIR descubre los sistemas participantes, verifica si cada uno está listo para una solicitud, programa trabajos independientes y devuelve cada respuesta a la aplicación que la originó.
Qué admite la beta
La beta de PAIR funciona en Windows 11, DGX OS, Ubuntu 14.04 y macOS Tahoe, con arquitecturas x64 y arm64 compatibles en los tres sistemas operativos; la documentación del proyecto describe Windows on ARM como experimental. La página del producto de Nvidia enumera el hardware compatible como todas las GPUs GeForce RTX a partir de la Serie 20, sistemas DGX Spark y GB10, y Macs con chips Apple M4 o posteriores, junto con un mínimo de 8 GB de RAM y 20 GB o más de espacio en disco recomendado. La publicación técnica del blog también incluye GPUs RTX PRO de estaciones de trabajo basadas en la arquitectura Turing y posteriores.
No se necesita conexión a Internet para su funcionamiento, aunque sí es necesaria para descargar los modelos. La página del producto indica que configurar un clúster no requiere cables o bastidores especiales: los usuarios descargan el software, añaden sus dispositivos y ejecutan sus aplicaciones de IA a través de él. Nvidia publica el código fuente de PAIR bajo la Licencia Apache 2.0, y afirma que los desarrolladores pueden inspeccionar el código, reportar problemas y contribuir con mejoras en el descubrimiento, emparejamiento, enrutamiento, integración de motores, puntos finales y la experiencia del usuario.
Enrutamiento sin agrupar GPUs
Nvidia describe PAIR como un router de inferencia virtual más que como una forma de combinar hardware. Cada solicitud se asigna a un nodo elegible y permanece allí durante su vida útil; el software no agrupa memoria de GPU, no combina GPUs en un acelerador lógico mayor, no fragmenta un único modelo entre máquinas, ni divide una solicitud de inferencia en curso entre nodos.
Las aplicaciones se conectan a través de puntos finales proxy compatibles con Ollama y OpenAI, que PAIR crea al tomar el control de los puertos predeterminados que utilizan los dos motores. Nvidia dijo que esto significa que los harness de agentes pueden seguir usando la interfaz que ya conocen, sin necesidad de integrar una nueva API de clúster. Un nodo solo se vuelve elegible para una solicitud cuando un motor compatible está habilitado en él y el modelo exacto solicitado está presente, y PAIR prefiere los nodos que ya sabe que poseen el modelo. Los modelos no tienen que ser idénticos en todo el clúster; cargar la misma etiqueta de modelo en más nodos brinda al planificador un conjunto elegible más amplio.
Para cada nueva solicitud, el planificador evalúa si un nodo emparejado está en línea y listo, si un motor compatible está habilitado, si el modelo solicitado está presente, la carga de trabajo actual incluyendo trabajos activos, y la utilización existente de GPU, como una aplicación intensiva en gráficos en ejecución. Los nodos pueden aportar capacidad cuando están disponibles y retirarse cuando sea necesario, por ejemplo, cuando una laptop entra en modo de suspensión, se cierra o abandona la red.
Descubrimiento, seguridad y privacidad
Tras la instalación, PAIR utiliza el descubrimiento en red local mediante mDNS para encontrar sistemas cercanos automáticamente, y también se puede añadir un nodo mediante dirección IP. El emparejamiento de dos máquinas usa un PIN de seis dígitos que se muestra en la máquina que invita y se ingresa en la invitada. Nvidia afirmó que toda comunicación nodo a nodo está bloqueada hasta que se establece el emparejamiento seguro, después de lo cual el tráfico se protege con MTLS y certificados generados. La compañía posiciona el software para inferencia local privada, con indicaciones, archivos y contexto de agente permaneciendo en la red doméstica del usuario en lugar de enviarse a un servicio de inferencia en la nube. La documentación del repositorio advierte a los usuarios que lean sus notas de seguridad antes de desplegar PAIR en una red no confiable o compartida, ya que incluye puntos finales HTTP locales, descubrimiento LAN y redes de clúster.
Cargas de trabajo objetivo y una demostración no oficial
Nvidia indicó que PAIR está dirigido a cargas de trabajo que generan muchas solicitudes independientes simultáneamente, como aplicaciones multi‑agente en las que un agente principal divide una tarea compleja en trabajos más pequeños para subagentes. En una demostración usando el agente Hermes Desktop y Ollama, la compañía informó que una tarea de cinco subagentes con el modelo Qwen 3.6 35B A3B tomó un promedio de 18 minutos en una única laptop RTX Spark, mientras que un clúster PAIR de tres dispositivos que combinaba una laptop RTX Spark, un DGX Spark y una RTX 5090 completó la misma carga de trabajo en un promedio de 8 minutos y 48 segundos. Nvidia caracterizó el resultado como una demostración no oficial y específica de la configuración, más que un benchmark general o una promesa de escalado lineal, señalando que los resultados dependen del paralelismo de la carga, el modelo, la configuración del motor, el hardware, la red y la disponibilidad de nodos.
La compañía señaló que tareas altamente secuenciales, cargas de trabajo dominadas por una única llamada larga al modelo, o configuraciones donde solo un nodo posee el modelo solicitado, pueden obtener menos beneficio. La documentación del repositorio añade que el software actualmente incluye una única política de programación que combina trabajo en cola con una señal gruesa de utilización de GPU, lo que lo hace más adecuado para máquinas similares que para un clúster altamente heterogéneo, y que Nvidia busca comentarios para hacer el planificador más inteligente sin compromisos fijos sobre qué se lanzará o cuándo.












