Modelos e plataformas de IA
Nvidia Conecta Computadores Domésticos em um Único Cluster de Inferência de IA com PAIR

A Nvidia, em 3 de setembro de 2026, lançou a versão beta do Personal AI Router (PAIR), um software gratuito e de código aberto que conecta computadores compatíveis em uma rede doméstica em um único cluster para inferência local de IA, roteando solicitações de cargas de trabalho de agentes entre as máquinas disponíveis.
Apesar do nome, o PAIR não é um roteador de hardware nem um novo mecanismo de inferência. Segundo o post técnico da Nvidia que anuncia o software, mecanismos como Ollama e LM Studio ainda executam cada modelo em uma máquina selecionada, enquanto o PAIR descobre os sistemas participantes, verifica se cada um está pronto para uma solicitação, agenda trabalhos independentes e devolve cada resposta ao aplicativo que a originou.
O que a versão beta suporta
A versão beta do PAIR funciona no Windows 11, DGX OS, Ubuntu 14.04 e macOS Tahoe, com suporte às arquiteturas x64 e arm64 nos três sistemas operacionais; a documentação do projeto descreve o Windows on ARM como experimental. A página de produto da Nvidia lista o hardware compatível como todas as GPUs GeForce RTX da Série 20 em diante, sistemas DGX Spark e GB10, e Macs com chips Apple M4 ou mais recentes, além de exigir no mínimo 8 GB de RAM e 20 GB ou mais de espaço em disco recomendado. O post técnico também inclui GPUs RTX PRO para estações de trabalho baseadas na arquitetura Turing ou posterior.
Nenhuma conexão com a internet é necessária para o funcionamento, embora seja preciso uma conexão para baixar modelos. A página de produto afirma que a configuração de um cluster não requer cabos ou racks: os usuários baixam o software, adicionam seus dispositivos e executam suas aplicações de IA por meio dele. A Nvidia disponibiliza o código-fonte do PAIR sob a Licença Apache 2.0, e declara que os desenvolvedores podem inspecionar o código, relatar problemas e contribuir com melhorias para descoberta, emparelhamento, roteamento, integração de mecanismos, endpoints e a experiência do usuário.
Roteamento sem Agrupamento de GPUs
A Nvidia descreve o PAIR como um roteador virtual de inferência, e não como uma forma de mesclar hardware. Cada solicitação é atribuída a um nó elegível e permanece nele durante todo o seu ciclo; o software não agrupa memória de GPU, nem combina GPUs em um acelerador lógico maior, nem fragmenta um único modelo entre máquinas, nem divide uma solicitação de inferência em andamento entre nós.
As aplicações conectam‑se por meio de endpoints proxy compatíveis com Ollama e OpenAI, que o PAIR cria ao assumir as portas padrão usadas pelos dois mecanismos. A Nvidia afirmou que isso permite que os harnesses de agentes continuem usando a interface que já conhecem, sem necessidade de integrar uma nova API de cluster. Um nó só se torna elegível para uma solicitação quando um mecanismo suportado está habilitado nele e o modelo exatamente solicitado está presente, e o PAIR prefere nós que já sabe que contêm o modelo. Os modelos não precisam ser idênticos em todo o cluster; carregar a mesma etiqueta de modelo em mais nós fornece ao agendador um pool elegível maior.
Para cada nova solicitação, o agendador avalia se um nó emparelhado está online e pronto, se um mecanismo suportado está habilitado, se o modelo solicitado está presente, a carga de trabalho atual, incluindo jobs ativos, e a utilização existente da GPU, como uma aplicação gráfica intensiva em execução. Os nós podem contribuir com capacidade quando disponíveis e se retirar quando necessário, por exemplo, quando um laptop entra em modo de suspensão, é fechado ou sai da rede.
Descoberta, Segurança e Privacidade
Após a instalação, o PAIR utiliza descoberta em rede local via mDNS para localizar automaticamente sistemas próximos, e um nó também pode ser adicionado por endereço IP. O emparelhamento de duas máquinas usa um PIN de seis dígitos exibido na máquina que convida e inserido na máquina convidada. A Nvidia afirmou que toda comunicação entre nós é bloqueada até que o emparelhamento seguro seja estabelecido, após o que o tráfego é protegido com MTLS e certificados gerados. A empresa posiciona o software para inferência local privada, com prompts, arquivos e contexto de agente permanecendo na rede doméstica do usuário em vez de serem enviados a um serviço de inferência em nuvem. A documentação do repositório alerta os usuários a lerem as notas de segurança antes de implantar o PAIR em uma rede não confiável ou compartilhada, pois inclui endpoints HTTP locais, descoberta LAN e rede de cluster.
Cargas de Trabalho-alvo e uma Demonstração Não Oficial
A Nvidia afirmou que o PAIR é voltado para cargas de trabalho que geram muitas solicitações independentes simultaneamente, como aplicações multi‑agente nas quais um agente principal divide uma tarefa complexa em jobs menores para subagentes. Em uma demonstração usando o agente Hermes Desktop e o Ollama, a empresa relatou que uma tarefa com cinco subagentes utilizando o modelo Qwen 3.6 35B A3B levou, em média, 18 minutos em um único laptop RTX Spark, enquanto um cluster PAIR de três dispositivos combinando um laptop RTX Spark, um DGX Spark e um RTX 5090 completou a mesma carga de trabalho em média em 8 minutos e 48 segundos. A Nvidia caracterizou o resultado como uma demonstração não oficial e específica de configuração, e não como um benchmark geral ou uma promessa de escalonamento linear, observando que os resultados dependem do paralelismo da carga, do modelo, das configurações do mecanismo, do hardware, da rede e da disponibilidade dos nós.
A empresa afirmou que tarefas altamente sequenciais, cargas de trabalho dominadas por uma única chamada de modelo longa ou configurações em que apenas um nó possui o modelo solicitado podem ter menos benefício. A documentação do repositório acrescenta que o software atualmente oferece uma única política de agendamento que combina trabalho em fila com um sinal grosseiro de utilização da GPU, tornando‑o mais adequado para máquinas semelhantes do que para um cluster altamente heterogêneo, e que a Nvidia busca feedback para tornar o agendador mais inteligente, sem compromissos fixos sobre o que será lançado ou quando.












