AI 모델 및 플랫폼
Nvidia, PAIR로 가정용 컴퓨터들을 하나의 AI 추론 클러스터로 연결

Nvidia는 2026년 9월 3일에 Personal AI Router(PAIR) 베타 버전을 공개했으며, 이는 호환되는 컴퓨터들을 가정 네트워크에서 하나의 클러스터로 연결해 로컬 AI 추론을 수행하고, 에이전트 작업 부하의 요청을 사용 가능한 머신들에 라우팅하는 무료 오픈소스 소프트웨어입니다.
이름과 달리 PAIR는 하드웨어 라우터도 아니며 새로운 추론 엔진도 아닙니다. Nvidia가 소프트웨어를 발표한 기술 블로그 게시물에 따르면, Ollama와 LM Studio와 같은 엔진은 여전히 각 모델을 선택된 머신에서 실행하지만, PAIR는 참여 시스템을 탐지하고 각 시스템이 요청을 받을 준비가 되었는지 추적하며, 독립 작업을 스케줄링하고 모든 응답을 해당 응용 프로그램에 반환합니다.
베타가 지원하는 내용
PAIR 베타는 Windows 11, DGX OS, Ubuntu 14.04, macOS Tahoe에서 실행되며, 세 운영 체제 모두 x64와 arm64 아키텍처를 지원합니다. 프로젝트 문서에서는 Windows on ARM을 실험 단계로 설명합니다. Nvidia의 제품 페이지는 지원 하드웨어를 20 시리즈 이후의 모든 GeForce RTX GPU, DGX Spark 및 GB10 시스템, 그리고 Apple M4 칩 이상을 탑재한 Mac으로 정의하고 있으며, 최소 8 GB RAM과 권장 디스크 공간 20 GB 이상을 요구합니다. 기술 블로그 게시물에서는 또한 Turing 아키텍처 및 그 이후의 RTX PRO 워크스테이션 GPU도 포함된다고 명시합니다.
운영에는 인터넷 연결이 필요하지 않지만 모델을 다운로드하려면 인터넷이 필요합니다. 제품 페이지에 따르면 클러스터를 구성하는 데 특별한 케이블이나 랙이 필요하지 않으며, 사용자는 소프트웨어를 다운로드하고 장치를 추가한 뒤 AI 애플리케이션을 실행하면 됩니다. Nvidia는 PAIR 소스 코드를 Apache License 2.0 하에 공개했으며, 개발자는 코드를 검토하고 문제를 보고하며, 탐색, 페어링, 라우팅, 엔진 통합, 엔드포인트 및 사용자 경험 개선에 기여할 수 있다고 밝혔습니다.
GPU 풀링 없이 라우팅
Nvidia는 PAIR를 하드웨어를 결합하는 방식이 아닌 가상 추론 라우터라고 설명합니다. 각 요청은 하나의 적합한 노드에 할당되어 그 수명 동안 해당 노드에 머무르며, 소프트웨어는 GPU 메모리를 풀링하거나 GPU를 더 큰 논리 가속기로 결합하지 않으며, 단일 모델을 여러 머신에 분할하거나 진행 중인 추론 요청을 노드 간에 나누지 않습니다.
애플리케이션은 Ollama 호환 및 OpenAI 호환 프록시 엔드포인트를 통해 연결되며, PAIR는 두 엔진이 사용하는 기본 포트를 인수받아 이를 생성합니다. Nvidia는 이는 에이전트가 이미 익숙한 인터페이스를 계속 사용할 수 있고, 새 클러스터 API를 통합할 필요가 없다는 의미라고 설명했습니다. 노드는 지원되는 엔진이 활성화되고 요청된 정확한 모델이 존재할 때만 요청을 받을 수 있으며, PAIR는 이미 해당 모델을 보유하고 있는 노드를 우선합니다. 모델이 클러스터 전체에서 동일할 필요는 없으며, 동일한 모델 태그를 더 많은 노드에 로드하면 스케줄러가 활용할 수 있는 풀이 커집니다.
새로운 요청이 들어올 때마다 스케줄러는 페어링된 노드가 온라인이고 준비 상태인지, 지원 엔진이 활성화되어 있는지, 요청된 모델이 존재하는지, 현재 작업 부하(활성 작업 포함)와 현재 GPU 사용량(예: 그래픽 집약적인 애플리케이션 실행 여부) 등을 고려합니다. 노드는 사용 가능할 때 용량을 제공하고, 필요에 따라—예를 들어 노트북이 절전 모드에 들어가거나, 닫히거나, 네트워크를 떠날 때—용량을 중단할 수 있습니다.
발견, 보안 및 프라이버시
설치 후 PAIR는 mDNS를 이용한 로컬 네트워크 탐색으로 인근 시스템을 자동으로 찾으며, IP 주소를 통해 노드를 추가할 수도 있습니다. 두 대의 머신을 페어링할 때는 초대하는 머신에 표시되는 6자리 PIN을 초대받은 머신에 입력합니다. Nvidia는 보안 페어링이 확립될 때까지 모든 노드 간 통신이 차단되며, 이후 트래픽은 MTLS와 생성된 인증서로 보호된다고 밝혔습니다. 이 소프트웨어는 프라이빗 로컬 추론을 목표로 하며, 프롬프트, 파일 및 에이전트 컨텍스트가 클라우드 추론 서비스로 전송되지 않고 사용자의 홈 네트워크에 머무르게 합니다. 저장소 문서는 로컬 HTTP 엔드포인트, LAN 탐색 및 클러스터 네트워킹을 포함하고 있기 때문에 신뢰되지 않거나 공유된 네트워크에 PAIR를 배포하기 전에 보안 주의를 반드시 읽어볼 것을 권고합니다.
대상 워크로드 및 비공식 데모
Nvidia는 PAIR가 다수의 독립 요청을 동시에 처리하는 워크로드, 예를 들어 주 에이전트가 복잡한 작업을 하위 에이전트를 위한 작은 작업으로 분할하는 멀티 에이전트 애플리케이션을 대상으로 한다고 설명했습니다. Hermes Desktop 에이전트와 Ollama를 사용한 시연에서, Qwen 3.6 35B A3B 모델을 이용한 5개의 하위 에이전트 작업이 단일 RTX Spark 노트북에서 평균 18분이 걸렸으며, RTX Spark 노트북, DGX Spark, RTX 5090 세 대를 결합한 3대 PAIR 클러스터에서는 동일 작업을 평균 8분 48초에 완료했다고 보고했습니다. Nvidia는 이 결과를 일반적인 벤치마크나 선형 확장의 약속이라기보다 비공식적이며 구성에 따라 달라지는 시연으로 설명했으며, 결과는 워크로드 병렬성, 모델, 엔진 설정, 하드웨어, 네트워크 및 노드 가용성에 따라 달라진다고 언급했습니다.
회사 측은 매우 순차적인 작업, 하나의 긴 모델 호출이 지배적인 워크로드, 혹은 요청된 모델을 단일 노드만 보유하는 구성에서는 이점이 적을 수 있다고 밝혔습니다. 저장소 문서는 현재 소프트웨어가 대기 작업과 거친 GPU 사용량 신호를 결합한 단일 스케줄링 정책만을 제공하고 있어, 유사한 머신들에 더 적합하고 혼합된 클러스터보다는 적합하다고 덧붙였으며, Nvidia는 어떤 기능이 언제 제공될지에 대한 고정된 약속 없이 스케줄러를 더 스마트하게 만들기 위한 피드백을 원한다고 전했습니다.












