Mô hình và nền tảng AI
Nvidia Kết Nối Các Máy Tính Gia Đình Thành Một Cụm AI Inference Với PAIR

Vào ngày 3 tháng 9 năm 2026, Nvidia đã phát hành bản beta của Personal AI Router (PAIR), phần mềm mã nguồn mở miễn phí, cho phép kết nối các máy tính tương thích trên mạng gia đình thành một cụm duy nhất để thực hiện inference AI cục bộ, định tuyến các yêu cầu từ các workload của agent qua bất kỳ máy nào có sẵn.
Mặc dù tên gọi, PAIR không phải là một bộ định tuyến phần cứng và cũng không phải là một engine inference mới. Theo bài đăng blog kỹ thuật của Nvidia công bố phần mềm, các engine như Ollama và LM Studio vẫn chạy mỗi mô hình trên một máy được chọn, trong khi PAIR phát hiện các hệ thống tham gia, theo dõi xem mỗi máy có sẵn sàng cho yêu cầu hay không, lên lịch các công việc độc lập và trả về mọi phản hồi cho ứng dụng khởi tạo.
Những Điều Bản Beta Hỗ Trợ
Bản beta của PAIR chạy trên Windows 11, DGX OS, Ubuntu 14.04 và macOS Tahoe, hỗ trợ kiến trúc x64 và arm64 trên ba hệ điều hành; tài liệu dự án mô tả Windows trên ARM là thử nghiệm. Trang sản phẩm của Nvidia liệt kê phần cứng được hỗ trợ bao gồm tất cả các GPU GeForce RTX từ series 20 trở lên, hệ thống DGX Spark và GB10, và các máy Mac có chip Apple M4 hoặc mới hơn, cùng với yêu cầu tối thiểu 8 GB RAM và 20 GB hoặc hơn không gian đĩa được khuyến nghị. Bài blog kỹ thuật còn liệt kê các GPU workstation RTX PRO trên kiến trúc Turing và các phiên bản mới hơn.
Không cần kết nối internet để vận hành, mặc dù cần có internet để tải mô hình. Trang sản phẩm cho biết việc thiết lập một cụm không đòi hỏi cáp hay giá đỡ đặc biệt: người dùng tải phần mềm, thêm các thiết bị của mình và chạy các ứng dụng AI qua đó. Nvidia công bố mã nguồn PAIR dưới giấy phép Apache License 2.0, và cho biết các nhà phát triển có thể kiểm tra mã, báo cáo lỗi và đóng góp cải tiến cho việc khám phá, ghép nối, định tuyến, tích hợp engine, các endpoint và trải nghiệm người dùng.
Định Tuyến Không Gộp Nhóm GPU
Nvidia mô tả PAIR là một bộ định tuyến inference ảo chứ không phải cách hợp nhất phần cứng. Mỗi yêu cầu được gán cho một nút đủ điều kiện và duy trì trên nút đó trong suốt thời gian tồn tại; phần mềm không gộp bộ nhớ GPU, không kết hợp các GPU thành một bộ tăng tốc logic lớn hơn, không chia một mô hình duy nhất qua các máy, cũng không tách một yêu cầu inference đang thực hiện giữa các nút.
Các ứng dụng kết nối thông qua các endpoint proxy tương thích với Ollama và OpenAI, mà PAIR tạo ra bằng cách chiếm quyền các cổng mặc định mà hai engine sử dụng. Nvidia cho biết điều này có nghĩa là các harness của agent có thể tiếp tục sử dụng giao diện mà chúng đã quen thuộc, mà không cần tích hợp API cụm mới. Một nút chỉ đủ điều kiện cho một yêu cầu khi một engine được hỗ trợ được bật trên nó và mô hình yêu cầu chính xác có sẵn ở đó, và PAIR ưu tiên các nút mà nó đã biết chứa mô hình. Các mô hình không cần phải giống hệt nhau trên toàn cụm; việc tải cùng một thẻ mô hình trên nhiều nút sẽ cung cấp cho bộ lập lịch một pool đủ điều kiện lớn hơn.
Đối với mỗi yêu cầu mới, bộ lập lịch đánh giá xem một nút đã ghép nối có đang trực tuyến và sẵn sàng không, engine hỗ trợ có được bật không, mô hình yêu cầu có tồn tại không, tải công việc hiện tại bao gồm các job đang chạy, và mức sử dụng GPU hiện có như một ứng dụng đồ họa nặng. Các nút có thể cung cấp khả năng khi có sẵn và rút lui khi cần, chẳng hạn khi một laptop vào chế độ ngủ, tắt hoặc rời mạng.
Khám Phá, Bảo Mật và Quyền Riêng Tư
Sau khi cài đặt, PAIR sử dụng khám phá mạng nội bộ qua mDNS để tự động tìm các hệ thống gần đó, và một nút cũng có thể được thêm bằng địa chỉ IP. Việc ghép nối hai máy sử dụng mã PIN sáu chữ số hiển thị trên máy mời và được nhập trên máy được mời. Nvidia cho biết mọi giao tiếp node‑to‑node đều bị chặn cho đến khi ghép nối an toàn được thiết lập, sau đó lưu lượng được bảo mật bằng MTLS và chứng chỉ được tạo ra. Công ty định vị phần mềm này cho inference cục bộ riêng tư, với các prompt, tệp và ngữ cảnh agent vẫn nằm trên mạng gia đình của người dùng thay vì được gửi tới dịch vụ inference đám mây. Tài liệu trong kho mã cảnh báo người dùng nên đọc các ghi chú bảo mật trước khi triển khai PAIR trên mạng không tin cậy hoặc chia sẻ, vì nó bao gồm các endpoint HTTP nội bộ, khám phá LAN và mạng cụm.
Công Việc Mục Tiêu và Một Bản Demo Không Chính Thức
Nvidia cho biết PAIR hướng tới các workload có nhiều yêu cầu độc lập đồng thời, chẳng hạn các ứng dụng đa‑agent trong đó một agent chính chia một nhiệm vụ phức tạp thành các job nhỏ hơn cho các sub‑agent. Trong một buổi demo sử dụng agent Hermes Desktop và Ollama, công ty báo cáo rằng một nhiệm vụ gồm năm sub‑agent sử dụng mô hình Qwen 3.6 35B A3B mất trung bình 18 phút trên một laptop RTX Spark đơn, trong khi một cụm PAIR ba thiết bị kết hợp laptop RTX Spark, một DGX Spark và một RTX 5090 hoàn thành cùng công việc trong trung bình 8 phút 48 giây. Nvidia mô tả kết quả này là một bản demo không chính thức, phụ thuộc vào cấu hình, chứ không phải một benchmark chung hay lời hứa về khả năng mở rộng tuyến tính, lưu ý rằng kết quả phụ thuộc vào mức độ song song của workload, mô hình, cài đặt engine, phần cứng, mạng và tính sẵn sàng của các nút.
Công ty cho biết các nhiệm vụ có tính tuần tự cao, các workload chi phối bởi một lời gọi mô hình dài, hoặc các cấu hình mà chỉ một nút duy nhất chứa mô hình yêu cầu có thể nhận được ít lợi ích hơn. Tài liệu trong kho mã bổ sung rằng phần mềm hiện đang cung cấp một chính sách lập lịch duy nhất, kết hợp công việc trong hàng đợi với tín hiệu sử dụng GPU thô, khiến nó phù hợp hơn với các máy giống nhau hơn là một cụm hỗn hợp đa dạng, và Nvidia mong muốn nhận phản hồi để làm cho bộ lập lịch thông minh hơn mà không cam kết cố định về những gì sẽ được phát hành hoặc thời gian phát hành.












