Mô hình và nền tảng AI

Nvidia Kết Nối Các Máy Tính Gia Đình Thành Một Cụm AI Inference Với PAIR

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Vào ngày 3 tháng 9 năm 2026, Nvidia đã phát hành bản beta của Personal AI Router (PAIR), phần mềm mã nguồn mở miễn phí, cho phép kết nối các máy tính tương thích trên mạng gia đình thành một cụm duy nhất để thực hiện inference AI cục bộ, định tuyến các yêu cầu từ các workload của agent qua bất kỳ máy nào có sẵn.

Mặc dù tên gọi, PAIR không phải là một bộ định tuyến phần cứng và cũng không phải là một engine inference mới. Theo bài đăng blog kỹ thuật của Nvidia công bố phần mềm, các engine như Ollama và LM Studio vẫn chạy mỗi mô hình trên một máy được chọn, trong khi PAIR phát hiện các hệ thống tham gia, theo dõi xem mỗi máy có sẵn sàng cho yêu cầu hay không, lên lịch các công việc độc lập và trả về mọi phản hồi cho ứng dụng khởi tạo.

Những Điều Bản Beta Hỗ Trợ

Bản beta của PAIR chạy trên Windows 11, DGX OS, Ubuntu 14.04 và macOS Tahoe, hỗ trợ kiến trúc x64 và arm64 trên ba hệ điều hành; tài liệu dự án mô tả Windows trên ARM là thử nghiệm. Trang sản phẩm của Nvidia liệt kê phần cứng được hỗ trợ bao gồm tất cả các GPU GeForce RTX từ series 20 trở lên, hệ thống DGX Spark và GB10, và các máy Mac có chip Apple M4 hoặc mới hơn, cùng với yêu cầu tối thiểu 8 GB RAM và 20 GB hoặc hơn không gian đĩa được khuyến nghị. Bài blog kỹ thuật còn liệt kê các GPU workstation RTX PRO trên kiến trúc Turing và các phiên bản mới hơn.

Không cần kết nối internet để vận hành, mặc dù cần có internet để tải mô hình. Trang sản phẩm cho biết việc thiết lập một cụm không đòi hỏi cáp hay giá đỡ đặc biệt: người dùng tải phần mềm, thêm các thiết bị của mình và chạy các ứng dụng AI qua đó. Nvidia công bố mã nguồn PAIR dưới giấy phép Apache License 2.0, và cho biết các nhà phát triển có thể kiểm tra mã, báo cáo lỗi và đóng góp cải tiến cho việc khám phá, ghép nối, định tuyến, tích hợp engine, các endpoint và trải nghiệm người dùng.

Định Tuyến Không Gộp Nhóm GPU

Nvidia mô tả PAIR là một bộ định tuyến inference ảo chứ không phải cách hợp nhất phần cứng. Mỗi yêu cầu được gán cho một nút đủ điều kiện và duy trì trên nút đó trong suốt thời gian tồn tại; phần mềm không gộp bộ nhớ GPU, không kết hợp các GPU thành một bộ tăng tốc logic lớn hơn, không chia một mô hình duy nhất qua các máy, cũng không tách một yêu cầu inference đang thực hiện giữa các nút.

Các ứng dụng kết nối thông qua các endpoint proxy tương thích với Ollama và OpenAI, mà PAIR tạo ra bằng cách chiếm quyền các cổng mặc định mà hai engine sử dụng. Nvidia cho biết điều này có nghĩa là các harness của agent có thể tiếp tục sử dụng giao diện mà chúng đã quen thuộc, mà không cần tích hợp API cụm mới. Một nút chỉ đủ điều kiện cho một yêu cầu khi một engine được hỗ trợ được bật trên nó và mô hình yêu cầu chính xác có sẵn ở đó, và PAIR ưu tiên các nút mà nó đã biết chứa mô hình. Các mô hình không cần phải giống hệt nhau trên toàn cụm; việc tải cùng một thẻ mô hình trên nhiều nút sẽ cung cấp cho bộ lập lịch một pool đủ điều kiện lớn hơn.

Đối với mỗi yêu cầu mới, bộ lập lịch đánh giá xem một nút đã ghép nối có đang trực tuyến và sẵn sàng không, engine hỗ trợ có được bật không, mô hình yêu cầu có tồn tại không, tải công việc hiện tại bao gồm các job đang chạy, và mức sử dụng GPU hiện có như một ứng dụng đồ họa nặng. Các nút có thể cung cấp khả năng khi có sẵn và rút lui khi cần, chẳng hạn khi một laptop vào chế độ ngủ, tắt hoặc rời mạng.

Khám Phá, Bảo Mật và Quyền Riêng Tư

Sau khi cài đặt, PAIR sử dụng khám phá mạng nội bộ qua mDNS để tự động tìm các hệ thống gần đó, và một nút cũng có thể được thêm bằng địa chỉ IP. Việc ghép nối hai máy sử dụng mã PIN sáu chữ số hiển thị trên máy mời và được nhập trên máy được mời. Nvidia cho biết mọi giao tiếp node‑to‑node đều bị chặn cho đến khi ghép nối an toàn được thiết lập, sau đó lưu lượng được bảo mật bằng MTLS và chứng chỉ được tạo ra. Công ty định vị phần mềm này cho inference cục bộ riêng tư, với các prompt, tệp và ngữ cảnh agent vẫn nằm trên mạng gia đình của người dùng thay vì được gửi tới dịch vụ inference đám mây. Tài liệu trong kho mã cảnh báo người dùng nên đọc các ghi chú bảo mật trước khi triển khai PAIR trên mạng không tin cậy hoặc chia sẻ, vì nó bao gồm các endpoint HTTP nội bộ, khám phá LAN và mạng cụm.

Công Việc Mục Tiêu và Một Bản Demo Không Chính Thức

Nvidia cho biết PAIR hướng tới các workload có nhiều yêu cầu độc lập đồng thời, chẳng hạn các ứng dụng đa‑agent trong đó một agent chính chia một nhiệm vụ phức tạp thành các job nhỏ hơn cho các sub‑agent. Trong một buổi demo sử dụng agent Hermes Desktop và Ollama, công ty báo cáo rằng một nhiệm vụ gồm năm sub‑agent sử dụng mô hình Qwen 3.6 35B A3B mất trung bình 18 phút trên một laptop RTX Spark đơn, trong khi một cụm PAIR ba thiết bị kết hợp laptop RTX Spark, một DGX Spark và một RTX 5090 hoàn thành cùng công việc trong trung bình 8 phút 48 giây. Nvidia mô tả kết quả này là một bản demo không chính thức, phụ thuộc vào cấu hình, chứ không phải một benchmark chung hay lời hứa về khả năng mở rộng tuyến tính, lưu ý rằng kết quả phụ thuộc vào mức độ song song của workload, mô hình, cài đặt engine, phần cứng, mạng và tính sẵn sàng của các nút.

Công ty cho biết các nhiệm vụ có tính tuần tự cao, các workload chi phối bởi một lời gọi mô hình dài, hoặc các cấu hình mà chỉ một nút duy nhất chứa mô hình yêu cầu có thể nhận được ít lợi ích hơn. Tài liệu trong kho mã bổ sung rằng phần mềm hiện đang cung cấp một chính sách lập lịch duy nhất, kết hợp công việc trong hàng đợi với tín hiệu sử dụng GPU thô, khiến nó phù hợp hơn với các máy giống nhau hơn là một cụm hỗn hợp đa dạng, và Nvidia mong muốn nhận phản hồi để làm cho bộ lập lịch thông minh hơn mà không cam kết cố định về những gì sẽ được phát hành hoặc thời gian phát hành.

Theo Nash là một chuyên gia được tạo bởi trí tuệ nhân tạo tại Unite.AI, chuyên về cơ sở hạ tầng trí tuệ nhân tạo, tính toán và các hệ thống phần cứng hỗ trợ trí tuệ nhân tạo hiện đại. Công việc của ông tập trung vào các nền tảng kỹ thuật đằng sau các công việc trí tuệ nhân tạo quy mô lớn, bao gồm trung tâm dữ liệu, tăng tốc, mạng và các phần mềm liên kết chúng lại với nhau.
Với quan điểm phân tích và kỹ thuật, Theo nghiên cứu cách các tiến bộ trong GPU, silicon tùy chỉnh, kiến trúc bộ nhớ và hệ thống phân tán cho phép tạo ra các mô hình trí tuệ nhân tạo mới. Ông đặc biệt chú ý đến việc trao đổi hiệu suất, hiệu quả năng lượng, khả năng mở rộng và các hạn chế thực tế định hình việc triển khai cơ sở hạ tầng trí tuệ nhân tạo trong thế giới thực.
Các bài viết được viết bởi Theo Nash được tạo bởi trí tuệ nhân tạo và được nhóm biên tập của Unite.AI xem xét để đảm bảo độ chính xác kỹ thuật, sự rõ ràng và phạm vi bao quát có trách nhiệm về tính toán trí tuệ nhân tạo đang phát triển nhanh chóng.