Model dan platform AI

Nvidia Menghubungkan Komputer Rumah Menjadi Satu Klaster Inferensi AI dengan PAIR

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Nvidia pada 3 September 2026 merilis beta Personal AI Router (PAIR), perangkat lunak sumber terbuka gratis yang menghubungkan komputer kompatibel pada jaringan rumah menjadi satu klaster untuk inferensi AI lokal, mengarahkan permintaan dari beban kerja agen ke mesin mana pun yang tersedia.

Meskipun namanya, PAIR bukan router perangkat keras dan bukan mesin inferensi baru. Menurut posting blog teknis Nvidia yang mengumumkan perangkat lunak tersebut, mesin seperti Ollama dan LM Studio tetap menjalankan setiap model pada mesin yang dipilih, sementara PAIR menemukan sistem yang berpartisipasi, melacak apakah masing‑masing siap menerima permintaan, menjadwalkan pekerjaan independen, dan mengembalikan setiap respons ke aplikasi yang memulainya.

Apa yang Didukung Beta

Beta PAIR berjalan pada Windows 11, DGX OS, Ubuntu 14.04, dan macOS Tahoe, dengan arsitektur x64 dan arm64 didukung di ketiga sistem operasi; dokumentasi proyek menyebutkan Windows pada ARM sebagai eksperimental. Halaman produk Nvidia mencantumkan perangkat keras yang didukung meliputi semua GPU GeForce RTX mulai dari Seri 20 ke atas, sistem DGX Spark dan GB10, serta Mac dengan chip Apple M4 atau yang lebih baru, bersama dengan minimal 8 GB RAM dan ruang disk yang direkomendasikan 20 GB atau lebih. Posting blog teknis juga menambahkan GPU workstation RTX PRO pada arsitektur Turing dan yang lebih baru.

Tidak diperlukan koneksi internet untuk operasi, meskipun diperlukan untuk mengunduh model. Halaman produk menyatakan bahwa menyiapkan klaster tidak memerlukan kabel atau rak khusus: pengguna mengunduh perangkat lunak, menambahkan perangkat mereka, dan menjalankan aplikasi AI melalui PAIR. Nvidia menerbitkan kode sumber PAIR di bawah Apache License 2.0, dan menyatakan bahwa pengembang dapat memeriksa kode, melaporkan masalah, serta berkontribusi pada perbaikan penemuan, pasangan, perutean, integrasi mesin, titik akhir, dan pengalaman pengguna.

Perutean Tanpa Menggabungkan GPU

Nvidia menggambarkan PAIR sebagai router inferensi virtual bukan sebagai cara menggabungkan perangkat keras. Setiap permintaan ditugaskan ke satu node yang memenuhi syarat dan tetap di sana selama masa hidupnya; perangkat lunak tidak menggabungkan memori GPU, menggabungkan GPU menjadi akselerator logis yang lebih besar, membagi satu model di antara mesin, atau membagi satu permintaan inferensi yang sedang berjalan antara node.

Aplikasi terhubung melalui titik akhir proksi yang kompatibel dengan Ollama dan OpenAI, yang dibuat PAIR dengan mengambil alih port default yang digunakan kedua mesin tersebut. Nvidia mengatakan ini berarti harness agen dapat terus menggunakan antarmuka yang sudah mereka pahami, tanpa perlu API klaster baru untuk diintegrasikan. Sebuah node hanya menjadi memenuhi syarat untuk sebuah permintaan ketika mesin yang didukung diaktifkan di node tersebut dan model yang diminta secara tepat tersedia di sana, dan PAIR lebih menyukai node yang sudah diketahui menyimpan model tersebut. Model tidak harus identik di seluruh klaster; memuat tag model yang sama pada lebih banyak node memberikan penjadwal kumpulan node yang lebih besar.

Untuk setiap permintaan baru, penjadwal menilai apakah node yang dipasangkan online dan siap, apakah mesin yang didukung diaktifkan, apakah model yang diminta tersedia, beban kerja saat ini termasuk pekerjaan aktif, serta pemanfaatan GPU yang ada seperti aplikasi grafis intensif yang sedang berjalan. Node dapat menyumbangkan kapasitas ketika tersedia dan mundur ketika diperlukan, misalnya ketika laptop tidur, ditutup, atau meninggalkan jaringan.

Penemuan, Keamanan, dan Privasi

Setelah instalasi, PAIR menggunakan penemuan jaringan lokal melalui mDNS untuk secara otomatis menemukan sistem terdekat, dan sebuah node juga dapat ditambahkan dengan alamat IP. Memasangkan dua mesin menggunakan PIN enam digit yang ditampilkan pada mesin yang mengundang dan dimasukkan pada mesin yang diundang. Nvidia menyatakan semua komunikasi antar‑node diblokir hingga pasangan aman terbentuk, setelah itu lalu lintas diamankan dengan MTLS dan sertifikat yang dihasilkan. Perusahaan menempatkan perangkat lunak ini untuk inferensi lokal pribadi, dengan prompt, berkas, dan konteks agen tetap berada di jaringan rumah pengguna alih‑alih dikirim ke layanan inferensi awan. Dokumentasi repositori memperingatkan pengguna untuk membaca catatan keamanan sebelum menerapkan PAIR pada jaringan yang tidak tepercaya atau berbagi, karena mencakup titik akhir HTTP lokal, penemuan LAN, dan jaringan klaster.

Beban Kerja Target dan Demo Tidak Resmi

Nvidia mengatakan PAIR ditujukan untuk beban kerja yang menghasilkan banyak permintaan independen sekaligus, seperti aplikasi multi‑agen di mana agen utama membagi tugas kompleks menjadi pekerjaan‑pekerjaan kecil untuk sub‑agen. Dalam demonstrasi menggunakan agen Hermes Desktop dan Ollama, perusahaan melaporkan bahwa tugas lima sub‑agen dengan model Qwen 3.6 35B A3B memakan rata‑rata 18 menit pada satu laptop RTX Spark, sementara klaster PAIR tiga perangkat yang menggabungkan laptop RTX Spark, DGX Spark, dan RTX 5090 menyelesaikan beban kerja yang sama dalam rata‑rata 8 menit 48 detik. Nvidia menggambarkan hasil tersebut sebagai demonstrasi tidak resmi yang spesifik pada konfigurasi, bukan benchmark umum atau janji skala linier, dengan catatan bahwa hasil bergantung pada paralelisme beban kerja, model, pengaturan mesin, perangkat keras, jaringan, dan ketersediaan node.

Perusahaan menyatakan bahwa tugas yang sangat berurutan, beban kerja yang didominasi oleh satu panggilan model yang panjang, atau konfigurasi di mana hanya satu node yang menyimpan model yang diminta mungkin memperoleh manfaat yang lebih sedikit. Dokumentasi repositori menambahkan bahwa perangkat lunak saat ini menyediakan satu kebijakan penjadwalan yang menggabungkan pekerjaan dalam antrian dengan sinyal pemanfaatan GPU yang kasar, menjadikannya lebih cocok untuk mesin serupa daripada klaster yang sangat campur aduk, dan bahwa Nvidia menginginkan umpan balik untuk membuat penjadwal lebih cerdas tanpa komitmen tetap mengenai apa yang akan dirilis atau kapan.

Theo Nash adalah seorang spesialis yang dihasilkan oleh AI di Unite.AI, yang meliputi infrastruktur AI, komputasi, dan sistem perangkat keras yang memungkinkan kecerdasan buatan modern. Pekerjaannya berfokus pada fondasi teknis di balik beban kerja AI skala besar, termasuk pusat data, akselerator, jaringan, dan tumpukan perangkat lunak yang menghubungkannya.
Dengan perspektif analitis dan berbasis teknik, Theo memeriksa bagaimana kemajuan dalam GPU, silikon kustom, arsitektur memori, dan sistem terdistribusi memungkinkan generasi baru model AI. Ia memperhatikan khusus pada pertukaran kinerja, efisiensi energi, skalabilitas, dan kendala praktis yang membentuk penerapan infrastruktur AI di dunia nyata.
Artikel yang ditulis oleh Theo Nash dihasilkan oleh AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi teknis, kejelasan, dan liputan yang bertanggung jawab atas lanskap komputasi AI yang berkembang pesat.