Modele și platforme AI

Nvidia conectează computerele de acasă într-un singur cluster de inferență AI cu PAIR

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Nvidia, pe 3 septembrie 2026, a lansat versiunea beta a Personal AI Router (PAIR), un software gratuit open-source care leagă computerele compatibile dintr-o rețea domestică într-un singur cluster pentru inferență AI locală, dirijând cererile din sarcinile agenților prin orice mașină disponibilă.

În ciuda numelui său, PAIR nu este un router hardware și nu este un motor de inferență nou. Conform postării tehnice de pe blogul Nvidia care anunță software‑ul, motoarele precum Ollama și LM Studio rulează în continuare fiecare model pe o mașină selectată, în timp ce PAIR descoperă sistemele participante, monitorizează dacă fiecare este pregătit pentru o cerere, programează sarcini independente și returnează fiecare răspuns aplicației care l‑a generat.

Ce suportă versiunea beta

Versiunea beta PAIR rulează pe Windows 11, DGX OS, Ubuntu 14.04 și macOS Tahoe, cu arhitecturi x64 și arm64 suportate pe cele trei sisteme de operare; documentația proiectului descrie Windows pe ARM ca fiind experimental. Pagina de produs a Nvidia enumeră hardware‑ul suportat ca fiind toate GPU‑urile GeForce RTX din seria 20 în sus, sistemele DGX Spark și GB10, și Mac‑urile cu cipuri Apple M4 sau mai noi, alături de un minim de 8 GB RAM și 20 GB sau mai mult spațiu de disc recomandat. Postarea tehnică de pe blog adaugă în listă GPU‑urile RTX PRO pentru stații de lucru pe arhitectura Turing și cele mai noi.

Nu este necesară o conexiune la internet pentru funcționare, deși una este necesară pentru descărcarea modelelor. Pagina de produs precizează că configurarea unui cluster nu necesită cabluri sau rackuri speciale: utilizatorii descarcă software‑ul, își adaugă dispozitivele și își rulează aplicațiile AI prin el. Nvidia publică codul sursă PAIR sub licența Apache 2.0, iar dezvoltatorii pot inspecta codul, raporta probleme și contribui la îmbunătățiri ale descoperirii, împerecherii, rutării, integrării motorului, punctelor finale și experienței utilizatorului.

Rutare fără gruparea GPU‑urilor

Nvidia descrie PAIR ca pe un router virtual de inferență, nu ca pe o metodă de a combina hardware‑ul. Fiecare cerere este atribuită unui nod eligibil și rămâne acolo pe toată durata sa; software‑ul nu grupează memoria GPU, nu combină GPU‑urile într-un accelerator logic mai mare, nu împarte un model unic pe mai multe mașini și nu împarte o cerere de inferență în curs între noduri.

Aplicațiile se conectează prin puncte finale proxy compatibile cu Ollama și OpenAI, pe care PAIR le creează preluând porturile implicite utilizate de cele două motoare. Nvidia a precizat că acest lucru permite instrumentelor agenților să continue să folosească interfața pe care o cunosc deja, fără a necesita un API nou de cluster pentru integrare. Un nod devine eligibil pentru o cerere doar când un motor suportat este activat pe el și modelul solicitat este prezent, iar PAIR preferă nodurile pe care deja știe că dețin modelul. Modelele nu trebuie să fie identice în întregul cluster; încărcarea aceluiași tag de model pe mai multe noduri oferă programatorului un grup de eligibilitate mai mare.

Pentru fiecare cerere nouă, programatorul evaluează dacă un nod împerecheat este online și pregătit, dacă un motor suportat este activat, dacă modelul solicitat este prezent, sarcina curentă inclusiv job‑urile active și utilizarea existentă a GPU‑ului, cum ar fi o aplicație grafică intensă în execuție. Nodurile pot oferi capacitate când sunt disponibile și se retrag când este necesar, de exemplu când un laptop intră în modul repaus, se închide sau părăsește rețeaua.

Descoperire, securitate și confidențialitate

După instalare, PAIR folosește descoperirea în rețeaua locală prin mDNS pentru a găsi automat sistemele din apropiere, iar un nod poate fi adăugat și prin adresă IP. Împerecherea a două mașini se realizează cu un cod PIN format din șase cifre afișat pe mașina care invită și introdus pe cea invitată. Nvidia a declarat că toate comunicațiile nod‑to‑nod sunt blocate până la stabilirea împerecherii securizate, după care traficul este protejat cu MTLS și certificate generate. Compania poziționează software‑ul pentru inferență locală privată, cu solicitări, fișiere și contextul agentului rămânând pe rețeaua de acasă a utilizatorului în loc să fie trimise către un serviciu de inferență în cloud. Documentația depozitului avertizează utilizatorii să citească notele de securitate înainte de a implementa PAIR pe o rețea nesigură sau partajată, deoarece include puncte finale HTTP locale, descoperire LAN și rețea de cluster.

Sarcini țintă și o demonstrație neoficială

Nvidia a declarat că PAIR este destinat sarcinilor care generează simultan numeroase cereri independente, cum ar fi aplicațiile multi‑agent în care un agent principal împarte o sarcină complexă în job‑uri mai mici pentru subagenți. Într-o demonstrație utilizând agentul Hermes Desktop și Ollama, compania a raportat că o sarcină cu cinci subagenți ce folosește modelul Qwen 3.6 35B A3B a durat în medie 18 minute pe un singur laptop RTX Spark, în timp ce un cluster PAIR cu trei dispozitive, format dintr-un laptop RTX Spark, un DGX Spark și un RTX 5090, a finalizat aceeași sarcină în medie 8 minute și 48 de secunde. Nvidia a caracterizat rezultatul ca o demonstrație neoficială, specifică configurației, și nu ca un benchmark general sau o promisiune de scalare liniară, subliniind că rezultatele depind de paralelismul sarcinii, model, setările motorului, hardware‑ul, rețeaua și disponibilitatea nodurilor.

Compania a precizat că sarcinile foarte secvențiale, sarcinile dominate de un singur apel lung al modelului sau configurațiile în care doar un nod deține modelul solicitat pot avea beneficii mai reduse. Documentația depozitului adaugă că software‑ul furnizează în prezent o singură politică de programare care combină lucrările în coadă cu un semnal grosier de utilizare a GPU‑ului, fiind astfel mai potrivit pentru mașini similare decât pentru un cluster foarte mixt, și că Nvidia dorește feedback pentru a face programatorul mai inteligent, fără angajamente fixe privind ce va fi livrat și când.

Theo Nash este un specialist generat de inteligență artificială la Unite.AI, care acoperă infrastructura de inteligență artificială, calcul și sistemele hardware care alimentează inteligența artificială modernă. Lucrarea sa se concentrează pe fundamentele tehnice ale sarcinilor de lucru cu inteligență artificială la scară largă, incluzând centre de date, acceleratoare, rețele și stivele de software care le leagă împreună.
Cu o perspectivă analitică și inginerice, Theo examinează modul în care progresele în domeniul unităților de procesare grafică, siliciului personalizat, arhitecturilor de memorie și sistemelor distribuite permit noi generații de modele de inteligență artificială. El acordă o atenție deosebită schimburilor de performanță, eficienței energetice, scalabilității și constrângerilor practice care influențează implementarea în lumea reală a infrastructurii de inteligență artificială.
Articolele scrise de Theo Nash sunt generate de inteligență artificială și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea tehnică, claritatea și o acoperire responsabilă a peisajului de calcul cu inteligență artificială în evoluție rapidă.