Modely a platformy AI
Nvidia spojuje domácí počítače do jednoho AI inferenčního clusteru pomocí PAIR

Nvidia 3. září 2026 vydala beta verzi Personal AI Router (PAIR), bezplatný open-source software, který propojuje kompatibilní počítače v domácí síti do jednoho clusteru pro lokální AI inferenci a směruje požadavky z agentních úloh na dostupné stroje.
Navzdory názvu PAIR není hardwarovým routerem ani novým inferenčním enginem. Podle technického blogu Nvidia, který software oznamuje, enginy jako Ollama a LM Studio stále spouštějí každý model na vybraném stroji, zatímco PAIR objevuje zapojené systémy, sleduje, zda je každý z nich připraven na požadavek, plánuje nezávislé úlohy a vrací každou odpověď aplikaci, která ji iniciovala.
Co beta podporuje
Beta verze PAIR běží na Windows 11, DGX OS, Ubuntu 14.04 a macOS Tahoe, přičemž napříč třemi operačními systémy jsou podporovány architektury x64 i arm64; dokumentace projektu popisuje Windows na ARM jako experimentální. Produktová stránka Nvidia uvádí podporovaný hardware jako všechny grafické karty GeForce RTX od řady 20 výše, systémy DGX Spark a GB10 a počítače Mac s čipy Apple M4 nebo novějšími, spolu s minimálně 8 GB RAM a doporučeným úložištěm 20 GB nebo více. Technický blog dále uvádí pracovní grafické karty RTX PRO na architektuře Turing a novější.
Pro provoz není vyžadováno připojení k internetu, i když je potřeba ke stažení modelů. Produktová stránka uvádí, že nastavení clusteru nevyžaduje žádné speciální kabely ani racky: uživatelé si stáhnou software, přidají svá zařízení a spustí své AI aplikace přes něj. Nvidia zveřejňuje zdrojový kód PAIR pod licencí Apache License 2.0 a uvádí, že vývojáři mohou kód prohlížet, hlásit problémy a přispívat ke zlepšením v oblasti objevování, párování, směrování, integrace enginů, koncových bodů a uživatelského zážitku.
Směrování bez sdružování GPU
Nvidia popisuje PAIR jako virtuální inferenční router, nikoli jako způsob sloučení hardwaru. Každý požadavek je přiřazen jednomu způsobilému uzlu a zůstává u něj po celou dobu svého životního cyklu; software nesdružuje paměť GPU, nespojuje GPU do většího logického akcelerátoru, nerozděluje jeden model mezi stroje ani nerozděluje probíhající inferenční požadavek mezi uzly.
Aplikace se připojují přes proxy koncové body kompatibilní s Ollama i OpenAI, které PAIR vytvoří převzetím výchozích portů, jež oba enginy používají. Nvidia uvedla, že to znamená, že agentní rozhraní mohou nadále používat známé rozhraní bez nutnosti nového API pro cluster. Uzel se stane způsobilým pro požadavek pouze tehdy, když je na něm povolen podporovaný engine a je v něm přítomen přesně požadovaný model, a PAIR dává přednost uzlům, o nichž již ví, že model obsahují. Modely nemusí být v celém clusteru identické; načtení stejného štítku modelu na více uzlech poskytne plánovači větší pool způsobilých uzlů.
Pro každý nový požadavek plánovač zvažuje, zda je spárovaný uzel online a připraven, zda je povolen podporovaný engine, zda je požadovaný model přítomen, jaká je aktuální zátěž včetně aktivních úloh a jaké je stávající využití GPU, například při běhu graficky náročné aplikace. Uzly mohou přispívat kapacitou, když jsou k dispozici, a odstoupit, když je to potřeba, například když notebook usne, se vypne nebo opustí síť.
Objevování, zabezpečení a soukromí
Po instalaci PAIR používá objevování v lokální síti prostřednictvím mDNS k automatickému nalezení blízkých systémů a uzel lze také přidat pomocí IP adresy. Párování dvou počítačů probíhá pomocí šestimístného PIN kódu zobrazeného na pozývajícím stroji a zadávaného na pozvaném. Nvidia uvedla, že veškerá komunikace mezi uzly je blokována, dokud není navázáno bezpečné párování, po němž je provoz zabezpečen pomocí MTLS a generovaných certifikátů. Společnost prezentuje software pro soukromou lokální inferenci, přičemž výzvy, soubory a kontext agenta zůstávají v domácí síti uživatele místo odesílání do cloudové inferenční služby. Dokumentace repozitáře varuje uživatele, aby si před nasazením PAIR v nedůvěryhodné nebo sdílené síti přečetli bezpečnostní poznámky, protože zahrnuje lokální HTTP koncové body, LAN objevování a síťování clusteru.
Cílové úlohy a neoficiální demo
Nvidia uvedla, že PAIR je zaměřen na úlohy, které najednou generují mnoho nezávislých požadavků, například multi-agentní aplikace, kde hlavní agent rozděluje složitý úkol na menší úlohy pro podagenty. V demonstraci s agentem Hermes Desktop a Ollama společnost oznámila, že úkol se pěti podagenty používající model Qwen 3.6 35B A3B trval v průměru 18 minut na jednom notebooku RTX Spark, zatímco třízařízeníový PAIR cluster kombinující notebook RTX Spark, DGX Spark a RTX 5090 dokončil stejnou zátěž v průměru 8 minut a 48 sekund. Nvidia charakterizovala výsledek jako neoficiální, specifický pro konfiguraci, spíše než obecný benchmark nebo slib lineárního škálování, a upozornila, že výsledky závisí na paralelismu úlohy, modelu, nastavení enginu, hardwaru, síti a dostupnosti uzlů.
Společnost uvedla, že vysoce sekvenční úlohy, zátěže ovládané jedním dlouhým voláním modelu nebo konfigurace, kde požadovaný model drží jen jeden uzel, mohou mít menší přínos. Dokumentace repozitáře doplňuje, že software v současnosti nabízí jedinou politiku plánování, která kombinuje frontu úloh s hrubým signálem využití GPU, což jej činí vhodnějším pro podobné stroje než pro vysoce smíšený cluster, a že Nvidia žádá o zpětnou vazbu k inteligentnějšímu plánovači bez pevně daných závazků, co a kdy bude dodáno.












