AI-modellen en platforms
Nvidia Verbindt Thuiscomputers tot één AI-inferentiecluster met PAIR

Nvidia heeft op 3 september 2026 de bètaversie van de Personal AI Router (PAIR) uitgebracht, gratis open‑source‑software die compatibele computers op een thuisnetwerk met elkaar verbindt tot één cluster voor lokale AI‑inferentie, en verzoeken van agent‑werkbelastingen over de beschikbare machines routeert.
Ondanks de naam is PAIR geen hardware‑router en geen nieuwe inferentiemotor. Volgens Nvidia’s technische blogpost die de software aankondigt, draaien motoren zoals Ollama en LM Studio nog steeds elk model op een geselecteerde machine, terwijl PAIR deelnemende systemen ontdekt, bijhoudt of elk systeem klaar is voor een verzoek, onafhankelijke taken plant en elke respons teruggeeft aan de applicatie die het heeft gestart.
Wat de bètaversie ondersteunt
De PAIR‑bèta draait op Windows 11, DGX OS, Ubuntu 14.04 en macOS Tahoe, met x64‑ en arm64‑architecturen die door de drie besturingssystemen worden ondersteund; de projectdocumentatie beschrijft Windows op ARM als experimenteel. Volgens de productpagina van Nvidia wordt de ondersteunde hardware vermeld als alle GeForce RTX‑GPU’s vanaf de 20‑serie, DGX Spark‑ en GB10‑systemen, en Macs met Apple M4‑chips of nieuwer, naast minimaal 8 GB RAM en ten minste 20 GB aanbevolen schijfruimte. De technische blogpost voegt daarnaast RTX PRO‑workstation‑GPU’s op de Turing‑architectuur en nieuwer toe.
Voor de werking is geen internetverbinding vereist, hoewel er wel één nodig is om modellen te downloaden. De productpagina stelt dat het opzetten van een cluster geen speciale kabels of rekken: gebruikers downloaden de software, voegen hun apparaten toe en laten hun AI‑applicaties erdoor draaien. Nvidia publiceert de PAIR‑broncode onder de Apache‑License 2.0, en zegt dat ontwikkelaars de code kunnen inspecteren, problemen kunnen melden en verbeteringen kunnen bijdragen aan ontdekking, koppeling, routering, engine‑integratie, eindpunten en de gebruikerservaring.
Routeren zonder GPU‑pooling
Nvidia beschrijft PAIR als een virtuele inferentierouter in plaats van een manier om hardware te combineren. Elk verzoek wordt toegewezen aan één geschikte node en blijft daar gedurende de levensduur; de software poolt GPU‑geheugen niet, combineert GPU’s niet tot een grotere logische accelerator, verdeelt een enkel model niet over meerdere machines, en splitst geen lopend inferentieverzoek tussen nodes.
Applicaties maken verbinding via Ollama‑compatibele en OpenAI‑compatibele proxy‑eindpunten, die PAIR creëert door de standaardpoorten die de twee motoren gebruiken over te nemen. Nvidia zei dat dit betekent dat agent‑harnassen de interface die ze al kennen kunnen blijven gebruiken, zonder een nieuwe cluster‑API te integreren. Een node wordt pas in aanmerking genomen voor een verzoek wanneer een ondersteunde engine op die node is ingeschakeld en het exact gevraagde model aanwezig is, en PAIR geeft de voorkeur aan nodes waarvan al bekend is dat ze het model bevatten. Modellen hoeven niet identiek te zijn binnen het cluster; het laden van dezelfde model‑tag op meer nodes geeft de planner een grotere pool van geschikte nodes.
Voor elk nieuw verzoek weegt de planner af of een gekoppelde node online en klaar is, of een ondersteunde engine is ingeschakeld, of het gevraagde model aanwezig is, wat de huidige werkbelasting is inclusief actieve taken, en de huidige GPU‑benutting, bijvoorbeeld door een grafisch intensieve applicatie. Nodes kunnen capaciteit leveren wanneer ze beschikbaar zijn en zich terugtrekken wanneer dat nodig is, zoals wanneer een laptop in slaapstand gaat, wordt afgesloten of het netwerk verlaat.
Ontdekking, beveiliging en privacy
Na installatie gebruikt PAIR lokale netwerk‑ontdekking via mDNS om automatisch nabijgelegen systemen te vinden, en een node kan ook worden toegevoegd via een IP‑adres. Het koppelen van twee machines gebeurt met een zes‑cijferige PIN die op de uitnodigende machine wordt weergegeven en op de uitgenodigde wordt ingevoerd. Nvidia meldt dat alle node‑naar‑node‑communicatie wordt geblokkeerd totdat de veilige koppeling tot stand is gebracht; daarna wordt het verkeer beveiligd met MTLS en gegenereerde certificaten. Het bedrijf positioneert de software voor private lokale inferentie, waarbij prompts, bestanden en agent‑context op het thuisnetwerk van de gebruiker blijven in plaats van naar een cloud‑inferentiedienst te worden gestuurd. De documentatie van de repository waarschuwt gebruikers om de beveiligingsnotities te lezen voordat ze PAIR inzetten op een onbetrouwbaar of gedeeld netwerk, omdat het lokale HTTP‑eindpunten, LAN‑ontdekking en cluster‑netwerken bevat.
Doelwerkbelastingen en een onofficiële demo
Nvidia geeft aan dat PAIR zich richt op werkbelastingen die veel onafhankelijke verzoeken tegelijk blootleggen, zoals multi‑agent‑applicaties waarbij een hoofd‑agent een complexe taak opsplitst in kleinere taken voor sub‑agenten. In een demonstratie met de Hermes Desktop‑agent en Ollama meldde het bedrijf dat een taak met vijf sub‑agenten die het Qwen 3.6 35B A3B‑model gebruikte, gemiddeld 18 minuten duurde op één RTX Spark‑laptop, terwijl een PAIR‑cluster met drie apparaten – een RTX Spark‑laptop, een DGX Spark en een RTX 5090 – dezelfde werkbelasting in gemiddeld 8 minuten en 48 seconden voltooide. Nvidia karakteriseert het resultaat als een onofficiële, configuratiespecifieke demonstratie in plaats van een algemene benchmark of een belofte van lineaire schaalbaarheid, en merkt op dat de uitkomsten afhangen van de paralleliteit van de werkbelasting, het model, de engine‑instellingen, hardware, netwerk en beschikbaarheid van nodes.
Het bedrijf stelt dat sterk sequentiële taken, werkbelastingen die gedomineerd worden door één lange modelaanroep, of configuraties waarbij slechts één node het gevraagde model bezit, mogelijk minder voordeel opleveren. De documentatie van de repository voegt toe dat de software momenteel één planningsbeleid levert dat wachttaken combineert met een ruwe GPU‑benuttingssignaal, waardoor het beter geschikt is voor gelijkaardige machines dan voor een sterk gemengd cluster, en dat Nvidia feedback wil ontvangen om de planner slimmer te maken zonder vaste toezeggingen over wat of wanneer er wordt uitgebracht.












