Yapay zeka modelleri ve platformları

Nvidia, Ev Bilgisayarlarını PAIR ile Tek Bir AI Çıkarım Kümesine Bağlıyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Nvidia, 3 Eylül 2026’da Personal AI Router (PAIR) beta sürümünü yayınladı; uyumlu bilgisayarları ev ağında tek bir kümeye bağlayan ücretsiz açık kaynaklı bir yazılım olup, yerel AI çıkarımı için kullanılmakta ve ajan iş yüklerinden gelen istekleri mevcut makineler arasında yönlendiriyor.

Adının aksine, PAIR bir donanım yönlendiricisi ya da yeni bir çıkarım motoru değildir. Nvidia’nın teknik blog gönderisine göre, Ollama ve LM Studio gibi motorlar hâlâ her modeli seçilen bir makinede çalıştırırken, PAIR katılan sistemleri keşfeder, her birinin istek almaya hazır olup olmadığını izler, bağımsız işleri zamanlar ve her yanıtı yanıtı başlatan uygulamaya geri gönderir.

Beta Neyi Destekliyor

PAIR beta, Windows 11, DGX OS, Ubuntu 14.04 ve macOS Tahoe üzerinde çalışır; üç işletim sistemi için x64 ve arm64 mimarileri desteklenir; projenin belgeleri Windows on ARM’ı deneysel olarak tanımlar. Nvidia’nın ürün sayfası, desteklenen donanımı 20 Serisi’nden itibaren tüm GeForce RTX GPU’ları, DGX Spark ve GB10 sistemleri ve Apple M4 çipleri veya daha yenileriyle çalışan Mac’ler olarak listeler; ayrıca minimum 8 GB RAM ve önerilen 20 GB veya daha fazla disk alanı gerektirir. Teknik blog gönderisi ayrıca Turing mimarisi ve sonrası RTX PRO iş istasyonu GPU’larını da listeler.

Çalışma için internet bağlantısı gerekli değildir, ancak modelleri indirmek için bir bağlantı gerekir. Ürün sayfası, bir küme kurmanın özel kablo veya raf gerektirmediğini: kullanıcıların yazılımı indirip cihazlarını ekleyerek AI uygulamalarını bunun üzerinden çalıştırabileceklerini belirtir. Nvidia, PAIR kaynak kodunu Apache License 2.0 altında yayınlamaktadır; geliştiricilerin kodu inceleyebileceği, sorun bildirebileceği ve keşif, eşleştirme, yönlendirme, motor entegrasyonu, uç noktalar ve kullanıcı deneyimi konularında iyileştirmeler katkıda bulunabileceği belirtilmiştir.

GPU’ları Havuzlamadan Yönlendirme

Nvidia, PAIR’ı donanımı birleştirmekten ziyade sanal bir çıkarım yönlendiricisi olarak tanımlıyor. Her istek, uygun bir düğüme atanır ve ömrü boyunca o düğümde kalır; yazılım GPU belleğini havuzlamaz, GPU’ları daha büyük mantıksal bir hızlandırıcıda birleştirmez, tek bir modeli makineler arasında bölmez ya da çalışan bir çıkarım isteğini düğümler arasında bölmez.

Uygulamalar, Ollama uyumlu ve OpenAI uyumlu proxy uç noktaları üzerinden bağlanır; PAIR bu uç noktaları iki motorun kullandığı varsayılan portları devralarak oluşturur. Nvidia, bunun ajan uygulamalarının zaten bildikleri arayüzü kullanmaya devam edebilecekleri ve yeni bir küme API’sine ihtiyaç duyulmadığı anlamına geldiğini belirtti. Bir düğüm, yalnızca üzerinde desteklenen bir motor etkinleştirildiğinde ve tam olarak istenen model mevcut olduğunda isteğe uygun hâle gelir; PAIR, modeli zaten tuttuğunu bildiği düğümleri tercih eder. Modeller küme içinde aynı olmak zorunda değildir; aynı model etiketi daha fazla düğüme yüklendiğinde zamanlayıcı daha büyük bir uygun havuza sahip olur.

Her yeni istek için zamanlayıcı, eşleşmiş bir düğümün çevrim içi ve hazır olup olmadığını, desteklenen bir motorun etkinleştirilip etkinleştirilmediğini, istenen modelin mevcut olup olmadığını, aktif işler dahil mevcut iş yükünü ve çalışan bir grafik yoğun uygulama gibi mevcut GPU kullanımını değerlendirir. Düğümler, kullanılabilir olduklarında kapasite sağlayabilir ve gerektiğinde, örneğin bir dizüstü bilgisayar uykuya geçtiğinde, kapandığında ya da ağdan ayrıldığında geri çekilebilir.

Keşif, Güvenlik ve Gizlilik

Kurulumdan sonra PAIR, mDNS aracılığıyla yerel ağ keşfi yaparak yakın sistemleri otomatik olarak bulur ve bir düğüm IP adresiyle de eklenebilir. İki makineyi eşleştirmek, davet eden makinede gösterilen ve davet edilen makinede girilen altı haneli bir PIN kullanır. Nvidia, güvenli eşleştirme kuruluncaya kadar tüm düğüm‑düğüm iletişiminin engellendiğini, ardından trafiğin MTLS ve oluşturulan sertifikalarla güvence altına alındığını belirtti. Şirket, yazılımı özel yerel çıkarım için konumlandırıyor; istemler, dosyalar ve ajan bağlamı kullanıcının ev ağında kalıyor, bulut çıkarım hizmetine gönderilmiyor. Depodaki belgeler, PAIR’ı güvenilmeyen veya paylaşılan bir ağda dağıtmadan önce güvenlik notlarını okumanızı öneriyor; çünkü yerel HTTP uç noktaları, LAN keşfi ve küme ağ iletişimi içeriyor.

Hedef İş Yükleri ve Resmi Olmayan Bir Demo

Nvidia, PAIR’ın aynı anda birçok bağımsız isteği ortaya çıkaran iş yüklerine yönelik olduğunu belirtti; örneğin bir lider ajanın karmaşık bir görevi alt ajanlar için daha küçük işlere böldüğü çok‑ajanlı uygulamalar. Hermes Desktop ajanı ve Ollama kullanılarak yapılan bir gösteride, şirket Qwen 3.6 35B A3B modelini kullanan beş alt ajanlık bir görevin tek bir RTX Spark dizüstü bilgisayarda ortalama 18 dakika sürdüğünü, üç cihazlı bir PAIR kümesinin (RTX Spark dizüstü, bir DGX Spark ve bir RTX 5090) aynı işi ortalama 8 dakika 48 saniyede tamamladığını raporladı. Nvidia, sonucun genel bir karşılaştırma ya da doğrusal ölçekleme vaadi olmaktan ziyade, yapılandırmaya özgü resmi olmayan bir gösterim olduğunu, sonuçların iş yükü paralelliği, model, motor ayarları, donanım, ağ ve düğüm kullanılabilirliğine bağlı olduğunu vurguladı.

Şirket, yüksek derecede sıralı görevlerin, tek uzun model çağrısının hâkim olduğu iş yüklerinin veya yalnızca bir düğümün istenen modeli tuttuğu yapılandırmaların daha az fayda sağlayabileceğini belirtti. Depo belgeleri, yazılımın şu anda kuyruğa alınmış işleri kaba bir GPU kullanım sinyaliyle birleştiren tek bir zamanlama politikasını içerdiğini, bunun benzer makineler için yüksek derecede karışık bir kümeden daha uygun olduğunu ve Nvidia’nın ne zaman ve neyin gönderileceği konusunda sabit taahhütler olmadan zamanlayıcıyı daha akıllı hâle getirmek için geri bildirim istediğini ekliyor.

Theo Nash yapay zeka altyapısı, hesaplamalar ve modern yapay zekayı güçlendirerek donanımsal sistemler konusunda uzmanlaşmış bir yapay zeka üreten uzman olarak Unite.AI'de çalışmaktadır. Çalışmaları, büyük ölçekli yapay zeka iş yüklerinin arkasındaki teknik temellere odaklanmaktadır, bunlar veri merkezleri, hızlandırıcılar, ağlar ve bunları birleştiren yazılım yığınlarını içermektedir.
Analitik ve mühendislik odaklı bir perspektifle, Theo, GPU'lar, özel silikon, bellek mimarileri ve dağıtılmış sistemlerdeki gelişmelerin yeni nesil yapay zeka modellerini nasıl mümkün kıldığını inceliyor. Performans ticaretinin, enerji verimliliğinin, ölçeklenebilirliğin ve yapay zeka altyapısının gerçek dünya dağıtımını şekillendiren pratik kısıtlara özel dikkat gösteriyor.
Theo Nash tarafından yazılan makaleler, teknik doğruluk, açıklık ve hızla gelişen yapay zeka hesaplaması manzarasının sorumlu bir şekilde kapsülendiğinden emin olmak için Unite.AI'nin editör ekibi tarafından incelenerek oluşturulmaktadır.