โมเดลและแพลตฟอร์ม AI
Nvidia เชื่อมคอมพิวเตอร์ในบ้านให้เป็นคลัสเตอร์ AI Inference เดียวด้วย PAIR

Nvidia เมื่อวันที่ 3 กันยายน 2026 เปิดตัวเบตาของ Personal AI Router (PAIR) ซึ่งเป็นซอฟต์แวร์โอเพ่นซอร์สฟรีที่เชื่อมคอมพิวเตอร์ที่เข้ากันได้บนเครือข่ายในบ้านให้เป็นคลัสเตอร์เดียวสำหรับการสรุปผล AI ภายในเครื่อง โดยทำการส่งต่อคำขอจากงานของเอเจนต์ไปยังเครื่องใดก็ได้ที่พร้อมใช้งาน
แม้ชื่อจะบ่งบอก PAIR ไม่ใช่เราเตอร์ฮาร์ดแวร์และไม่ใช่เอนจินสรุปผลใหม่ ตามบล็อกเทคนิคของ Nvidia ที่ประกาศซอฟต์แวร์นี้ เอนจินอย่าง Ollama และ LM Studio ยังคงรันโมเดลแต่ละตัวบนเครื่องที่เลือกไว้ ในขณะที่ PAIR ค้นหาระบบที่เข้าร่วม, ตรวจสอบว่าแต่ละเครื่องพร้อมรับคำขอหรือไม่, กำหนดเวลางานอิสระ, และส่งคืนผลตอบกลับทุกอย่างไปยังแอปพลิเคชันที่เป็นต้นทาง
สิ่งที่เบตานี้รองรับ
เบต้า PAIR ทำงานบน Windows 11, DGX OS, Ubuntu 14.04 และ macOS Tahoe โดยรองรับสถาปัตยกรรม x64 และ arm64 บนระบบปฏิบัติการทั้งสาม; เอกสารของโครงการระบุว่า Windows บน ARM อยู่ในขั้นทดลอง หน้าแสดงผลิตภัณฑ์ของ Nvidia ระบุฮาร์ดแวร์ที่รองรับเป็น GPU GeForce RTX ทุกรุ่นตั้งแต่ซีรีส์ 20 ขึ้นไป, ระบบ DGX Spark และ GB10, รวมถึง Mac ที่ใช้ชิป Apple M4 หรือใหม่กว่า พร้อมต้องมี RAM ขั้นต่ำ 8 GB และพื้นที่ดิสก์ที่แนะนำอย่างน้อย 20 GB หรือมากกว่า บล็อกเทคนิคยังเพิ่มรายการ GPU รุ่น RTX PRO สำหรับเวิร์กสเตชันบนสถาปัตยกรรม Turing และรุ่นใหม่กว่า
ไม่จำเป็นต้องเชื่อมต่ออินเทอร์เน็ตเพื่อใช้งาน แม้ว่าจะต้องใช้เพื่อดาวน์โหลดโมเดล หน้าแสดงผลิตภัณฑ์ระบุว่าการตั้งค่าคลัสเตอร์ไม่ต้องใช้สายเคเบิลหรือแร็คพิเศษ: ผู้ใช้ดาวน์โหลดซอฟต์แวร์, เพิ่มอุปกรณ์ของตน, และรันแอปพลิเคชัน AI ผ่านระบบนี้ Nvidia เผยโค้ดต้นฉบับของ PAIR ภายใต้ Apache License 2.0 และกล่าวว่าผู้พัฒนาสามารถตรวจสอบโค้ด, รายงานปัญหา, และร่วมพัฒนาการปรับปรุงด้านการค้นหา, การจับคู่, การกำหนดเส้นทาง, การรวมเอ็นจิน, จุดสิ้นสุด, และประสบการณ์ผู้ใช้ได้
การกำหนดเส้นทางโดยไม่รวม GPU เข้าด้วยกัน
Nvidia อธิบายว่า PAIR เป็นเราเตอร์สรุปผลเสมือน ไม่ใช่วิธีการรวมฮาร์ดแวร์เข้าด้วยกัน คำขอแต่ละรายการจะถูกมอบหมายให้กับโหนดที่มีคุณสมบัติเหมาะสมหนึ่งโหนดและคงอยู่ที่นั่นตลอดอายุการใช้งาน; ซอฟต์แวร์ไม่ทำการรวมหน่วยความจำ GPU, ไม่รวม GPU เข้าด้วยกันเป็นตัวเร่งตรรกะขนาดใหญ่, ไม่แบ่งโมเดลเดียวกันระหว่างเครื่องหลายเครื่อง, หรือแยกคำขอสรุปผลที่กำลังดำเนินการหนึ่งคำขอออกเป็นหลายโหนด
แอปพลิเคชันเชื่อมต่อผ่านปลายทางพร็อกซีที่เข้ากันได้กับ Ollama และ OpenAI ซึ่ง PAIR สร้างขึ้นโดยเข้าครอบครองพอร์ตเริ่มต้นที่สองเอ็นจินใช้ Nvidia กล่าวว่าหมายความว่าชุดเครื่องมือของเอเจนต์สามารถใช้ส่วนต่อประสานที่คุ้นเคยอยู่ได้โดยไม่ต้องมี API คลัสเตอร์ใหม่เพื่อผสานรวม โหนดจะถือว่าเหมาะสมกับคำขอเมื่อมีเอ็นจินที่รองรับเปิดใช้งานบนโหนดนั้นและมีโมเดลที่ร้องขออยู่ที่นั่นอย่างตรงกัน และ PAIR จะให้ความสำคัญกับโหนดที่ทราบว่ามีโมเดลนั้นอยู่แล้ว โมเดลไม่จำเป็นต้องเหมือนกันทั่วคลัสเตอร์; การโหลดแท็กโมเดลเดียวกันบนโหนดหลายโหนดจะทำให้ตัวกำหนดเวลามีพูลโหนดที่เหมาะสมขนาดใหญ่ขึ้น
สำหรับคำขอใหม่แต่ละครั้ง ตัวกำหนดเวลาจะพิจารณาว่าโหนดที่จับคู่อยู่เชื่อมต่อออนไลน์และพร้อมใช้งานหรือไม่, มีเอ็นจินที่รองรับเปิดอยู่หรือไม่, โมเดลที่ร้องขอมีอยู่หรือไม่, ภาระงานปัจจุบันรวมถึงงานที่กำลังทำ, และการใช้ GPU ที่มีอยู่เช่นแอปพลิเคชันที่ใช้กราฟิกหนัก โหนดสามารถให้ความจุเมื่อพร้อมใช้งานและหยุดให้บริการเมื่อจำเป็น เช่น เมื่อแล็ปท็อปเข้าสู่โหมดสลีป, ปิดเครื่อง, หรือออกจากเครือข่าย
การค้นหา, ความปลอดภัย, และความเป็นส่วนตัว
หลังการติดตั้ง PAIR ใช้การค้นหาเครือข่ายท้องถิ่นผ่าน mDNS เพื่อค้นหาระบบใกล้เคียงโดยอัตโนมัติ และสามารถเพิ่มโหนดโดยใช้ที่อยู่ IP ได้ การจับคู่เครื่องสองเครื่องใช้ PIN หกหลักที่แสดงบนเครื่องเชิญและต้องป้อนบนเครื่องที่ได้รับเชิญ Nvidia กล่าวว่าการสื่อสารระหว่างโหนดทั้งหมดจะถูกบล็อกจนกว่าจะมีการจับคู่อย่างปลอดภัยเสร็จสมบูรณ์ หลังจากนั้นการจราจรจะได้รับการปกป้องด้วย MTLS และใบรับรองที่สร้างขึ้น บริษัทวางตำแหน่งซอฟต์แวร์นี้เพื่อการสรุปผลภายในเครือข่ายส่วนตัว โดยข้อความแจ้ง, ไฟล์, และบริบทของเอเจนต์จะอยู่บนเครือข่ายบ้านของผู้ใช้แทนที่จะส่งไปยังบริการสรุปผลบนคลาวด์ เอกสารในคลังโค้ดเตือนผู้ใช้ให้อ่านหมายเหตุด้านความปลอดภัยก่อนนำ PAIR ไปใช้บนเครือข่ายที่ไม่เชื่อถือหรือแชร์ เนื่องจากมีปลายทาง HTTP ภายใน, การค้นหา LAN, และการเชื่อมต่อคลัสเตอร์
งานเป้าหมายและการสาธิตแบบไม่เป็นทางการ
Nvidia กล่าวว่า PAIR มุ่งเน้นที่งานที่ต้องจัดการคำขออิสระหลายคำขอพร้อมกัน เช่น แอปพลิเคชันหลายเอเจนต์ที่เอเจนต์หลักแบ่งงานซับซ้อนออกเป็นงานย่อยสำหรับเอเจนต์ย่อย ในการสาธิตโดยใช้เอเจนต์ Hermes Desktop และ Ollama บริษัทรายงานว่าหน้าที่ที่มีเอเจนต์ย่อยห้าตัวใช้โมเดล Qwen 3.6 35B A3B ใช้เวลาโดยเฉลี่ย 18 นาทีบนแล็ปท็อป RTX Spark เครื่องเดียว ในขณะที่คลัสเตอร์ PAIR ที่ประกอบด้วยอุปกรณ์สามเครื่อง ได้แก่ แล็ปท็อป RTX Spark, DGX Spark, และ RTX 5090 ทำงานเดียวกันได้ในเวลาเฉลี่ย 8 นาที 48 วินาที Nvidia ระบุผลลัพธ์นี้เป็นการสาธิตแบบไม่เป็นทางการและขึ้นกับการตั้งค่าเฉพาะ ไม่ใช่การวัดมาตรฐานทั่วไปหรือสัญญาว่าจะสเกลเชิงเส้น โดยชี้ให้เห็นว่าผลลัพธ์ขึ้นอยู่กับความขนานของงาน, โมเดล, การตั้งค่าเอ็นจิน, ฮาร์ดแวร์, เครือข่าย, และความพร้อมของโหนด
บริษัทกล่าวว่างานที่เป็นลำดับขั้นสูง, งานที่มีการเรียกโมเดลยาวหนึ่งครั้งเป็นหลัก, หรือการตั้งค่าที่มีเพียงโหนดเดียวที่มีโมเดลที่ร้องขออาจได้รับประโยชน์น้อยลง เอกสารในคลังโค้ดเพิ่มเติมว่าในขณะนี้ซอฟต์แวร์มาพร้อมกับนโยบายการกำหนดเวลาหนึ่งแบบที่รวมงานคิวกับสัญญาณการใช้ GPU อย่างหยาบ ทำให้เหมาะกับเครื่องที่คล้ายคลึงกันมากกว่าในคลัสเตอร์ที่ผสมผสานอย่างหลากหลาย และ Nvidia ต้องการรับข้อเสนอแนะเพื่อทำให้ตัวกำหนดเวลาฉลาดขึ้นโดยไม่มีข้อผูกมัดแน่นอนเกี่ยวกับสิ่งที่จะปล่อยหรือเวลาใด












