โมเดลและแพลตฟอร์ม AI
NVIDIA เปิดตัวโมเดลผู้พูดแบบเปิดน้ำหนัก Nemotron 3 Diarization

NVIDIA ในวันที่ 23 กันยายน 2026 ได้เปิดตัว Nemotron 3 Diarization ซึ่งเป็นโมเดลการแยกผู้พูดแบบเปิดน้ำหนักที่สามารถระบุผู้พูดได้สูงสุดถึงแปดคนในเสียงสดหรือบันทึก และ Baseten ประกาศการสนับสนุนการให้บริการในวันเดียวกันด้วยพรีเซ็ตแบบแบช, สตรีมมิ่ง, และการถอดข้อความพร้อมการแยกผู้พูด ซึ่งแต่ละพรีเซ็ตทำงานบน GPU RTX PRO 6000 หนึ่งตัว
การแยกผู้พูดแบ่งสตรีมเสียงตามช่วงเวลาที่ผู้พูดแต่ละคนพูด, ส่งออกเวลาแต่ละเสียง, และกำหนดป้ายกำกับที่สอดคล้องให้กับแต่ละช่วง; เมื่อจับคู่กับการถอดข้อความ, มันจะเชื่อมโยงคำที่ถอดกับบุคคลที่พูด. ประกาศของ Baseten บรรยาย Nemotron 3 Diarization ว่าเป็นโมเดลแบบเปิดและครบวงจรที่แทนที่กระบวนการแยกส่วนและการฝังเวกเตอร์แบบเดิมพร้อมการปรับแต่งด้วยการดำเนินการครั้งเดียว, โดยทำการติดป้ายผู้พูดที่ช่วงเวลาที่กำหนดได้ต่ำสุดเพียง 320 มิลลิวินาที
สถาปัตยกรรมและโปรไฟล์ความหน่วงเวลา
ตาม การ์ดโมเดลของ NVIDIA, โมเดลนี้ออกแบบมาเพื่อระบุว่า “ใครพูดเมื่อไหร่” ในเสียงจริง, รองรับการสรุปผลแบบสตรีมมิ่งและออฟไลน์, และพร้อมสำหรับการใช้งานเชิงพาณิชย์หรือไม่เชิงพาณิชย์. โมเดลนี้เป็น Encoder Transformer จำนวน 31 ชั้น ที่มีพารามิเตอร์ 100 ล้านตัว พร้อม Rotary Positional Embeddings. เสียงอินพุตที่มีความถี่ 16 kHz ช่องเดียวจะถูกแปลงเป็นเฟรมเมลสเปกโตรแกรมที่มีความยาว 10 มิลลิวินาที, ลดอัตราการสุ่มตัวอย่างลงด้วยอัตรา 8 เท่าเป็นอัตราเฟรม Encoder 80 มิลลิวินาที, และชั้น Conv1D ด้านบน Encoder จะอัปซัมพล์การพยากรณ์กลับไปที่ความละเอียดอินพุต 10 มิลลิวินาที. โมเดลจะส่งออกเทนเซอร์ของความน่าจะเป็นการทำงานของแต่ละผู้พูดโดยมีรูปทรง T, 8, และช่องผู้พูดทั้งแปดจะเรียงตามลำดับการมาถึงครั้งแรกของแต่ละผู้พูดในเสียง
สำหรับการสตรีมมิ่ง, โมเดลใช้ Arrival-Order Speaker Cache และคิว FIFO ที่แนะนำในงาน Streaming Sortformer ของ NVIDIA: แคชจะเก็บข้อมูลผู้พูดจากชั้นก่อนหน้าเพื่อให้เสียงแรกที่ได้ยินคงป้ายกำกับเดิม, ส่วนคิวจะให้บริบทของเฟรมล่าสุดสำหรับแต่ละขั้นตอนการประมวลผล. การออกแบบนี้ไม่ต้องใช้การฝังเวกเตอร์หรือการจัดกลุ่ม, และการสรุปผลแบบแบ่งชิ้นไม่มีขีดจำกัดคงที่ต่อระยะเวลาของเสียง
เช็คพอยต์เดียวให้บริการสี่การกำหนดค่าความหน่วงที่แนะนำ: 0.32, 0.64, และ 1.04 วินาที, พร้อมบัฟเฟอร์อินพุตแบบออฟไลน์ 30.4 วินาที. การ์ดกำหนดความหน่วงนี้เป็นความหน่วงของบัฟเฟอร์อินพุต — ความยาวชิ้นบวกบริบทด้านขวา, คูณด้วย 80 มิลลิวินาที — และระบุว่าตัวเลขนี้ไม่รวมเวลาการประมวลผลเชิงคำนวณ. เช็คพอยต์สามารถทำงานด้วยบัฟเฟอร์ต่ำสุดที่ 80 มิลลิวินาที, แม้ว่า 0.32 วินาทีจะเป็นการกำหนดค่าที่แนะนำต่ำสุด, และความละเอียดของเฟรมเอาต์พุตสามารถกำหนดได้เป็นหลายของ 10 มิลลิวินาที
ความแม่นยำและความเร็วที่รายงาน
การ์ดโมเดลของ NVIDIA รายงานอัตราความผิดพลาดของการแยกผู้พูด, ความแม่นยำในการนับผู้พูด, และค่าเฉลี่ยความคลาดเคลื่อนสัมบูรณ์ในการนับผู้พูดเทียบกับ diar_streaming_sortformer_4spk-v2.1 baseline, โดยรวมการพูดทับซ้อนและใช้คอลลาร์ศูนย์วินาทีในทุกเกณฑ์การทดสอบ ยกเว้น CALLHOME-Part2 ที่ใช้คอลลาร์ 0.25 วินาที. ใน DIHARD III, การ์ดรายงานอัตราความผิดพลาดของชุดเต็มที่ 12.73 สำหรับโปรไฟล์ 30.4 วินาทีและ 13.55 สำหรับ 0.32 วินาที, เทียบกับ 19.09 และ 19.85 ของ baseline. ในการบันทึกช่องเดียวของ NOTSOFAR1 รายงานค่า 11.00 เทียบกับ 30.49 ในโปรไฟล์ออฟไลน์; ใน AMI Test SDM, 11.14 เทียบกับ 21.42; ใน AliMeeting Test Near, 6.40 เทียบกับ 11.57; และใน CALLHOME-Part2, 9.10 เทียบกับ 10.32. การ์ดระบุว่าคะแนนของ AMI, AliMeeting, และ NOTSOFAR1 ถูกคำนวณด้วยป้ายอ้างอิงแบบ forced-alignment และผลลัพธ์ที่วัดกับการอ้างอิงที่ต่างกันไม่สามารถเปรียบเทียบโดยตรงได้.
ตารางความเร็วในการ์ดรายงานการเพิ่มประสิทธิภาพแบบ real-time-factor, ซึ่งกำหนดเป็นระยะเวลาเสียงทั้งหมดหารด้วยระยะเวลาการประมวลผลทั้งหมด, มีค่า 1,340 ในโหมด eager และ 4,385 ในโหมด compiled ที่ขนาดแบชหนึ่งบนโปรไฟล์ออฟไลน์, วัดบน RTX PRO 5000 ที่ความแม่นยำ BF16. สำหรับโปรไฟล์ 0.32 วินาที, ตัวเลขที่สอดคล้องกันคือ 12.5 และ 54.
Baseten ทำการประเมินของตนเอง, โดยวัดอัตราความผิดพลาดพร้อมการพูดทับซ้อนและไม่มีคอลลาร์. รายงานอัตราความผิดพลาด 9.8% บน AISHELL-4 ที่โปรไฟล์ความหน่วงต่ำ เทียบกับ 27.2% ของ Streaming Sortformer v2.1, และระบุว่าการเปลี่ยนจากโปรไฟล์ออฟไลน์ 30 วินาทีไปยังโปรไฟล์อัลตร้าโลว์ 0.32 วินาทีเพิ่มอัตราความผิดพลาดเพียงหนึ่งถึงสองคะแนน. Baseten รายงานว่าโมเดลนี้เหนือกว่า Meta Muse Voice Transcribe ในทุกชุดข้อมูลที่ทดสอบ, แม้ในกำหนดค่าอัลตร้าโลว์, และแพ้ต่อ pyannote community-1 เพียงใน AMI.
ข้อมูลการฝึกและการให้สิทธิ์ใช้งาน
การ์ดโมเดลระบุว่ามีประมาณ 10,000 ชั่วโมงของการสนทนาจริง (รวมถึง Fisher English, คอร์ปัสการประชุม AMI และ ICSI, VoxConverse, AISHELL-4, AliMeeting, การแข่งขัน DIHARD ครั้งที่สาม, CALLHOME, NOTSOFAR1, ชุด DISPLACE, การบันทึกที่ได้รับอนุญาตจาก David AI, และส่วนย่อยที่มีการตั้งฉลากเทียมของ YODAS-v2) ควบคู่กับ 82,611 ชั่วโมงของการผสมเสียงหลายผู้พูดที่จำลองด้วยเครื่องมือ FastMSS จากประมาณ 28,000 ชั่วโมงของการบันทึกผู้พูดเดี่ยว. การฝึกเริ่มจากเช็คพอยต์ NEST แบบเรียนรู้ด้วยตนเองและดำเนินการบนโหนดแปดโหนดที่มี GPU A100-80GB จำนวนแปดตัวในสองขั้นตอน: การฝึกออฟไลน์บนข้อมูลจำลอง, ตามด้วยการปรับจูนแบบสตรีมมิ่งบนการผสมของเสียงจริงและจำลอง. การใช้โมเดลนี้อยู่ภายใต้ข้อตกลงใบอนุญาต OpenMDW License Agreement เวอร์ชัน 1.1.
พรีเซ็ตการให้บริการของ Baseten และความจุ
Baseten เปิดเผยโมเดลผ่านสามพรีเซ็ต ซึ่งแต่ละพรีเซ็ตทำงานบน RTX PRO 6000 เครื่องเดียวที่อยู่เบื้องหลังเอนจิน CUDA‑graph ที่สร้างขึ้นรอบลูปสตรีมมิ่งของ NVIDIA ตาม รายการใน Model Library ของมัน ซึ่งยังอธิบายโมเดลว่าเป็นรุ่นต่อจาก Streaming Sortformer v2.1 พรีเซ็ต Batch Diarization เป็น endpoint HTTP สำหรับออดิโอที่บันทึกไว้ซึ่งส่งคืนการเปลี่ยนผู้พูดพร้อมโปรไฟล์ความหน่วงต่อคำขอ Streaming Diarization เป็น endpoint WebSocket สำหรับออดิโอสดที่ส่งต่ออัตลักษณ์ของผู้พูดตลอดการสนทนาโดยไม่ต้องทำการจัดกลุ่มใหม่ Streaming Diarized Transcription ผสานการทำ diarization กับโมเดลการรู้จำเสียงพูด Parakeet V2 ของ NVIDIA ซึ่งเป็นระบบที่มีพารามิเตอร์ 600 ล้านตัว และส่งคืนคำที่มีแท็กผู้พูดพร้อมเวลา คำส่วนย่อยต่อผู้พูด และแฟล็กการทับซ้อน Baseten ระบุว่าพรีเซ็ตนี้ส่งเวกเตอร์กิจกรรมต่อผู้พูดโดยตรงเข้าสู่ชั้นเริ่มต้นของตัวเข้ารหัส Parakeet ทำให้การพูดที่ทับซ้อนถูกถอดความในหนึ่งรอบ พร้อมป้ายผู้พูดที่สรุปเมื่อมาถึงและคำที่บันทึกแล้วจะไม่ถูกแก้ไข
Baseten รายงานว่า RTX PRO 6000 เครื่องเดียวสามารถรองรับสตรีม diarization ความยาวหนึ่งชั่วโมงพร้อมกันได้มากกว่า 500 สตรีมที่โปรไฟล์ 1.04 วินาที, 200 สตรีมที่โปรไฟล์ 0.32 วินาที, และ 190 สตรีมความยาวหนึ่งชั่วโมงเมื่อเพิ่มการถอดข้อความ, ในขณะที่พรีเซ็ต batch สามารถประมวลผลไฟล์ออดิโอหกนาที 200 ไฟล์ต่อหนึ่งนาที โดยใช้ไฟล์และฮาร์ดแวร์เดียวกัน Baseten รายงานว่าพรีเซ็ตที่ปรับแต่งของตนให้ผลผลิต batch สูงกว่าการตั้งค่าอ้างอิงของ NVIDIA ที่ทดสอบประมาณ 1.35 เท่า ภายใต้โหลดที่สร้างโดย k6 ภายในคลัสเตอร์พร้อมการควบคุมสตรีมเดียวบน replica ที่ไม่ได้ทำงาน
Baseten ยังระบุว่าสัญญาณกิจกรรมต่อผู้พูดของโมเดล ซึ่งติดตามเป็นช่วงเวลา 10 มิลลิวินาที สามารถใช้เพื่อการตรวจจับกิจกรรมเสียง, การตรวจจับจบการพูดของผู้พูดแต่ละคน, และการจัดการการสลับบทพูดและการขัดจังหวะ โดยตอบสนองภายในประมาณ 300 มิลลิวินาทีในตั้งค่าความหน่วงต่ำสุด
Nemotron 3 Diarization มีให้บริการบน Hugging Face ภายใต้รีโพสิตอรี nvidia/Nemotron-3-Diarization และใน Model Library ของ Baseten พร้อมการผสานรวม NeMo Framework เวอร์ชัน 3.0 และรองรับ GPU ของ NVIDIA รุ่น Ampere, Ada Lovelace, Hopper, และ Blackwell












