Mô hình và nền tảng AI
NVIDIA phát hành mô hình người nói Nemotron 3 Diarization dạng mở

Vào ngày 23 tháng 9 năm 2026, NVIDIA đã phát hành Nemotron 3 Diarization, một mô hình phân đoạn người nói dạng mở có khả năng nhận dạng tối đa tám người nói trong âm thanh trực tiếp hoặc đã ghi âm, và Baseten đã công bố hỗ trợ phục vụ trong cùng ngày với các preset batch, streaming và diarized-transcription, mỗi preset chạy trên một GPU RTX PRO 6000.
Phân đoạn người nói chia một luồng âm thanh dựa trên thời điểm mỗi người nói riêng biệt, xuất ra thời gian cho mỗi giọng nói và gán nhãn nhất quán cho mỗi đoạn; khi kết hợp với việc chuyển văn bản, nó gán các từ đã chuyển cho người đã nói chúng. Thông báo của Baseten mô tả Nemotron 3 Diarization là một mô hình mở, đầu cuối, thay thế quy trình phân đoạn cộng nhúng thông thường và việc tinh chỉnh của nó bằng một lần chạy duy nhất, gán nhãn cho các người nói ở khoảng thời gian có thể cấu hình thấp nhất chỉ 320 mili giây.
Kiến trúc và các hồ sơ độ trễ
Theo thẻ mô hình của NVIDIA, mô hình được thiết kế để xác định “ai đã nói khi nào” trong âm thanh thực tế, hỗ trợ cả suy luận streaming và offline, và sẵn sàng cho việc sử dụng thương mại hoặc phi thương mại. Đây là một bộ mã hoá Transformer 31 lớp, có 100 triệu tham số, kèm Rotary Positional Embeddings. Âm thanh đơn kênh 16 kHz đầu vào được chuyển thành các khung mel-spectrogram 10 mili giây, sau đó giảm mẫu xuống mức 8 lần để có tốc độ khung mã hoá 80 mili giây, và một lớp Conv1D phía trên bộ mã hoá sẽ tăng mẫu các dự đoán trở lại độ phân giải đầu vào 10 mili giây. Mô hình xuất ra một tensor các xác suất hoạt động theo người nói với hình dạng T, 8, và tám kênh người nói được sắp xếp theo thứ tự xuất hiện đầu tiên của mỗi người trong âm thanh.
Đối với streaming, mô hình sử dụng Bộ nhớ đệm Loại Người Nói Theo Thứ Tự Xuất Hiện và hàng đợi FIFO được giới thiệu trong công trình Streaming Sortformer của NVIDIA: bộ nhớ đệm giữ thông tin người nói từ các đoạn trước để giọng đầu tiên nghe được giữ nhãn, trong khi hàng đợi cung cấp ngữ cảnh khung gần nhất cho mỗi bước xử lý. Thiết kế này không yêu cầu embedding hay clustering, và suy luận theo khối không đặt giới hạn cố định cho độ dài âm thanh.
Một checkpoint duy nhất hỗ trợ bốn cấu hình độ trễ được khuyến nghị: 0,32, 0,64 và 1,04 giây, cộng với bộ đệm đầu vào dạng offline 30,4 giây. Thẻ mô tả độ trễ này là độ trễ bộ đệm đầu vào — độ dài khối cộng ngữ cảnh bên phải, nhân với 80 mili giây — và lưu ý rằng con số này không bao gồm thời gian xử lý tính toán. Checkpoint có thể chạy với bộ đệm thấp nhất 80 mili giây, mặc dù 0,32 giây là cấu hình được khuyến nghị thấp nhất, và độ phân giải khung đầu ra có thể cấu hình theo bội số của 10 mili giây.
Độ chính xác và tốc độ được báo cáo
Thẻ mô hình của NVIDIA báo cáo tỷ lệ lỗi phân đoạn người nói, độ chính xác đếm người nói và sai số trung bình tuyệt đối khi đếm người nói so với diar_streaming_sortformer_4spk-v2.1 đối chiếu với baseline, bao gồm cả lời nói chồng chéo và không có khoảng thời gian lót (collar) trên mọi bộ chuẩn trừ CALLHOME-Part2, bộ này sử dụng khoảng lót 0,25 giây. Trên DIHARD III, thẻ báo cáo tỷ lệ lỗi toàn bộ là 12,73 ở hồ sơ 30,4 giây và 13,55 ở 0,32 giây, so với 19,09 và 19,85 của baseline. Trên các bản ghi kênh đơn NOTSOFAR1, nó báo cáo 11,00 so với 30,49 ở hồ sơ offline; trên AMI Test SDM, 11,14 so với 21,42; trên AliMeeting Test Near, 6,40 so với 11,57; và trên CALLHOME-Part2, 9,10 so với 10,32. Thẻ cho biết các điểm số AMI, AliMeeting và NOTSOFAR1 được tính bằng nhãn tham chiếu căn chỉnh ép buộc và kết quả được chấm điểm dựa trên các chú thích tham chiếu khác nhau không thể so sánh trực tiếp.
Bảng tốc độ trong thẻ báo cáo tăng tốc hệ số thời gian thực, được định nghĩa là tổng thời lượng âm thanh chia cho tổng thời gian xử lý, đạt 1.340 ở chế độ eager và 4.385 khi biên dịch với kích thước batch là một trên hồ sơ offline, đo trên RTX PRO 5000 với độ chính xác BF16. Ở hồ sơ 0,32 giây, các con số tương ứng là 12,5 và 54.
Baseten đã thực hiện đánh giá riêng, cũng tính tỷ lệ lỗi với lời nói chồng chéo và không có khoảng lót. Nó báo cáo tỷ lệ lỗi 9,8 % trên AISHELL-4 ở hồ sơ độ trễ thấp, so với 27,2 % của Streaming Sortformer v2.1, và cho biết việc chuyển từ hồ sơ offline 30 giây sang hồ sơ siêu thấp 0,32 giây chỉ làm tăng tỷ lệ lỗi một đến hai điểm phần trăm. Baseten cho biết mô hình vượt trội hơn Meta Muse Voice Transcribe trên mọi bộ dữ liệu mà nó thử nghiệm, ngay cả ở cấu hình siêu thấp, và chỉ thua pyannote community-1 trên AMI.
Dữ liệu đào tạo và giấy phép
Thẻ mô hình liệt kê khoảng 10.000 giờ hội thoại thực (bao gồm Fisher English, các tập dữ liệu họp AMI và ICSI, VoxConverse, AISHELL-4, AliMeeting, thử thách DIHARD lần thứ ba, CALLHOME, NOTSOFAR1, các bộ DISPLACE, các bản ghi có giấy phép của David AI, và một tập con YODAS-v2 được gán nhãn giả) cùng với 82.611 giờ hỗn hợp đa người nói được mô phỏng bằng công cụ FastMSS từ khoảng 28.000 giờ bản ghi đơn người nói. Quá trình đào tạo bắt đầu từ checkpoint tự giám sát NEST và được thực hiện trên tám nút, mỗi nút có tám GPU A100-80GB, qua hai giai đoạn: đào tạo offline trên dữ liệu mô phỏng, sau đó tinh chỉnh streaming trên sự kết hợp của âm thanh thực và mô phỏng. Việc sử dụng mô hình được điều chỉnh bởi Thỏa thuận Giấy phép OpenMDW, phiên bản 1.1.
Các preset phục vụ của Baseten và khả năng
Baseten cung cấp mô hình thông qua ba preset, mỗi preset chạy trên một RTX PRO 6000 phía sau một engine đồ thị CUDA được xây dựng quanh vòng lặp streaming của NVIDIA NeMo, theo danh sách Thư viện Mô hình của nó, cũng mô tả mô hình này là người kế thừa của Streaming Sortformer v2.1. Preset Batch Diarization là một endpoint HTTP cho âm thanh đã ghi, trả về các lượt nói của người nói với hồ sơ độ trễ mỗi yêu cầu. Streaming Diarization là một endpoint WebSocket cho âm thanh trực tiếp, truyền danh tính người nói xuyên suốt cuộc hội thoại mà không cần tái phân cụm. Streaming Diarized Transcription kết hợp bộ phân đoạn giọng nói với mô hình nhận dạng giọng nói Parakeet V2 của NVIDIA, một hệ thống 600 triệu tham số, và trả về các từ được gắn nhãn người nói cùng thời gian, phần riêng của mỗi người nói, và cờ chồng lắp. Baseten cho biết preset này đưa các vector hoạt động mỗi người nói trực tiếp vào các lớp mã hoá đầu tiên của Parakeet nên tiếng nói chồng lắp được chuyển đổi trong một lần duy nhất, với nhãn người nói cuối cùng khi đến và các từ đã cam kết không bao giờ được sửa đổi.
Baseten báo cáo rằng một RTX PRO 6000 duy trì hơn 500 luồng diarization kéo dài một giờ đồng thời ở hồ sơ 1,04 giây, 200 luồng ở hồ sơ 0,32 giây, và 190 luồng kéo dài một giờ khi thêm chức năng chuyển văn bản, trong khi preset batch xử lý 200 tệp âm thanh sáu phút mỗi phút. Sử dụng các tệp và phần cứng giống nhau, Baseten báo cáo rằng preset được tối ưu của họ đạt tốc độ xử lý batch cao hơn khoảng 1,35 lần so với cấu hình tham chiếu của NVIDIA mà họ đã thử nghiệm, dưới tải k6 tạo ra bên trong cụm với một luồng kiểm soát trên một bản sao nhàn rỗi.
Baseten cũng cho biết tín hiệu hoạt động mỗi người nói của mô hình, được theo dõi theo khoảng thời gian 10 mili giây, có thể điều khiển phát hiện hoạt động giọng nói, phát hiện kết thúc lượt nói riêng cho mỗi người nói, và xử lý việc luân chuyển lượt nói và ngắt lời, phản hồi trong khoảng 300 mili giây trên các cài đặt độ trễ siêu thấp.
Nemotron 3 Diarization có sẵn trên Hugging Face trong kho nvidia/Nemotron-3-Diarization và trong Thư viện Mô hình của Baseten, với tích hợp NeMo Framework v3.0 và hỗ trợ các GPU NVIDIA Ampere, Ada Lovelace, Hopper và Blackwell.












