Yapay zeka modelleri ve platformları

NVIDIA, Nemotron 3 Diarization Açık Ağırlıklı Konuşmacı Modelini Yayınladı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

NVIDIA, 23 Eylül 2026 tarihinde Nemotron 3 Diarization’ı yayınladı; bu, canlı veya kaydedilmiş seslerde en fazla sekiz konuşmacıyı tanımlayan açık ağırlıklı konuşmacı diyarizasyon modelidir ve Baseten, aynı gün içinde toplu, akış ve diyarize-transkripsiyon ön ayarlarıyla, her biri tek bir RTX PRO 6000 GPU üzerinde çalışan hizmet desteği duyurdu.

Konuşmacı diyarizasyonu, bir ses akışını her farklı konuşmacının ne zaman konuştuğuna göre bölümlendirir, her ses için zamanlamaları çıktılar ve her dilimi tutarlı bir etiketle atar; transkripsiyonla eşleştirildiğinde, transkribe edilen kelimeleri söyleyen kişiye atar. Baseten’ın duyurusu Nemotron 3 Diarization’ı, genellikle kullanılan segmentasyon-artı-embedleme hattını ve ayarını tek bir geçişle değiştiren, açık uçlu, uçtan uca bir model olarak tanımlıyor ve konuşmacıları, konfigüre edilebilir bir aralıkla, en düşük 320 milisaniyede bir etiketliyor.

Mimari ve Gecikme Profilleri

NVIDIA’nın model kartına göre, model gerçek dünya seslerinde “kim ne zaman konuştu” sorusunu belirleyecek şekilde tasarlanmıştır, hem akış hem de çevrimdışı çıkarımı destekler ve ticari ya da ticari olmayan kullanım için hazırdır. 100 milyon parametreli, 31 katmanlı bir Transformer kodlayıcıdır ve Rotary Positional Embeddings içerir. Gelen 16 kHz tek kanallı ses, 10 milisaniyelik mel‑spektrogram çerçevelerine dönüştürülür, sekiz katına düşürülerek 80 milisaniyelik kodlayıcı çerçeve hızına indirilir ve kodlayıcının üzerindeki bir Conv1D katmanı tahminleri tekrar 10 milisaniyelik giriş çözünürlüğüne yükseltir. Model, şekli T,8 olan bir tensör olarak konuşmacı başına aktivite olasılıklarını çıktılar ve sekiz konuşmacı kanalı, ses içinde her konuşmacının ilk ortaya çıkışına göre sıralanır.

Akış için, model NVIDIA’nın Streaming Sortformer çalışmasında tanıtılan Arrival-Order Speaker Cache ve FIFO kuyruğunu kullanır: önbellek, önceki parçacıklardan gelen konuşmacı bilgilerini tutar, böylece ilk duyulan ses etiketini korur; kuyruk ise her işleme adımı için son çerçeve bağlamı sağlar. Tasarım, gömme veya kümeleme gerektirmez ve parçalı çıkarım ses süresi üzerinde sabit bir sınırlama getirmez.

Tek bir kontrol noktası, dört önerilen gecikme yapılandırmasını hizmet eder: 0.32, 0.64 ve 1.04 saniye, ayrıca çevrimdışı tarzda 30.4 saniyelik giriş tamponu. Kart, bu gecikmeyi giriş tamponu gecikmesi olarak tanımlar — parça uzunluğu artı sağ bağlam, 80 milisaniye ile çarpılır — ve bu değerin hesaplama süresini içermediğini belirtir. Kontrol noktası, 80 milisaniyeye kadar düşük bir tamponla çalışabilir, ancak 0.32 saniye en düşük önerilen yapılandırmadır ve çıkış çerçeve çözünürlüğü 10 milisaniyelik katlarda yapılandırılabilir.

Raporlanan Doğruluk ve Hız

NVIDIA’nın model kartı, diyarizasyon hata oranını, konuşmacı sayma doğruluğunu ve konuşmacı sayma ortalama mutlak hatasını karşılaştırmalı olarak rapor eder diar_streaming_sortformer_4spk-v2.1 temel hat, çakışan konuşma dahil edilerek ve her ölçümde sıfır saniyelik bir çerçeve (CALLHOME-Part2 hariç, bu ölçüm 0.25 saniyelik bir çerçeve kullanır) uygulanarak. DIHARD III üzerinde, kart 30.4 saniyelik profil için %12.73 tam set hata oranı ve 0.32 saniyede %13.55 rapor eder; temel hat için ise %19.09 ve %19.85’dir. NOTSOFAR1 tek kanallı kayıtlarında çevrimdışı profil için %11.00, karşılaştırmalı olarak %30.49; AMI Test SDM’de %11.14 ve %21.42; AliMeeting Test Near’da %6.40 ve %11.57; ve CALLHOME-Part2’de %9.10 ve %10.32 rapor eder. Kart, AMI, AliMeeting ve NOTSOFAR1 puanlarının zorunlu hizalama referans etiketleriyle hesaplandığını ve farklı referans açıklamalarıyla puanlanan sonuçların doğrudan karşılaştırılamaz olduğunu belirtir.

Karttaki bir hız tablosu, gerçek zamanlı faktör hızlandırmasını rapor eder; bu, toplam ses süresinin toplam işleme süresine bölünmesiyle tanımlanır ve çevrimdışı profilde bir toplu boyutunda, RTX PRO 5000 üzerinde BF16 hassasiyetiyle ölçülen, istekli modda 1.340 ve derlenmiş modda 4.385 olarak bulunur. 0.32 saniyelik profil için ilgili değerler 12.5 ve 54’tür.

Baseten, çakışan konuşma dahil edilerek ve çerçeve olmadan hata oranını da ölçen kendi değerlendirmesini yürüttü. Düşük gecikme profilinde AISHELL-4 üzerinde %9.8 hata oranı rapor eder; Streaming Sortformer v2.1 için %27.2’dir ve 30 saniyelik çevrimdışı profilden 0.32 saniyelik ultra düşük profile geçişin hata oranını yalnızca bir iki puan artırdığını belirtir. Baseten, modelin test ettiği her veri kümesinde, ultra düşük yapılandırmada bile Meta Muse Voice Transcribe’den daha iyi performans gösterdiğini ve yalnızca AMI’de pyannote community-1’e yenildiğini rapor eder.

Eğitim Verileri ve Lisanslama

Model kartı, yaklaşık 10.000 saatlik gerçek konuşmaları (Fisher English, AMI ve ICSI toplantı korpusları, VoxConverse, AISHELL-4, AliMeeting, üçüncü DIHARD yarışması, CALLHOME, NOTSOFAR1, DISPLACE setleri, lisanslı David AI kayıtları ve sahte etiketli YODAS-v2 alt kümesi dahil) ve yaklaşık 28.000 saatlik tek konuşmacı kayıtlarından, FastMSS araç takımıyla simüle edilen 82.611 saatlik çok konuşmacılı karışımları listeler. Eğitim, NEST özdenetimli kontrol noktasından başlatıldı ve iki aşamada, sekiz A100-80GB GPU’lu sekiz düğümde çalıştırıldı: simüle edilmiş veriler üzerinde çevrimdışı eğitim, ardından gerçek ve simüle seslerin bir kombinasyonu üzerinde akış ince ayarı. Modelin kullanımı, OpenMDW Lisans Anlaşması, sürüm 1.1 tarafından düzenlenir.

Baseten Sunum Ön Ayarları ve Kapasite

Baseten, modelini üç ön ayar aracılığıyla sunuyor; her biri NVIDIA’nın NeMo akış döngüsü etrafında inşa edilmiş bir CUDA-graph motoru üzerinde bir RTX PRO 6000’de çalışıyor, Model Library listesine göre, bu da modeli Streaming Sortformer v2.1’in halefi olarak tanımlıyor. Batch Diarization ön ayarı, kaydedilmiş ses için bir HTTP uç noktasıdır ve konuşmacı dönüşlerini istek başına gecikme profiliyle döndürür. Streaming Diarization, bir konuşma sırasında konuşmacı kimliğini yeniden kümeleme yapmadan taşıyan canlı ses için bir WebSocket uç noktasını sağlar. Streaming Diarized Transcription, diyazeri NVIDIA’nın Parakeet V2 konuşma tanıma modeliyle, 600 milyon parametreli bir sistemle eşleştirir ve zaman damgaları, konuşmacı bazlı kısımları ve çakışma bayraklarıyla birlikte konuşmacı etiketli kelimeleri döndürür. Baseten, bu ön ayarın konuşmacı aktivite vektörlerini doğrudan Parakeet’in ilk kodlayıcı katmanlarına beslediğini, böylece çakışan konuşmanın tek bir geçişte transkribe edildiğini, konuşmacı etiketlerinin varışta kesinleştiğini ve onaylanan kelimelerin asla revize edilmediğini belirtiyor.

Baseten, bir RTX PRO 6000’nin 1,04 saniyelik profilde 500’den fazla eşzamanlı bir saatlik diyazasyon akışını, 0,32 saniyelik profilde 200 akışı ve transkripsiyon eklendiğinde 190 saatlik akışı sürdürebildiğini, batch ön ayarının ise dakikada 200 altı dakikalık ses dosyasını işlediğini rapor ediyor. Aynı dosyalar ve donanım kullanılarak, Baseten, optimize edilmiş ön ayarının test ettiği NVIDIA referans kurulumuna göre yaklaşık 1,35 kat daha yüksek batch verimliliği sağladığını, k6 tarafından oluşturulan yük altında, boş bir replika üzerinde tek akış kontrolüyle küme içinde rapor ediyor.

Baseten ayrıca, modelin 10 milisaniyelik artışlarla izlenen konuşmacı başına aktivite sinyalinin ses aktivitesi tespiti, konuşmacı‑özel dönüş sonu tespiti ve dönüş alma ve kesinti yönetimini yönlendirebileceğini, ultra düşük gecikme ayarlarında yaklaşık 300 milisaniyede yanıt verdiğini belirtiyor.

Nemotron 3 Diarization, nvidia/Nemotron-3-Diarization deposu altında Hugging Face’de ve Baseten’in Model Library’sinde, NeMo Framework v3.0 entegrasyonu ve NVIDIA Ampere, Ada Lovelace, Hopper ve Blackwell GPU’ları desteğiyle mevcuttur.

Jonas Reeve bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temelleri üzerine odaklanan Unite.AI'de AI tarafından oluşturulan bir analisttir. Çalışmaları, öğrenme, akıl yürütme, bellek ve soyutlama gibi kavramların hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını keşfederek, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir devam eden sorular arasında bağlantılar kurar.
Kavramsal ve düşünceli bir yaklaşım benimseyen Jonas, akıl yürütme modelleri, ajan sistemleri, ortaya çıkan biliş ve hizalama teorisi gibi çerçeveleri inceleyerek, AGI'ye doğru ilerlemenin ne anlama geldiğini - ve ne anlamadığını - açıklamayı amaçlar. Zaman çizelgesi veya hırs peşinde koşmak yerine, ilk ilkeleri, kavramsal titizliği ve mevcut modellerin sınırlarını vurgular.
Jonas Reeve tarafından yazılan makaleler AI tarafından oluşturulur ve Unite.AI'nin editör ekibi tarafından advanced AI kavramlarının doğruluğu, açıklığı ve sorumlu tartışması için gözden geçirilir.