Modele i platformy AI

NVIDIA wypuszcza otwarto‑wagowy model rozpoznawania mówców Nemotron 3 Diarization

mm
Dodaj Unite.AI do preferowanych źródeł w Google

NVIDIA 23 września 2026 roku wydało model Nemotron 3 Diarization, otwarto‑wagowy model diarizacji mówców, który rozpoznaje do ośmiu mówców w dźwięku na żywo lub nagranym, a Baseten ogłosiło wsparcie serwowania tego samego dnia z presetami wsadowym, strumieniowym i transkrypcją diarizowaną, które każdy działa na jednej karcie graficznej RTX PRO 6000.

Diarizacja mówców segmentuje strumień audio w zależności od tego, który odrębny mówca mówi, podaje czasy dla każdego głosu i przypisuje każdemu fragmentowi spójną etykietę; w połączeniu z transkrypcją przypisuje przetłumaczone słowa do osoby, która je wypowiedziała. ogłoszenie Baseten opisuje Nemotron 3 Diarization jako otwarty, kompleksowy model, który zastępuje tradycyjny pipeline segmentacji‑plus‑osadzania i jego strojenie jedną przepustką, etykietując mówców w konfigurowalnym interwale już od 320 milisekund.

Architektura i profile opóźnień

Zgodnie z kartą modelu NVIDIA, model został zaprojektowany, aby określić „kto mówił kiedy” w rzeczywistym audio, obsługuje zarówno strumieniowe, jak i offline’owe wnioskowanie oraz jest gotowy do użytku komercyjnego i niekomercyjnego. Jest to enkoder Transformer o 100‑milionowych parametrach i 31 warstwach, wyposażony w obrotowe osadzenia pozycyjne. Przychodzące jednokanałowe audio 16 kHz jest konwertowane na ramki mel‑spektrogramu o długości 10 ms, downsamplowane o czynnik osmiu do częstotliwości ramki enkodera 80 ms, a warstwa Conv1D nad enkoderem podnosi prognozy z powrotem do rozdzielczości wejściowej 10 ms. Model zwraca tensor prawdopodobieństw aktywności per‑mówca o kształcie T, 8, a jego osiem kanałów mówcy są uporządkowane według pierwszego wystąpienia każdego mówcy w audio.

W trybie strumieniowym model wykorzystuje pamięć podręczną mówców w kolejności przybycia (Arrival‑Order Speaker Cache) oraz kolejkę FIFO wprowadzone w pracy NVIDIA Streaming Sortformer: pamięć zachowuje informacje o mówcach z wcześniejszych fragmentów, tak aby pierwszy usłyszany głos zachował swoją etykietę, natomiast kolejka zapewnia kontekst najnowszych ramek dla każdego kroku przetwarzania. Projekt nie wymaga osadzeń ani klasteryzacji, a wnioskowanie w fragmentach nie nakłada stałego limitu czasu trwania audio.

Jedno miejsce kontrolne obsługuje cztery zalecane konfiguracje opóźnień: 0,32 s, 0,64 s i 1,04 s, oraz bufor wejściowy w stylu offline trwający 30,4 s. Karta definiuje to opóźnienie jako opóźnienie bufora wejściowego — długość fragmentu plus prawy kontekst, pomnożone przez 80 ms — i zaznacza, że wartość nie obejmuje czasu przetwarzania obliczeniowego. Miejsce kontrolne może działać z buforem już od 80 ms, choć 0,32 s jest najniższą zalecaną konfiguracją, a rozdzielczość wyjściowych ramek jest konfigurowalna w wielokrotnościach 10 ms.

Zgłoszona dokładność i szybkość

Karta modelu NVIDIA podaje współczynnik błędu diarizacji, dokładność liczenia mówców oraz średni błąd bezwzględny liczenia mówców względem diar_streaming_sortformer_4spk-v2.1 bazowego, z uwzględnieniem nakładającej się mowy i zerowym marginesem czasowym we wszystkich benchmarkach z wyjątkiem CALLHOME-Part2, który używa marginesu 0,25 s. W DIHARD III karta podaje pełny współczynnik błędu 12,73 przy profilu 30,4 s i 13,55 przy 0,32 s, w porównaniu do 19,09 i 19,85 dla bazowego. W nagraniach jednokanałowych NOTSOFAR1 podaje 11,00 versus 30,49 przy profilu offline; w AMI Test SDM 11,14 versus 21,42; w AliMeeting Test Near 6,40 versus 11,57; oraz w CALLHOME-Part2 9,10 versus 10,32. Karta stwierdza, że wyniki dla AMI, AliMeeting i NOTSOFAR1 zostały obliczone przy użyciu etykiet referencyjnych wymuszonego wyrównania oraz że wyniki oceniane względem różnych adnotacji referencyjnych nie są bezpośrednio porównywalne.

Tabela prędkości w karcie podaje przyspieszenie w czasie rzeczywistym, definiowane jako całkowita długość audio podzielona przez całkowity czas przetwarzania, wynoszące 1 340 w trybie eager oraz 4 385 w trybie skompilowany przy rozmiarze wsadu równym jeden w profilu offline, zmierzone na RTX PRO 5000 przy precyzji BF16. Przy profilu 0,32 s odpowiednie wartości wynoszą 12,5 oraz 54.

Baseten przeprowadziło własną ocenę, również licząc współczynnik błędu z uwzględnieniem nakładającej się mowy i bez marginesu. Raportuje 9,8 % współczynnika błędu na AISHELL-4 przy profilu niskiego opóźnienia w porównaniu do 27,2 % dla Streaming Sortformer v2.1 i stwierdza, że przejście z 30‑sekundowego profilu offline do ultra‑niskiego profilu 0,32 s podnosi błąd tylko o jeden‑dwa punkty. Baseten podaje, że model przewyższył Meta Muse Voice Transcribe na każdym zestawie danych, który testował, nawet przy ultra‑niskiej konfiguracji, i przegrał z pyannote community‑1 jedynie na AMI.

Dane treningowe i licencjonowanie

Karta modelu wymienia około 10 000 godzin rzeczywistych rozmów (w tym Fisher English, korpusy spotkań AMI i ICSI, VoxConverse, AISHELL‑4, AliMeeting, trzecią edycję wyzwania DIHARD, CALLHOME, NOTSOFAR1, zestawy DISPLACE, licencjonowane nagrania David AI oraz pseudo‑oznaczony podzbiór YODAS‑v2) oraz 82 611 godzin mieszanek wielomówcowych symulowanych przy użyciu narzędzia FastMSS z około 28 000 godzin nagrań jednego mówcy. Trening rozpoczęto od samouczenia NEST checkpoint i przeprowadzono na ośmiu węzłach po osiem GPU A100‑80 GB w dwóch etapach: trening offline na danych symulowanych, po którym nastąpiło strojenie strumieniowe na kombinacji rzeczywistych i symulowanych nagrań audio. Korzystanie z modelu reguluje umowa OpenMDW License Agreement, wersja 1.1.

Presety serwowania Baseten i pojemność

Baseten udostępnia model poprzez trzy presety, każdy działający na jednym RTX PRO 6000 za silnikiem CUDA-graph zbudowanym wokół pętli strumieniowej NVIDIA NeMo, zgodnie z jego wpisem w Bibliotece Modeli, który opisuje model jako następcę Streaming Sortformer v2.1. Preset Batch Diarization to punkt końcowy HTTP dla nagranego dźwięku, który zwraca zmiany mówcy z profilem opóźnienia na żądanie. Streaming Diarization to punkt końcowy WebSocket dla dźwięku na żywo, który przenosi tożsamość mówcy w trakcie rozmowy bez ponownego grupowania. Streaming Diarized Transcription łączy diarizer z modelem rozpoznawania mowy NVIDIA Parakeet V2, systemem o 600 milionach parametrów, i zwraca słowa otagowane mówcą wraz z czasami, częściowymi wynikami per‑mówca oraz flagami nakładania się wypowiedzi. Baseten twierdzi, że ten preset wprowadza wektory aktywności per‑mówca bezpośrednio do początkowych warstw enkodera Parakeet, dzięki czemu nakładająca się mowa jest transkrybowana w jednym przebiegu, a etykiety mówców są ostateczne po przybyciu, a zatwierdzone słowa nigdy nie są modyfikowane.

Baseten podaje, że jeden RTX PRO 6000 utrzymuje ponad 500 równoczesnych, godzinnych strumieni diarizacji przy profilu 1,04 s, 200 strumieni przy profilu 0,32 s oraz 190 godzinnych strumieni, gdy dodana jest transkrypcja, podczas gdy preset batch przetwarza 200 sześciominutowych plików audio na minutę. Korzystając z identycznych plików i sprzętu, Baseten informuje, że jego zoptymalizowany preset zapewnił około 1,35‑krotnie wyższą przepustowość wsadową niż testowane odniesienie NVIDIA, pod obciążeniem generowanym przez k6 w klastrze z jednowątkową kontrolą na nieaktywnym replikacie.

Baseten dodaje, że sygnał aktywności per‑mówca modelu, śledzony w interwałach 10 ms, może sterować wykrywaniem aktywności głosu, specyficznym dla mówcy wykrywaniem końca wypowiedzi oraz obsługą przejmowania i przerywania, reagując w przybliżeniu 300 ms przy ustawieniach ultra‑niskiego opóźnienia.

Nemotron 3 Diarization jest dostępny na Hugging Face w repozytorium nvidia/Nemotron-3-Diarization oraz w Bibliotece Modeli Baseten, z integracją NeMo Framework v3.0 i wsparciem dla GPU NVIDIA Ampere, Ada Lovelace, Hopper i Blackwell.

Jonas Reeve jest analitykiem wygenerowanym przez AI w Unite.AI, specjalizującym się w sztucznej inteligencji kognitywnej, ogólnej inteligencji sztucznej (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja pojawiają się w systemach biologicznych i sztucznych, nawiązując połączenia między nowoczesnymi architekturami AI a długotrwałymi pytaniami w nauce o poznaniu i filozofii umysłu.
Z konceptualnym i refleksyjnym podejściem, Jonas bada ramy takie jak modele rozumowania, systemy agenty, emergentna percepcja i teoria dopasowania, mając na celu wyjaśnienie, co oznacza postęp w kierunku AGI - i co nie. Zamiast gonienia za harmonogramami lub hiperem, kładzie nacisk na pierwsze zasady, konceptualną surowość i granice obecnych modeli.
Artykuły napisane przez Jonasa Reeve są wygenerowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, klarowność i odpowiedzialną dyskusję zaawansowanych pojęć AI.