Modely a platformy AI

NVIDIA uvádí otevřený váhový model řečnické diarizace Nemotron 3

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

NVIDIA 23. září 2026 představila Nemotron 3 Diarization, otevřený váhový model řečnické diarizace, který dokáže identifikovat až osm řečníků v živém nebo nahraném zvuku, a Baseten oznámil podporu obsluhy ve stejný den s přednastavenými režimy batch, streaming a diarizovaná transkripce, které každé běží na jednom GPU RTX PRO 6000.

Řečnická diarizace segmentuje zvukový proud podle toho, kdy každý odlišný řečník mluví, vypisuje časové značky pro každý hlas a přiřazuje každému úseku konzistentní štítek; ve spojení s transkripcí přiřazuje přepsaná slova osobě, která je vyslovila. oznámení Basetenu popisuje Nemotron 3 Diarization jako otevřený, end-to-end model, který nahrazuje běžný segmentačně‑embeddingový pipeline a jeho ladění jedním průchodem, označujícím řečníky v konfigurovatelném intervalu již od 320 milisekund.

Architektura a profily latence

Podle modelové karty NVIDIA je model navržen tak, aby určil “kdo mluvil kdy” ve skutečném zvuku, podporuje jak streaming, tak offline inferenci a je připraven k obchodnímu i nekomerčnímu použití. Jedná se o 100‑milionový parametr, 31‑vrstvý Transformer encoder s rotujícími pozičními embedováními. Příchozí 16 kHz jednorázový audio signál je převeden na 10‑milisekundové mel‑spektrální rámce, downsamplován faktorem osm na 80‑milisekundovou frekvenci enkodéru, a Conv1D vrstva nad enkodérem upsampluje predikce zpět na 10‑milisekundové vstupní rozlišení. Model výstupuje tenzor pravděpodobností aktivity na řečníka s tvarem T, 8 a jeho osm kanálů řečníka je uspořádáno podle prvního výskytu každého řečníka v audio.

Pro streaming model používá Arrival-Order Speaker Cache a FIFO frontu zavedenou v práci NVIDIA Streaming Sortformer: cache uchovává informace o řečnících z předchozích úseků, takže první slyšený hlas si zachová svůj štítek, zatímco fronta poskytuje kontext posledních rámců pro každý krok zpracování. Návrh nevyžaduje žádné embedování ani shlukování a chunkovaná inferenční metoda neklade žádné pevné omezení na délku zvuku.

Jedna kontrolní bod slouží čtyřem doporučeným konfiguracím latence: 0,32 s, 0,64 s a 1,04 s, plus offline‑stylový vstupní buffer 30,4 s. Karta definuje tuto latenci jako latenci vstupního bufferu — délka úseku plus pravý kontext, vynásobené 80 ms — a uvádí, že hodnota nezahrnuje čas výpočetního zpracování. Kontrolní bod může běžet s bufferem již od 80 ms, i když 0,32 s je nejnižší doporučená konfigurace, a rozlišení výstupních rámců je konfigurovatelné v násobcích 10 ms.

Uvedená přesnost a rychlost

Modelová karta NVIDIA uvádí míru chyby diarizace, přesnost počtu řečníků a střední absolutní chybu počtu řečníků vůči diar_streaming_sortformer_4spk-v2.1 základní linii, s zahrnutým překrývajícím se projevem a nulovým sekundovým okrajem u každého benchmarku kromě CALLHOME-Part2, který používá okraj 0,25 s. Na DIHARD III karta uvádí celkovou míru chyby 12,73 při profilu 30,4 s a 13,55 při 0,32 s, oproti 19,09 a 19,85 pro základní linii. Na jednorázových nahrávkách NOTSOFAR1 uvádí 11,00 versus 30,49 při offline profilu; na AMI Test SDM 11,14 versus 21,42; na AliMeeting Test Near 6,40 versus 11,57; a na CALLHOME-Part2 9,10 versus 10,32. Karta uvádí, že její skóre pro AMI, AliMeeting a NOTSOFAR1 byla vypočítána s referenčními štítky nuceného zarovnání a že výsledky hodnocené proti různým referenčním anotacím nejsou přímo srovnatelné.

Tabulka rychlosti v kartě uvádí zrychlení v reálném čase, definované jako celková délka audia dělená celkovým časem zpracování, 1 340 v režimu eager a 4 385 při kompilaci při velikosti batchu jedna na offline profilu, měřeno na RTX PRO 5000 s přesností BF16. U profilu 0,32 s jsou odpovídající hodnoty 12,5 a 54.

Baseten provedl vlastní hodnocení, také měřící míru chyby s zahrnutým překrývajícím se projevem a bez okraje. Udává míru chyby 9,8 % na AISHELL‑4 při profilu nízké latence oproti 27,2 % pro Streaming Sortformer v2.1 a uvádí, že přechod z 30‑sekundového offline profilu na ultra‑nízký profil 0,32 s zvýší míru chyby jen o jeden až dva body. Baseten uvádí, že model překonal Meta Muse Voice Transcribe na každém testovaném datasetu, i při ultra‑nízké konfiguraci, a prohrál proti pyannote community‑1 pouze na AMI.

Tréninková data a licence

Modelová karta uvádí přibližně 10 000 hodin skutečných konverzací (včetně Fisher English, korpusů setkání AMI a ICSI, VoxConverse, AISHELL‑4, AliMeeting, třetí výzvy DIHARD, CALLHOME, NOTSOFAR1, sad DISPLACE, licencovaných nahrávek David AI a pseudo‑označené podmnožiny YODAS‑v2) spolu s 82 611 hodinami více‑řečnických mixů simulovaných pomocí nástroje FastMSS z přibližně 28 000 hodin nahrávek jedné řečnické osoby. Trénink byl inicializován z NEST samoučícího se kontrolního bodu a probíhal na osmi uzlech po osm GPU A100‑80 GB ve dvou fázích: offline trénink na simulovaných datech, následovaný streamingovým doladěním na kombinaci reálných a simulovaných audio. Používání modelu je řízeno licenční smlouvou OpenMDW License Agreement, verze 1.1.

Přednastavení a kapacita služby Baseten

Baseten zpřístupňuje model prostřednictvím tří předvoleb, z nichž každá běží na jednom RTX PRO 6000 za CUDA‑graph enginem postaveným kolem smyčky streamingu NeMo od NVIDIA, podle seznamu v jeho Model Library, který také popisuje model jako nástupce Streaming Sortformer v2.1. Předvolba Batch Diarization je HTTP endpoint pro nahraný zvuk, který vrací řečové tahy s latencí na požadavek. Streaming Diarization je WebSocket endpoint pro živý zvuk, který přenáší identitu mluvčího během konverzace bez pře‑klastrování. Streaming Diarized Transcription spojuje diarizér s modelem rozpoznávání řeči Parakeet V2 od NVIDIA, systémem s 600 miliony parametrů, a vrací slova označená mluvčím s časovými značkami, částečnými výstupy pro každého mluvčího a příznaky překrytí. Baseten uvádí, že tato předvolba přivádí vektor aktivity na mluvčího přímo do počátečních enkodérových vrstev Parakeetu, takže překrytá řeč je přepsána v jediném průchodu, přičemž štítky mluvčích jsou konečné při příchodu a potvrzená slova nejsou nikdy revidována.

Baseten uvádí, že jeden RTX PRO 6000 zvládne více než 500 souběžných hodinových diarizačních streamů při profilu 1,04 s, 200 streamů při profilu 0,32 s a 190 hodinových streamů, když je přidána transkripce, zatímco předvolba batch zpracovává 200 šestiminutových zvukových souborů za minutu. Při použití identických souborů a hardwaru Baseten uvádí, že jeho optimalizovaná předvolba dosáhla přibližně 1,35‑násobně vyšší propustnosti batch než referenční nastavení NVIDIA, které testoval, při zátěži generované k6 uvnitř clusteru s jedním‑streamovým řízením na nečinné replice.

Baseten také uvádí, že signál aktivity na mluvčího, sledovaný v intervalech 10 ms, může řídit detekci hlasové aktivity, detekci konce řečového tahu specifickou pro mluvčího a řízení střídání řeči a přerušení, přičemž reaguje zhruba za 300 ms při nastaveních ultra‑nízké latence.

Nemotron 3 Diarization je k dispozici na Hugging Face v repozitáři nvidia/Nemotron-3-Diarization a v Model Library společnosti Baseten, s integrací NeMo Framework v3.0 a podporou GPU NVIDIA Ampere, Ada Lovelace, Hopper a Blackwell.

Jonas Reeve je analytikum generovaným pomocí AI ve společnosti Unite.AI, zaměřujícím se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojového učení. Jeho práce zkoumá, jak se učí, reasoning, paměť a abstrakce objevují v biologických i umělých systémech, a to tím, že spojuje moderní architektury AI s dlouholetými otázkami kognitivní vědy a filozofie mysli.
S konceptuálním a reflexivním přístupem Jonas zkoumá rámce, jako jsou modely uvažování, agentic systémy, emergentní kognice a teorie sladění, s cílem objasnit, co skutečně znamená pokrok směrem k AGI - a co ne. Místo toho, aby sledoval termíny nebo hype, zdůrazňuje první principy, konceptuální rigor a limity současných modelů.
Články napsané Jonasem Reeveem jsou generovány pomocí AI a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, jasnost a odpovědnou diskusi o pokročilých konceptech AI.