Моделі та платформи ШІ

NVIDIA випускає відкриту модель розпізнавання голосу Nemotron 3 Diarization

mm
Додайте Unite.AI до бажаних джерел у Google

NVIDIA 23 вересня 2026 року випустила Nemotron 3 Diarization, відкриту модель розпізнавання голосу, яка визначає до восьми спікерів у живому або записаному аудіо, а Baseten оголосила про підтримку обслуговування в той же день з пресетами batch, streaming та diarized-transcription, які кожен працює на одному GPU RTX PRO 6000.

Розпізнавання голосу сегментує аудіопотік за часом, коли говорить кожен окремий спікер, виводить часові мітки для кожного голосу та присвоює кожному фрагменту послідовну мітку; у поєднанні з транскрипцією воно прив’язує розшифровані слова до особи, яка їх вимовила. Оголошення Baseten описує Nemotron 3 Diarization як відкриту сквозну модель, яка замінює звичний конвеєр сегментація‑плюс‑ембеддинг та його налаштування одним проходом, позначаючи спікерів з налаштовуваним інтервалом навіть до 320 мілісекунд.

Архітектура та профілі затримки

Згідно з карткою моделі NVIDIA, модель розроблена для визначення “хто говорив коли” у реальному аудіо, підтримує як потокове, так і офлайн‑висновування та готова до комерційного або некомерційного використання. Це енкодер Transformer з 100 мільйонами параметрів та 31 шаром, оснащений обертальними позиційними ембеддінгами. Вхідний 16 кГц одно-канальний аудіосигнал перетворюється у 10‑міллісекундні кадри мел‑спектрограм, зменшуються в 8 разів до частоти кадрів енкодера 80 мс, а шар Conv1D над енкодером підвищує роздільність прогнозів назад до 10‑міллісекундної вхідної роздільності. Модель виводить тензор ймовірностей активності для кожного спікера у формі T, 8, причому вісім каналів спікерів упорядковано за порядком першого появлення кожного спікера в аудіо.

Для потокового режиму модель використовує кеш спікерів у порядку прибуття (Arrival-Order Speaker Cache) та чергу FIFO, впроваджені у роботі NVIDIA Streaming Sortformer: кеш зберігає інформацію про спікерів з попередніх фрагментів, тому перший почутий голос зберігає свою мітку, а черга надає контекст останніх кадрів для кожного кроку обробки. Такий підхід не потребує ембеддингів чи кластеризації, і інференція по фрагментах не накладає фіксованих обмежень на тривалість аудіо.

Один контрольний пункт підтримує чотири рекомендовані конфігурації затримки: 0,32, 0,64 і 1,04 секунди, а також буфер вводу в 30,4 секунди у офлайн‑стилі. Картка визначає цю затримку як затримку буфера вводу — довжина фрагмента плюс правий контекст, помножені на 80 мс — і зазначає, що цифра не включає час обчислювальної обробки. Контрольний пункт може працювати з буфером навіть 80 мс, хоча 0,32 секунди є найнижчою рекомендованою конфігурацією, а роздільність вихідних кадрів налаштовується кратно 10 мс.

Зазначена точність та швидкість

Картка моделі NVIDIA повідомляє про рівень помилки діаризації, точність підрахунку спікерів та середню абсолютну помилку підрахунку спікерів щодо diar_streaming_sortformer_4spk-v2.1 базової лінії, з урахуванням накладаючогося мовлення та нульовим “collar” у всіх тестах, крім CALLHOME-Part2, який використовує 0,25‑секундний “collar”. На DIHARD III картка повідомляє про повний рівень помилки 12,73 при профілі 30,4 секунди та 13,55 при 0,32 секунди, у порівнянні з 19,09 та 19,85 для базової лінії. На одно‑канальних записах NOTSOFAR1 вона повідомляє 11,00 проти 30,49 при офлайн‑профілі; на AMI Test SDM — 11,14 проти 21,42; на AliMeeting Test Near — 6,40 проти 11,57; і на CALLHOME-Part2 — 9,10 проти 10,32. Картка зазначає, що її результати для AMI, AliMeeting та NOTSOFAR1 були обчислені з використанням етикеток примусового вирівнювання, і що результати, оцінені за різними референсними анотаціями, не є безпосередньо порівнянними.

Таблиця швидкості в картці повідомляє про прискорення у реальному часі (real‑time‑factor), визначене як загальна тривалість аудіо, поділена на загальний час обробки, у 1 340 у режимі eager та 4 385 у режимі compiled при розмірі пакету один на офлайн‑профілі, виміряно на RTX PRO 5000 з точністю BF16. При профілі 0,32 секунди відповідні показники становлять 12,5 та 54.

Baseten провела власну оцінку, також вимірюючи рівень помилки з урахуванням накладаючогося мовлення та без “collar”. Вона повідомляє про 9,8 % рівня помилки на AISHELL‑4 при профілі низької затримки у порівнянні з 27,2 % для Streaming Sortformer v2.1 і зазначає, що перехід від 30‑секундного офлайн‑профілю до 0,32‑секундного ультра‑низького профілю підвищує рівень помилки лише на один‑два пункту. Baseten повідомляє, що модель перевершила Meta Muse Voice Transcribe на всіх наборих даних, які вона тестувала, навіть у ультра‑низькій конфігурації, і програла лише pyannote community‑1 на AMI.

Дані для навчання та ліцензування

У картці моделі зазначено приблизно 10 000 годин реальних розмов (включаючи Fisher English, корпуси зустрічей AMI та ICSI, VoxConverse, AISHELL‑4, AliMeeting, третій конкурс DIHARD, CALLHOME, NOTSOFAR1, набори DISPLACE, ліцензовані записи David AI та псевдо‑маркірований підмножину YODAS‑v2) разом із 82 611 годинами багатоговорців‑міксів, змодельованих за допомогою інструментарію FastMSS з близько 28 000 годин записів одного спікера. Навчання ініціалізувалося з самонавчального контрольного пункту NEST і проходило на восьми вузлах, кожен з яких мав вісім GPU A100‑80GB, у два етапи: офлайн‑навчання на змодельованих даних, а потім тонке налаштування потокового режиму на комбінації реального та змодельованого аудіо. Використання моделі регулюється ліцензійною угодою OpenMDW License Agreement, версія 1.1.

Пресети обслуговування Baseten та ємність

Baseten надає модель через три пресети, кожен з яких працює на одному RTX PRO 6000 за CUDA‑graph‑рушієм, побудованому навколо потокової петлі NVIDIA NeMo, згідно its Model Library listing, де також зазначено, що модель є наступницею Streaming Sortformer v2.1. Пресет Batch Diarization — це HTTP‑кінцева точка для записаного аудіо, яка повертає репліки доповідачів із профілем затримки на запит. Streaming Diarization — це WebSocket‑кінцева точка для живого аудіо, яка передає ідентифікацію доповідачів протягом розмови без повторного кластеризування. Streaming Diarized Transcription поєднує діаризатор з моделлю розпізнавання мови NVIDIA Parakeet V2, системою з 600‑мільйонами параметрів, і повертає слова, позначені доповідачами, з часовими мітками, частковими результатами per‑speaker та позначками перекриття. Baseten зазначає, що цей пресет передає вектори активності per‑speaker безпосередньо у початкові шари кодувальника Parakeet, тому перекритий мовлення транскрибується в один прохід, а мітки доповідачів остаточно встановлюються при надходженні, і зафіксовані слова ніколи не змінюються.

Baseten повідомляє, що один RTX PRO 6000 підтримує понад 500 одночасних годинних потоків діаризації за профілем 1,04 секунди, 200 потоків за профілем 0,32 секунди та 190 годинних потоків, коли додається транскрипція, тоді як пресет batch обробляє 200 шести‑хвилинних аудіофайлів за хвилину. Використовуючи однакові файли та обладнання, Baseten зазначає, що його оптимізований пресет забезпечив приблизно в 1,35 рази вищу пропускну здатність batch у порівнянні з референтною конфігурацією NVIDIA, яку він тестував, під навантаженням, згенерованим k6, всередині кластера з одно‑потоковим контролем на неактивній репліці.

Baseten також зазначає, що сигнал активності per‑speaker моделі, відстежуваний у 10‑мілісекундних інтервалах, може керувати виявленням голосової активності, специфічним для доповідача визначенням кінця репліки, а також управлінням чергуванням та обробкою переривань, реагуючи приблизно за 300 міллісекунд у налаштуваннях ультра‑низької затримки.

Nemotron 3 Diarization доступний на Hugging Face у репозиторії nvidia/Nemotron-3-Diarization та в Model Library Baseten, з інтеграцією NeMo Framework v3.0 та підтримкою GPU NVIDIA Ampere, Ada Lovelace, Hopper і Blackwell.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.