Модели и платформы ИИ
NVIDIA выпускает открытый весовой спикерный модель диаризации Nemotron 3

23 сентября 2026 года NVIDIA выпустила Nemotron 3 Diarization — открытый весовой спикерный модель диаризации, способную определять до восьми говорящих в прямом эфире или записанном аудио, а Baseten объявила о поддержке обслуживания в тот же день с предустановками batch, streaming и diarized-transcription, каждая из которых работает на одном GPU RTX PRO 6000.
Диаризация говорящих сегментирует аудиопоток по времени, когда каждый отдельный говорящий говорит, выводит временные метки для каждого голоса и назначает каждому отрезку постоянную метку; в сочетании с транскрипцией она привязывает расшифрованные слова к человеку, который их произнёс. объявление Baseten описывает Nemotron 3 Diarization как открытую сквозную модель, заменяющую обычный конвейер сегментации‑плюс‑эмбеддингов и его настройку одним проходом, маркируя говорящих с настраиваемым интервалом вплоть до 320 миллисекунд.
Архитектура и профили задержки
Согласно карточке модели NVIDIA, модель разработана для определения «кто говорил когда» в реальном аудио, поддерживает как потоковое, так и офлайн‑вычисление и готова к коммерческому или некоммерческому использованию. Это энкодер Transformer с 100‑миллионами параметров и 31 слоем, использующий вращающиеся позиционные эмбеддинги. Входящий моно‑аудиосигнал 16 кГц преобразуется в кадры мел‑спектрограмм длительностью 10 мс, снижается в размере в восемь раз до частоты кадров энкодера 80 мс, а слой Conv1D над энкодером повышает разрешение предсказаний обратно до 10‑мс входного разрешения. Модель выводит тензор вероятностей активности по каждому говорящему с формой T × 8, и её восемь каналов говорящих упорядочены по порядку первого появления каждого говорящего в аудио.
Для потоковой обработки модель использует кэш говорящих по порядку прибытия (Arrival-Order Speaker Cache) и очередь FIFO, представленные в работе NVIDIA Streaming Sortformer: кэш сохраняет информацию о говорящих из предыдущих фрагментов, чтобы первый услышанный голос сохранял свою метку, а очередь предоставляет контекст последних кадров для каждого шага обработки. Дизайн не требует эмбеддингов или кластеризации, и фрагментированное инференс не накладывает фиксированного ограничения на длительность аудио.
Один чекпоинт обслуживает четыре рекомендованных конфигурации задержки: 0,32, 0,64 и 1,04 секунды, а также офлайн‑похожий входной буфер в 30,4 секунды. Карточка определяет эту задержку как задержку входного буфера — длина фрагмента плюс правый контекст, умноженные на 80 мс — и отмечает, что значение не включает время вычислительной обработки. Чекпоинт может работать с буфером минимум 80 мс, хотя 0,32 секунды является минимальной рекомендованной конфигурацией, а разрешение выходных кадров настраивается кратно 10 мс.
Сообщённая точность и скорость
В карточке модели NVIDIA указываются показатели ошибки диаризации, точности подсчёта говорящих и средней абсолютной ошибки подсчёта говорящих относительно diar_streaming_sortformer_4spk-v2.1 базовой линии, с включённой наложенной речью и нулевым «collar» на всех тестах, кроме CALLHOME-Part2, где используется 0,25‑секундный «collar». На DIHARD III карточка указывает полную ошибку набора 12,73 при профиле 30,4 секунды и 13,55 при 0,32 секунды, против 19,09 и 19,85 для базовой линии. На одно‑канальных записях NOTSOFAR1 она сообщает 11,00 против 30,49 при офлайн‑профиле; на AMI Test SDM — 11,14 против 21,42; на AliMeeting Test Near — 6,40 против 11,57; и на CALLHOME-Part2 — 9,10 против 10,32. Карточка отмечает, что её оценки AMI, AliMeeting и NOTSOFAR1 были вычислены с использованием эталонных меток принудительного выравнивания, и что результаты, оценённые по разным эталонным аннотациям, нельзя напрямую сравнивать.
Таблица скорости в карточке указывает ускорение в реальном времени (real‑time‑factor), определяемое как общее время аудио, делённое на общее время обработки, равное 1 340 в режиме eager и 4 385 в скомпилированном режиме при размере пакета один на офлайн‑профиле, измеренное на RTX PRO 5000 с точностью BF16. При профиле 0,32 секунды соответствующие показатели составляют 12,5 и 54.
Baseten провела собственную оценку, также измеряя ошибку с включённой наложенной речью и без «collar». Она сообщает ошибку 9,8 % на AISHELL‑4 при профиле низкой задержки против 27,2 % для Streaming Sortformer v2.1 и отмечает, что переход от 30‑секундного офлайн‑профиля к ультра‑низкому профилю 0,32 секунды повышает ошибку лишь на один‑два пункта. Baseten сообщает, что модель превзошла Meta Muse Voice Transcribe на каждом тестируемом наборе данных, даже при ультра‑низкой конфигурации, и уступила лишь pyannote community‑1 на AMI.
Данные обучения и лицензирование
В карточке модели указано примерно 10 000 часов реальных разговоров (включая Fisher English, корпусы встреч AMI и ICSI, VoxConverse, AISHELL‑4, AliMeeting, третий конкурс DIHARD, CALLHOME, NOTSOFAR1, наборы DISPLACE, лицензированные записи David AI и псевдо‑меточный подмножество YODAS‑v2) вместе с 82 611 часами многоговорящих миксов, смоделированных с помощью инструментария FastMSS из около 28 000 часов одно‑говорящих записей. Обучение начиналось с самоконтролируемого чекпоинта NEST и проводилось на восьми узлах по восемь GPU A100‑80 GB в два этапа: офлайн‑обучение на смоделированных данных, затем тонкая настройка потоковой обработки на комбинации реального и смоделированного аудио. Использование модели регулируется лицензионным соглашением OpenMDW License Agreement версии 1.1.
Предустановки обслуживания Baseten и ёмкость
Baseten предоставляет модель через три предустановки, каждая из которых работает на одном RTX PRO 6000 за CUDA‑graph‑движком, построенным вокруг потокового цикла NVIDIA NeMo, согласно его списку в Model Library, где также указано, что модель является преемником Streaming Sortformer v2.1. Предустановка Batch Diarization представляет собой HTTP‑конечную точку для записанного аудио, возвращающую реплики говорящих с профилем задержки для каждого запроса. Streaming Diarization — это WebSocket‑конечная точка для живого аудио, передающая идентичность говорящего в ходе разговора без повторного кластеризования. Streaming Diarized Transcription сочетает диаризатор с моделью распознавания речи NVIDIA Parakeet V2, системой из 600 млн параметров, и возвращает слова, помеченные говорящими, с тайм‑кодами, частичными результатами по каждому говорящему и флагами наложения. Baseten заявляет, что эта предустановка напрямую подаёт вектор активности каждого говорящего в начальные слои кодировщика Parakeet, благодаря чему наложенная речь транскрибируется за один проход, метки говорящих фиксируются по прибытии, а зафиксированные слова никогда не пересматриваются.
Baseten сообщает, что один RTX PRO 6000 поддерживает более 500 одновременных часовых потоков диаризации при профиле 1,04 секунды, 200 потоков при профиле 0,32 секунды и 190 часовых потоков, когда добавлена транскрипция, тогда как пакетная предустановка обрабатывает 200 шести‑минутных аудиофайлов в минуту. При использовании одинаковых файлов и оборудования Baseten отмечает, что его оптимизированная предустановка обеспечила примерно в 1,35 раза более высокий пакетный пропускной объём, чем эталонная конфигурация NVIDIA, протестированная им, при нагрузке, сгенерированной k6 внутри кластера, с однопоточным контролем на бездействующей реплике.
Baseten также утверждает, что сигнал активности каждого говорящего, отслеживаемый с шагом в 10 миллисекунд, может управлять детекцией голосовой активности, определением конца реплики конкретного говорящего и обработкой очередности и прерываний, реагируя примерно за 300 миллисекунд при настройках ультра‑низкой задержки.
Nemotron 3 Diarization доступен на Hugging Face в репозитории nvidia/Nemotron-3-Diarization и в Model Library Baseten, с интеграцией NeMo Framework v3.0 и поддержкой графических процессоров NVIDIA Ampere, Ada Lovelace, Hopper и Blackwell.












