Modelos y plataformas de IA

NVIDIA lanza el modelo de altavoz de peso abierto Nemotron 3 Diarization

mm
Añade Unite.AI a tus fuentes preferidas en Google

NVIDIA, el 23 de septiembre de 2026, lanzó Nemotron 3 Diarization, un modelo de diarización de hablantes de peso abierto que identifica hasta ocho hablantes en audio en vivo o grabado, y Baseten anunció soporte de servicio el mismo día con preajustes de lote, transmisión y transcripción diarizada que se ejecutan cada uno en una GPU RTX PRO 6000.

La diarización de hablantes segmenta una corriente de audio según cuándo habla cada hablante distinto, genera marcas de tiempo para cada voz y asigna a cada tramo una etiqueta coherente; combinada con la transcripción, atribuye las palabras transcritas a la persona que las dijo. el anuncio de Baseten describe Nemotron 3 Diarization como un modelo abierto y de extremo a extremo que reemplaza la típica tubería de segmentación más incrustación y su ajuste con un solo paso, etiquetando a los hablantes a intervalos configurables de hasta cada 320 milisegundos.

Arquitectura y perfiles de latencia

Según la tarjeta de modelo de NVIDIA, el modelo está diseñado para determinar “quién habló cuándo” en audio del mundo real, admite tanto inferencia en streaming como offline, y está listo para uso comercial o no comercial. Es un codificador Transformer de 31 capas y 100 millones de parámetros con incrustaciones posicionales rotativas. El audio entrante de 16 kHz mono se convierte en tramas de mel‑espectrograma de 10 milisegundos, se reduce en una factor de ocho a una tasa de trama del codificador de 80 milisegundos, y una capa Conv1D sobre el codificador vuelve a muestrear las predicciones a la resolución de entrada de 10 milisegundos. El modelo produce un tensor de probabilidades de actividad por hablante con forma T, 8, y sus ocho canales de hablante se ordenan según la primera aparición de cada hablante en el audio.

Para streaming, el modelo utiliza la caché de hablantes por orden de llegada y la cola FIFO introducidas en el trabajo Streaming Sortformer de NVIDIA: la caché conserva la información del hablante de fragmentos anteriores de modo que la primera voz escuchada mantiene su etiqueta, mientras que la cola proporciona contexto de tramas recientes para cada paso de procesamiento. El diseño no requiere incrustaciones ni agrupamiento, y la inferencia por fragmentos no impone un límite fijo a la duración del audio.

Un único punto de control sirve cuatro configuraciones de latencia recomendadas: 0.32, 0.64 y 1.04 segundos, más un búfer de entrada de estilo offline de 30.4 segundos. La tarjeta define esta latencia como latencia del búfer de entrada — longitud del fragmento más contexto derecho, multiplicado por 80 milisegundos — y señala que la cifra excluye el tiempo de procesamiento computacional. El punto de control puede ejecutarse con un búfer de tan solo 80 milisegundos, aunque 0.32 segundos es la configuración recomendada más baja, y la resolución de trama de salida es configurable en múltiplos de 10 milisegundos.

Precisión y velocidad reportadas

La tarjeta de modelo de NVIDIA informa la tasa de error de diarización, la precisión del conteo de hablantes y el error absoluto medio del conteo de hablantes contra la diar_streaming_sortformer_4spk-v2.1 línea base, con habla superpuesta incluida y un margen de cero segundos en cada referencia salvo CALLHOME-Part2, que usa un margen de 0.25 segundos. En DIHARD III, la tarjeta informa una tasa de error de conjunto completo de 12.73 en el perfil de 30.4 segundos y 13.55 a 0.32 segundos, frente a 19.09 y 19.85 para la línea base. En grabaciones mono de NOTSOFAR1 informa 11.00 versus 30.49 en el perfil offline; en AMI Test SDM, 11.14 versus 21.42; en AliMeeting Test Near, 6.40 versus 11.57; y en CALLHOME-Part2, 9.10 versus 10.32. La tarjeta indica que sus puntuaciones en AMI, AliMeeting y NOTSOFAR1 se calcularon con etiquetas de referencia de alineación forzada y que los resultados puntuados contra diferentes anotaciones de referencia no son directamente comparables.

Una tabla de velocidad en la tarjeta informa una aceleración del factor de tiempo real, definida como la duración total del audio dividida por el tiempo total de procesamiento, de 1,340 en modo ansioso y 4,385 compilado con tamaño de lote uno en el perfil offline, medido en una RTX PRO 5000 con precisión BF16. En el perfil de 0.32 segundos, las cifras correspondientes son 12.5 y 54.

Baseten realizó su propia evaluación, también calculando la tasa de error con habla superpuesta incluida y sin margen. Informa una tasa de error del 9.8 % en AISHELL-4 en el perfil de baja latencia frente al 27.2 % de Streaming Sortformer v2.1, y dice que pasar del perfil offline de 30 segundos al perfil ultra‑bajo de 0.32 segundos aumenta la tasa de error solo en uno o dos puntos. Baseten informa que el modelo superó a Meta Muse Voice Transcribe en todos los conjuntos de datos que probó, incluso en la configuración ultra‑baja, y solo perdió frente a pyannote community-1 en AMI.

Datos de entrenamiento y licencia

La tarjeta de modelo enumera aproximadamente 10,000 horas de conversaciones reales (incluyendo Fisher English, los corpora de reuniones AMI e ICSI, VoxConverse, AISHELL-4, AliMeeting, el tercer desafío DIHARD, CALLHOME, NOTSOFAR1, los conjuntos DISPLACE, grabaciones licenciadas de David AI y un subconjunto pseudoetiquetado YODAS‑v2) junto a 82,611 horas de mezclas de múltiples hablantes simuladas con la herramienta FastMSS a partir de unas 28,000 horas de grabaciones de un solo hablante. El entrenamiento se inició a partir de un punto de control auto‑supervisado NEST y se ejecutó en ocho nodos de ocho GPU A100‑80GB en dos etapas: entrenamiento offline con datos simulados, seguido de ajuste fino en streaming con una combinación de audio real y simulado. El uso del modelo se rige por el Acuerdo de Licencia OpenMDW, versión 1.1.

Preajustes de servicio de Baseten y capacidad

Baseten expone el modelo a través de tres preajustes, cada uno ejecutándose en una RTX PRO 6000 detrás de un motor CUDA-graph construido alrededor del bucle de transmisión de NeMo de NVIDIA, según su listado de Model Library, que también describe el modelo como el sucesor de Streaming Sortformer v2.1. El preajuste Batch Diarization es un punto final HTTP para audio grabado que devuelve los turnos de los hablantes con un perfil de latencia por solicitud. Streaming Diarization es un punto final WebSocket para audio en vivo que transporta la identidad del hablante a lo largo de una conversación sin reclasificar. Streaming Diarized Transcription combina el diarizador con el modelo de reconocimiento de voz Parakeet V2 de NVIDIA, un sistema de 600 millones de parámetros, y devuelve palabras etiquetadas por hablante con marcas de tiempo, parciales por hablante y banderas de superposición. Baseten afirma que este preajuste alimenta los vectores de actividad por hablante directamente en las capas iniciales del codificador de Parakeet, de modo que el habla superpuesta se transcribe en una sola pasada, con las etiquetas de hablante finales al llegar y las palabras comprometidas nunca revisadas.

Baseten informa que una RTX PRO 6000 mantiene más de 500 flujos concurrentes de diarización de una hora de duración con el perfil de 1.04 segundos, 200 flujos con el perfil de 0.32 segundos y 190 flujos de una hora cuando se añade la transcripción, mientras que el preajuste por lotes procesa 200 archivos de audio de seis minutos por minuto. Utilizando archivos y hardware idénticos, Baseten informa que su preajuste optimizado entregó aproximadamente 1.35 veces mayor rendimiento por lotes que la configuración de referencia de NVIDIA que probó, bajo una carga generada por k6 dentro del clúster con un control de un solo flujo en una réplica inactiva.

Baseten también afirma que la señal de actividad por hablante del modelo, rastrada en incrementos de 10 milisegundos, puede impulsar la detección de actividad de voz, la detección de fin de turno específica de cada hablante y la gestión de toma de turnos e interrupciones, respondiendo en aproximadamente 300 milisegundos en configuraciones de latencia ultrabaja.

Nemotron 3 Diarization está disponible en Hugging Face bajo el repositorio nvidia/Nemotron-3-Diarization y en la Model Library de Baseten, con integración del NeMo Framework v3.0 y compatibilidad con GPUs NVIDIA Ampere, Ada Lovelace, Hopper y Blackwell.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en la inteligencia artificial cognitiva, la inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de la máquina. Su trabajo explora cómo surgen el aprendizaje, el razonamiento, la memoria y la abstracción en sistemas biológicos y artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas largamente debatidas en la ciencia cognitiva y la filosofía de la mente.
Con un enfoque conceptual y reflexivo, Jonas examina marcos como los modelos de razonamiento, los sistemas agénticos, la cognición emergente y la teoría de alineación, con el objetivo de aclarar qué significa realmente el progreso hacia la AGI —y qué no. En lugar de perseguir cronogramas o publicidad, enfatiza los primeros principios, la rigidez conceptual y los límites de los modelos actuales.
Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión, la claridad y la discusión responsable de conceptos de IA avanzados.