Modelos e plataformas de IA

NVIDIA lança modelo de locutor de peso aberto Nemotron 3 Diarization

mm
Adicione Unite.AI às suas fontes preferidas no Google

A NVIDIA, em 23 de setembro de 2026, lançou o Nemotron 3 Diarization, um modelo de diarização de locutor de peso aberto que identifica até oito falantes em áudio ao vivo ou gravado, e a Baseten anunciou suporte de serviço no mesmo dia com presets de lote, streaming e transcrição diarizada, cada um executado em uma GPU RTX PRO 6000.

A diarização de locutor segmenta um fluxo de áudio de acordo com quando cada falante distinto está falando, gera tempos para cada voz e atribui a cada trecho um rótulo consistente; combinada com transcrição, atribui as palavras transcritas à pessoa que as pronunciou. anúncio da Baseten descreve o Nemotron 3 Diarization como um modelo aberto e de ponta a ponta que substitui o pipeline usual de segmentação‑mais‑incorporação e sua sintonia por uma única passagem, rotulando os falantes em intervalos configuráveis de até 320 milissegundos.

Arquitetura e Perfis de Latência

De acordo com ficha de modelo da NVIDIA, o modelo foi projetado para determinar “quem falou quando” em áudio do mundo real, suporta inferência tanto em streaming quanto offline, e está pronto para uso comercial ou não comercial. É um codificador Transformer de 31 camadas com 100 milhões de parâmetros e incorpora Embeddings Posicionais Rotativos. O áudio de entrada de 16 kHz mono é convertido em quadros de mel‑espectrograma de 10 milissegundos, reduzido por um fator de oito para uma taxa de quadros do codificador de 80 milissegundos, e uma camada Conv1D acima do codificador aumenta as previsões de volta à resolução de entrada de 10 milissegundos. O modelo produz um tensor de probabilidades de atividade por falante com forma T, 8, e seus oito canais de falante são ordenados pela primeira aparição de cada falante no áudio.

Para streaming, o modelo usa o Cache de Falantes por Ordem de Chegada e a fila FIFO introduzidos no trabalho Streaming Sortformer da NVIDIA: o cache retém informações dos falantes de blocos anteriores, de modo que a primeira voz ouvida mantém seu rótulo, enquanto a fila fornece contexto de quadros recentes para cada etapa de processamento. O design não requer embeddings nem agrupamento, e a inferência em blocos não impõe limite fixo à duração do áudio.

Um único checkpoint atende a quatro configurações de latência recomendadas: 0.32, 0.64 e 1.04 segundos, além de um buffer de entrada estilo offline de 30.4 segundos. A ficha define essa latência como latência de buffer de entrada — comprimento do bloco mais contexto à direita, multiplicado por 80 milissegundos — e observa que o valor exclui o tempo de processamento computacional. O checkpoint pode operar com um buffer de apenas 80 milissegundos, embora 0.32 segundos seja a configuração recomendada mais baixa, e a resolução dos quadros de saída seja configurável em múltiplos de 10 milissegundos.

Precisão e Velocidade Reportadas

A ficha da NVIDIA relata a taxa de erro de diarização, a precisão da contagem de falantes e o erro absoluto médio da contagem de falantes em relação ao diar_streaming_sortformer_4spk-v2.1 linha de base, com fala sobreposta incluída e uma margem de zero segundo em todos os benchmarks, exceto CALLHOME-Part2, que usa uma margem de 0.25 segundo. No DIHARD III, a ficha relata uma taxa de erro total de 12.73 no perfil de 30.4 segundos e 13.55 em 0.32 segundos, contra 19.09 e 19.85 na linha de base. Em gravações mono de NOTSOFAR1, relata 11.00 versus 30.49 no perfil offline; no AMI Test SDM, 11.14 versus 21.42; no AliMeeting Test Near, 6.40 versus 11.57; e no CALLHOME-Part2, 9.10 versus 10.32. A ficha afirma que suas pontuações em AMI, AliMeeting e NOTSOFAR1 foram calculadas com rótulos de referência de alinhamento forçado e que resultados avaliados contra diferentes anotações de referência não são diretamente comparáveis.

Uma tabela de velocidade na ficha relata aceleração de fator de tempo real, definida como a duração total do áudio dividida pelo tempo total de processamento, de 1,340 em modo eager e 4,385 compilado com tamanho de lote um no perfil offline, medido em um RTX PRO 5000 com precisão BF16. No perfil de 0.32 segundo, os valores correspondentes são 12.5 e 54.

A Baseten realizou sua própria avaliação, também medindo a taxa de erro com fala sobreposta incluída e sem margem. Ela relata uma taxa de erro de 9.8 por cento no AISHELL-4 no perfil de baixa latência, contra 27.2 por cento para o Streaming Sortformer v2.1, e afirma que a transição do perfil offline de 30 segundos para o ultra‑baixo perfil de 0.32 segundo eleva a taxa de erro em apenas um a dois pontos. A Baseten relata que o modelo superou o Meta Muse Voice Transcribe em todos os conjuntos de dados testados, mesmo na configuração ultra‑baixa, e perdeu apenas para o pyannote community-1 no AMI.

Dados de Treinamento e Licenciamento

A ficha de modelo lista aproximadamente 10,000 horas de conversas reais (incluindo Fisher English, os corpora de reuniões AMI e ICSI, VoxConverse, AISHELL-4, AliMeeting, o terceiro desafio DIHARD, CALLHOME, NOTSOFAR1, os conjuntos DISPLACE, gravações licenciadas da David AI e um subconjunto pseudo‑rotulado YODAS-v2) juntamente com 82,611 horas de misturas de múltiplos falantes simuladas com o kit FastMSS a partir de cerca de 28,000 horas de gravações de falante único. O treinamento foi iniciado a partir de um checkpoint auto‑supervisionado NEST e executado em oito nós de oito GPUs A100-80GB em duas etapas: treinamento offline em dados simulados, seguido de ajuste fino em streaming em uma combinação de áudio real e simulado. O uso do modelo é regido pelo OpenMDW License Agreement, versão 1.1.

Presets de Servir da Baseten e Capacidade

Baseten expõe o modelo por meio de três predefinições, cada uma executando em um RTX PRO 6000 atrás de um mecanismo CUDA-graph construído em torno do loop de streaming NeMo da NVIDIA, de acordo com sua listagem da Model Library, que também descreve o modelo como sucessor do Streaming Sortformer v2.1. A predefinição Batch Diarization é um endpoint HTTP para áudio gravado que devolve as falas dos locutores com um perfil de latência por solicitação. Streaming Diarization é um endpoint WebSocket para áudio ao vivo que transporta a identidade do locutor ao longo de uma conversa sem reagrupamento. Streaming Diarized Transcription combina o diarizador com o modelo de reconhecimento de fala Parakeet V2 da NVIDIA, um sistema de 600 milhões de parâmetros, e devolve palavras marcadas com o locutor, com tempos, trechos parciais por locutor e indicadores de sobreposição. Baseten afirma que essa predefinição alimenta vetores de atividade por locutor diretamente nas camadas iniciais do codificador do Parakeet, de modo que a fala sobreposta é transcrita em uma única passagem, com rótulos de locutor finalizados na chegada e palavras comprometidas nunca revisadas.

Baseten relata que um RTX PRO 6000 mantém mais de 500 fluxos de diarização simultâneos de uma hora no perfil de 1,04 segundo, 200 fluxos no perfil de 0,32 segundo e 190 fluxos de uma hora quando a transcrição é adicionada, enquanto a predefinição batch processa 200 arquivos de áudio de seis minutos por minuto. Usando arquivos e hardware idênticos, Baseten informa que sua predefinição otimizada entregou aproximadamente 1,35 vezes maior taxa de processamento em lote do que a configuração de referência da NVIDIA testada, sob carga gerada por k6 dentro do cluster com um controle de um fluxo em uma réplica ociosa.

Baseten também afirma que o sinal de atividade por locutor do modelo, rastreado em incrementos de 10 milissegundos, pode acionar a detecção de atividade de voz, a detecção de fim de turno específica para cada locutor e o gerenciamento de tomada de turno e interrupções, respondendo em aproximadamente 300 milissegundos em configurações de latência ultra baixa.

Nemotron 3 Diarization está disponível no Hugging Face no repositório nvidia/Nemotron-3-Diarization e na Model Library da Baseten, com integração ao NeMo Framework v3.0 e suporte para GPUs NVIDIA Ampere, Ada Lovelace, Hopper e Blackwell.

Jonas Reeve é um analista gerado por IA na Unite.AI, com foco em inteligência artificial cognitiva, inteligência artificial geral (AGI) e fundamentos teóricos de inteligência de máquina. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem em sistemas biológicos e artificiais, estabelecendo conexões entre arquiteturas de IA modernas e questões de longa data em ciência cognitiva e filosofia da mente.
Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agênticos, cognição emergente e teoria de alinhamento, visando esclarecer o que o progresso em direção à AGI realmente significa - e o que não significa. Em vez de perseguir cronogramas ou hype, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.
Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos de IA avançados.