Modèles et plateformes d’IA

NVIDIA publie le modèle de locuteur à poids ouvert Nemotron 3 Diarization

mm
Ajouter Unite.AI à vos sources préférées sur Google

NVIDIA a publié le 23 septembre 2026 Nemotron 3 Diarization, un modèle de diarisation de locuteurs à poids ouvert qui identifie jusqu’à huit intervenants dans l’audio en direct ou enregistré, et Baseten a annoncé un support de service le même jour avec des préréglages batch, streaming et transcription diarisation, chacun fonctionnant sur un GPU RTX PRO 6000.

La diarisation de locuteurs segmente un flux audio en fonction du moment où chaque locuteur distinct parle, fournit les timings pour chaque voix et attribue à chaque segment une étiquette cohérente ; associée à la transcription, elle attribue les mots transcrits à la personne qui les a prononcés. l’annonce de Baseten décrit Nemotron 3 Diarization comme un modèle ouvert et de bout en bout qui remplace le pipeline habituel de segmentation + embedding ainsi que son réglage par un unique passage, étiquetant les locuteurs à un intervalle configurable aussi bas que 320 millisecondes.

Architecture et profils de latence

Selon la fiche technique de NVIDIA, le modèle est conçu pour déterminer “who spoke when” dans l’audio du monde réel, prend en charge à la fois le streaming et l’inférence hors ligne, et est prêt pour une utilisation commerciale ou non commerciale. Il s’agit d’un encodeur Transformer de 31 couches, comportant 100 million de paramètres, avec des Rotary Positional Embeddings. L’audio mono de 16 kHz entrant est converti en trames de mel‑spectrogramme de 10 millisecondes, sous‑échantillonné par un facteur de huit pour obtenir un taux de trame d’encodeur de 80 millisecondes, et une couche Conv1D au‑dessus de l’encodeur remonte les prédictions à la résolution d’entrée de 10 millisecondes. Le modèle produit un tenseur de probabilités d’activité par locuteur de forme T, 8, et ses huit canaux de locuteurs sont ordonnés selon l’arrivée première de chaque locuteur dans l’audio.

Pour le streaming, le modèle utilise le cache de locuteurs par ordre d’arrivée et la file FIFO introduits dans les travaux Streaming Sortformer de NVIDIA : le cache conserve les informations des locuteurs des segments précédents afin que la première voix entendue conserve son étiquette, tandis que la file fournit le contexte des trames récentes pour chaque étape de traitement. La conception ne nécessite ni embeddings ni regroupement, et l’inférence par segments n’impose aucune limite fixe à la durée de l’audio.

Un seul point de contrôle prend en charge quatre configurations de latence recommandées : 0.32, 0.64 et 1.04 secondes, ainsi qu’un tampon d’entrée de 30.4 secondes de type hors ligne. La fiche technique définit cette latence comme la latence du tampon d’entrée — durée du segment plus contexte droit, multipliée par 80 millisecondes — et précise que le chiffre exclut le temps de traitement computationnel. Le point de contrôle peut fonctionner avec un tampon aussi bas que 80 millisecondes, bien que 0.32 secondes soit la configuration la plus basse recommandée, et la résolution des trames de sortie est configurable par multiples de 10 millisecondes.

Exactitude et vitesse rapportées

Le modèle de la fiche technique de NVIDIA rapporte le taux d’erreur de diarisation, la précision du comptage des locuteurs et l’erreur absolue moyenne du comptage des locuteurs par rapport au diar_streaming_sortformer_4spk-v2.1 baseline, avec la parole chevauchante incluse et un collet de zéro seconde sur chaque benchmark sauf CALLHOME-Part2, qui utilise un collet de 0.25 seconde. Sur DIHARD III, la fiche indique un taux d’erreur complet de 12.73 pour le profil de 30.4 secondes et de 13.55 pour 0.32 secondes, contre 19.09 et 19.85 pour la référence. Sur les enregistrements mono‑canal NOTSOFAR1, elle indique 11.00 contre 30.49 pour le profil hors ligne ; sur AMI Test SDM, 11.14 contre 21.42 ; sur AliMeeting Test Near, 6.40 contre 11.57 ; et sur CALLHOME-Part2, 9.10 contre 10.32. La fiche précise que ses scores AMI, AliMeeting et NOTSOFAR1 ont été calculés avec des étiquettes de référence d’alignement forcé et que les résultats évalués contre des annotations de référence différentes ne sont pas directement comparables.

Un tableau de vitesse dans la fiche indique un gain de facteur temps réel, défini comme la durée totale de l’audio divisée par le temps total de traitement, de 1,340 en mode eager et 4,385 compilé avec une taille de lot de un sur le profil hors ligne, mesuré sur un RTX PRO 5000 en précision BF16. Sur le profil de 0.32‑seconde, les valeurs correspondantes sont 12.5 et 54.

Baseten a effectué sa propre évaluation, calculant également le taux d’erreur avec la parole chevauchante incluse et sans collet. Elle rapporte un taux d’erreur de 9.8 % sur AISHELL‑4 au profil à faible latence contre 27.2 % pour Streaming Sortformer v2.1, et indique que le passage du profil hors ligne de 30 secondes au profil ultra‑faible de 0.32 seconde n’augmente le taux d’erreur que d’un à deux points. Baseten rapporte que le modèle a surpassé Meta Muse Voice Transcribe sur chaque jeu de données testé, même avec la configuration ultra‑faible, et n’a perdu que face à pyannote community‑1 sur AMI.

Données d’entraînement et licence

La fiche technique indique environ 10,000 heures de conversations réelles (incluant Fisher English, les corpus de réunions AMI et ICSI, VoxConverse, AISHELL‑4, AliMeeting, le troisième défi DIHARD, CALLHOME, NOTSOFAR1, les ensembles DISPLACE, des enregistrements David AI sous licence, et un sous‑ensemble pseudo‑étiqueté YODAS‑v2) ainsi que 82,611 heures de mélanges multi‑locuteurs simulés avec l’outil FastMSS à partir d’environ 28,000 heures d’enregistrements mono‑locuteur. L’entraînement a démarré à partir d’un point de contrôle auto‑supervisé NEST et s’est déroulé sur huit nœuds de huit GPU A100‑80GB en deux étapes : entraînement hors ligne sur des données simulées, suivi d’un affinement en streaming sur une combinaison d’audio réel et simulé. L’utilisation du modèle est régie par l’OpenMDW License Agreement, version 1.1.

Préréglages de service Baseten et capacité

Baseten expose le modèle via trois préréglages, chacun fonctionnant sur un RTX PRO 6000 derrière un moteur CUDA‑graph construit autour de la boucle de streaming NeMo de NVIDIA, selon sa liste de la bibliothèque de modèles, qui décrit également le modèle comme le successeur du Streaming Sortformer v2.1. Le préréglage Batch Diarization est un point de terminaison HTTP pour l’audio enregistré qui renvoie les tours de parole avec un profil de latence par requête. Streaming Diarization est un point de terminaison WebSocket pour l’audio en direct qui maintient l’identité du locuteur tout au long d’une conversation sans reclustering. Streaming Diarized Transcription associe le diariseur au modèle de reconnaissance vocale Parakeet V2 de NVIDIA, un système de 600 millions de paramètres, et renvoie les mots étiquetés par locuteur avec leurs horodatages, les parties partielles par locuteur et les indicateurs de chevauchement. Baseten indique que ce préréglage alimente les vecteurs d’activité par locuteur directement dans les premières couches d’encodeur de Parakeet, de sorte que la parole chevauchée est transcrite en un seul passage, les étiquettes de locuteur étant finalisées à l’arrivée et les mots validés ne sont jamais révisés.

Baseten rapporte qu’un RTX PRO 6000 maintient plus de 500 flux de diarisation d’une heure en concurrence au profil de 1,04 seconde, 200 flux au profil de 0,32 seconde, et 190 flux d’une heure lorsque la transcription est ajoutée, tandis que le préréglage batch traite 200 fichiers audio de six minutes par minute. En utilisant des fichiers et du matériel identiques, Baseten indique que son préréglage optimisé a fourni un débit batch environ 1,35 fois supérieur à celui de la configuration de référence NVIDIA testée, sous charge générée par k6 à l’intérieur du cluster avec un contrôle d’un flux sur une réplique inactif.

Baseten précise également que le signal d’activité par locuteur du modèle, suivi par incréments de 10 millisecondes, peut piloter la détection d’activité vocale, la détection de fin de tour spécifique à chaque locuteur, ainsi que la gestion des tours de parole et des interruptions, en répondant en environ 300 millisecondes dans les réglages à ultra‑faible latence.

Nemotron 3 Diarization est disponible sur Hugging Face dans le dépôt nvidia/Nemotron-3-Diarization et dans la Bibliothèque de Modèles de Baseten, avec une intégration du cadre NeMo v3.0 et la prise en charge des GPU NVIDIA Ampere, Ada Lovelace, Hopper et Blackwell.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.