Μοντέλα και πλατφόρμες AI
Η NVIDIA κυκλοφορεί το μοντέλο ομιλητή ανοιχτού βάρους Nemotron 3 Diarization

Η NVIDIA στις 23 Σεπτεμβρίου 2026 κυκλοφόρησε το Nemotron 3 Diarization, ένα μοντέλο ανοιχτού βάρους για διαχωρισμό ομιλητών που αναγνωρίζει έως και οκτώ ομιλητές σε ζωντανό ή ηχογραφημένο ήχο, και η Baseten ανακοίνωσε υποστήριξη εξυπηρέτησης την ίδια ημέρα με προεπιλογές batch, streaming και diarized-transcription, καθεμία από τις οποίες εκτελείται σε μία GPU RTX PRO 6000.
Η διαχωρισμός ομιλητών (speaker diarization) χωρίζει ένα ηχητικό ρεύμα ανάλογα με το πότε κάθε ξεχωριστός ομιλητής μιλάει, εξάγει χρονικές σημάνσεις για κάθε φωνή και αναθέτει σε κάθε απόσπασμα μια συνεπή ετικέτα· σε συνδυασμό με τη μεταγραφή, αποδίδει τις μεταγραμμένες λέξεις στο άτομο που τις είπε. η ανακοίνωση της Baseten περιγράφει το Nemotron 3 Diarization ως ένα ανοιχτό, end-to-end μοντέλο που αντικαθιστά τη συνήθη pipeline segmentation-plus-embedding και η ρύθμισή του με μία μόνο διέλευση, ετικετοποιώντας τους ομιλητές σε διαμορφώσιμο διάστημα όσο χαμηλό όσο κάθε 320 χιλιοστά του δευτερολέπτου.
Αρχιτεκτονική και Προφίλ Καθυστέρησης
Σύμφωνα με η κάρτα μοντέλου της NVIDIA, το μοντέλο έχει σχεδιαστεί για να καθορίζει «ποιος μίλησε πότε» σε πραγματικό ήχο, υποστηρίζει τόσο streaming όσο και offline inference, και είναι έτοιμο για εμπορική ή μη εμπορική χρήση. Είναι ένας κωδικοποιητής Transformer 100‑εκατομμυρίων παραμέτρων, 31‑στρωματικός, με Rotary Positional Embeddings. Η εισερχόμενη μονοκάναλη ήχος 16 kHz μετατρέπεται σε καρέ mel‑spectrogram των 10 ms, υποβαθμίζεται κατά παράγοντα οκτώ σε ρυθμό κωδικοποιητή 80 ms, και ένα Conv1D στρώμα πάνω από τον κωδικοποιητή επαναδειγματοληπτεί τις προβλέψεις πίσω στην ανάλυση εισόδου των 10 ms. Το μοντέλο εξάγει ένα τανυστή με πιθανότητες δραστηριότητας ανά ομιλητή με σχήμα T, 8, και τα οχτώ κανάλια ομιλητών ταξινομούνται με βάση την πρώτη εμφάνιση του κάθε ομιλητή στο ηχητικό σήμα.
Για streaming, το μοντέλο χρησιμοποιεί το Arrival‑Order Speaker Cache και την ουρά FIFO που εισήχθησαν στην εργασία Streaming Sortformer της NVIDIA: η κρυφή μνήμη (cache) διατηρεί πληροφορίες ομιλητών από προηγούμενα τμήματα ώστε η πρώτη φωνή που ακούγεται να διατηρεί την ετικέτα της, ενώ η ουρά παρέχει πρόσφατο πλαίσιο καρέ για κάθε βήμα επεξεργασίας. Ο σχεδιασμός δεν απαιτεί embeddings ή clustering, και η επεξεργασία σε τμήματα δεν θέτει κανένα σταθερό όριο στη διάρκεια του ήχου.
Ένα μοναδικό checkpoint εξυπηρετεί τέσσερις προτεινόμενες ρυθμίσεις καθυστέρησης: 0,32 s, 0,64 s και 1,04 s, καθώς και ένα buffer εισόδου 30,4 s σε offline‑στυλ. Η κάρτα ορίζει αυτή τη καθυστέρηση ως καθυστέρηση buffer εισόδου — διάρκεια τμήματος συν δεξιό πλαίσιο, πολλαπλασιασμένο με 80 ms — και σημειώνει ότι το νούμερο δεν περιλαμβάνει τον χρόνο επεξεργασίας. Το checkpoint μπορεί να λειτουργήσει με buffer όσο χαμηλό και 80 ms, αν και 0,32 s είναι η χαμηλότερη προτεινόμενη ρύθμιση, και η ανάλυση εξόδου καρέ μπορεί να ρυθμιστεί σε πολλαπλάσια των 10 ms.
Αναφερόμενη Ακρίβεια και Ταχύτητα
Η κάρτα μοντέλου της NVIDIA αναφέρει το ποσοστό σφάλματος διαχωρισμού, την ακρίβεια μέτρησης ομιλητών και το μέσο απόλυτο σφάλμα μέτρησης ομιλητών σε σχέση με το diar_streaming_sortformer_4spk-v2.1 βάση, με συμπερίληψη επικαλυπτόμενης ομιλίας και μηδενικό περιθώριο (collar) σε κάθε benchmark εκτός από το CALLHOME‑Part2, που χρησιμοποιεί περιθώριο 0,25 s. Στο DIHARD III, η κάρτα αναφέρει ποσοστό σφάλματος πλήρους συνόλου 12,73 στο προφίλ 30,4 s και 13,55 στο 0,32 s, σε σύγκριση με 19,09 και 19,85 για τη βάση. Στις ηχογραφήσεις μονοκαναλικού τύπου NOTSOFAR1 αναφέρει 11,00 έναντι 30,49 στο offline προφίλ· στο AMI Test SDM, 11,14 έναντι 21,42· στο AliMeeting Test Near, 6,40 έναντι 11,57· και στο CALLHOME‑Part2, 9,10 έναντι 10,32. Η κάρτα δηλώνει ότι οι βαθμολογίες AMI, AliMeeting και NOTSOFAR1 υπολογίστηκαν με ετικέτες αναφοράς forced‑alignment και ότι τα αποτελέσματα που βαθμολογούνται έναντι διαφορετικών αναφορών δεν είναι άμεσα συγκρίσιμα.
Ένας πίνακας ταχύτητας στην κάρτα αναφέρει επιτάχυνση πραγματικού χρόνου (real‑time‑factor), ορισμένη ως η συνολική διάρκεια ήχου διαιρεμένη με το συνολικό χρόνο επεξεργασίας, 1 340 σε eager mode και 4 385 σε compiled με batch size 1 στο offline προφίλ, μετρημένο σε RTX PRO 5000 με ακρίβεια BF16. Στο προφίλ 0,32 s, οι αντίστοιχοι αριθμοί είναι 12,5 και 54.
Η Baseten διεξήγαγε τη δική της αξιολόγηση, καταγράφοντας επίσης ποσοστό σφάλματος με συμπερίληψη επικαλυπτόμενης ομιλίας και χωρίς περιθώριο. Αναφέρει ποσοστό σφάλματος 9,8 % στο AISHELL‑4 στο προφίλ χαμηλής καθυστέρησης, έναντι 27,2 % για το Streaming Sortformer v2.1, και δηλώνει ότι η μετάβαση από το 30‑δευτερόλεπτο offline προφίλ στο ultra‑low προφίλ 0,32 s αυξάνει το ποσοστό σφάλματος μόνο κατά ένα έως δύο σημεία. Η Baseten αναφέρει ότι το μοντέλο ξεπέρασε το Meta Muse Voice Transcribe σε κάθε σύνολο δεδομένων που δοκίμασε, ακόμη και στην ultra‑low ρύθμιση, και έχασε μόνο απέναντι στο pyannote community‑1 στο AMI.
Δεδομένα Εκπαίδευσης και Άδεια Χρήσης
Η κάρτα μοντέλου αναφέρει περίπου 10 000 ώρες πραγματικών συνομιλιών (συμπεριλαμβανομένων των Fisher English, των συνόλων συνάντησης AMI και ICSI, VoxConverse, AISHELL‑4, AliMeeting, της τρίτης πρόκλησης DIHARD, CALLHOME, NOTSOFAR1, των συνόλων DISPLACE, αδειοδοτημένων ηχογραφήσεων David AI, και ενός ψευδο‑ετικετοποιημένου υποσυνόλου YODAS‑v2) μαζί με 82 611 ώρες μιξαρισμάτων πολλαπλών ομιλητών που προσομοιώθηκαν με το FastMSS toolkit από περίπου 28 000 ώρες μονοφωνικών ηχογραφήσεων. Η εκπαίδευση ξεκίνησε από ένα checkpoint αυτο‑επιβλεπόμενο NEST και εκτελέστηκε σε οκτώ κόμβους με οκτώ GPU A100‑80GB σε δύο στάδια: offline εκπαίδευση σε προσομοιωμένα δεδομένα, ακολουθούμενη από fine‑tuning streaming σε συνδυασμό πραγματικού και προσομοιωμένου ήχου. Η χρήση του μοντέλου διέπεται από τη Συμφωνία Άδειας OpenMDW, έκδοση 1.1.
Προεπιλογές Εξυπηρέτησης Baseten και Χωρητικότητα
Η Baseten εκθέτει το μοντέλο μέσω τριών προεπιλογών, η καθεμία εκτελείται σε ένα RTX PRO 6000 πίσω από μια μηχανή CUDA-graph που έχει κατασκευαστεί γύρω από το streaming loop του NVIDIA NeMo, σύμφωνα με η καταχώριση του Model Library, η οποία επίσης περιγράφει το μοντέλο ως διάδοχο του Streaming Sortformer v2.1. Η προεπιλογή Batch Diarization είναι ένα HTTP endpoint για ηχογραφημένο ήχο που επιστρέφει τις αλλαγές ομιλητών με προφίλ καθυστέρησης ανά αίτηση. Η Streaming Diarization είναι ένα WebSocket endpoint για ζωντανό ήχο που μεταφέρει την ταυτότητα του ομιλητή κατά τη διάρκεια μιας συνομιλίας χωρίς επανακατηγοριοποίηση. Η Streaming Diarized Transcription συνδυάζει τον διαχωριστή με το μοντέλο αναγνώρισης ομιλίας Parakeet V2 της NVIDIA, ένα σύστημα με 600 εκατομμύρια παραμέτρους, και επιστρέφει λέξεις με ετικέτες ομιλητή και χρονικές σημάνσεις, μερικά τμήματα ανά ομιλητή και σημαίες επικάλυψης. Η Baseten δηλώνει ότι αυτή η προεπιλογή τροφοδοτεί διανύσματα δραστηριότητας ανά ομιλητή απευθείας στα αρχικά επίπεδα κωδικοποιητή του Parakeet, ώστε η επικάλυψη ομιλίας να μεταγραφεί σε μία μόνο διέλευση, με τις ετικέτες ομιλητών να τελειοποιούνται κατά την άφιξη και οι καταχωρημένες λέξεις να μην τροποποιούνται ποτέ.
Η Baseten αναφέρει ότι ένα RTX PRO 6000 διατηρεί περισσότερα από 500 ταυτόχρονες ροές διαλόγου διάρκειας μίας ώρας στο προφίλ των 1,04 δευτερολέπτων, 200 ροές στο προφίλ των 0,32 δευτερολέπτων, και 190 ροές μίας ώρας όταν προστίθεται η μεταγραφή, ενώ η προεπιλογή batch επεξεργάζεται 200 αρχεία ήχου έξι λεπτών ανά λεπτό. Χρησιμοποιώντας τα ίδια αρχεία και υλικό, η Baseten αναφέρει ότι η βελτιστοποιημένη προεπιλογή της παρείχε περίπου 1,35 φορές μεγαλύτερη απόδοση batch σε σύγκριση με τη ρύθμιση αναφοράς της NVIDIA που δοκίμασε, υπό φορτίο που δημιουργήθηκε από k6 μέσα στο σύμπλεγμα με έναν έλεγχο μίας ροής σε ένα ανενεργό αντίγραφο.
Η Baseten επίσης δηλώνει ότι το σήμα δραστηριότητας ανά ομιλητή του μοντέλου, που παρακολουθείται σε βήματα των 10 χιλιοστών του δευτερολέπτου, μπορεί να ενεργοποιήσει ανίχνευση φωνητικής δραστηριότητας, ανίχνευση λήξης σειράς για συγκεκριμένο ομιλητή, καθώς και διαχείριση λήψης σειράς και διακοπής, ανταποκρινόμενο σε περίπου 300 χιλιοστά του δευτερολέπτου σε ρυθμίσεις υπερ-χαμηλής καθυστέρησης.
Το Nemotron 3 Diarization είναι διαθέσιμο στο Hugging Face υπό το αποθετήριο nvidia/Nemotron-3-Diarization και στη Model Library της Baseten, με ενσωμάτωση του NeMo Framework v3.0 και υποστήριξη για GPU NVIDIA Ampere, Ada Lovelace, Hopper και Blackwell.












