AI-mallit ja alustat

NVIDIA julkaisee Nemotron 3 Diarization avoimen painomallin puheentunnistukseen

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

NVIDIA julkaisi 23. syyskuuta 2026 Nemotron 3 Diarization -mallin, avoimen painomallin puheentunnistuksen diarisaatiomallin, joka tunnistaa enintään kahdeksan puhujaa live- tai tallennetussa äänessä, ja Baseten ilmoitti samana päivänä tarjoavansa palvelutuki erä-, suoratoisto- ja diarisoitu transkriptio -esiasetuksilla, jotka kaikki toimivat yhdellä RTX PRO 6000 GPU:lla.

Puhujan diarisaatio jakaa äänivirran sen mukaan, milloin kukin erillinen puhuja puhuu, tuottaa aikaleimat jokaiselle äänelle ja antaa jokaiselle jaksolle yhtenäisen tunnisteen; yhdessä transkription kanssa se liittää transkriboidut sanat siihen henkilöön, joka ne sanoi. Basetenin ilmoitus kuvaa Nemotron 3 Diarization -mallin avoimeksi, end-to-end -malliksi, joka korvaa tavanomaisen segmentointi‑plus‑upotusputken ja sen hienosäädön yhdellä läpikäynnillä, merkitsemällä puhujat säädettävällä aikavälillä, joka voi olla jopa 320 millisekuntia.

Arkkitehtuuri ja latenssiprofiilit

NVIDIAn mallikortin mukaan, NVIDIAn mallikortti, malli on suunniteltu määrittämään kuka puhui milloin todellisessa äänessä, tukee sekä suoratoisto- että offline-päätelmiä, ja on valmis kaupalliseen tai ei‑kaupalliseen käyttöön. Se on 100 miljoonaa parametria sisältävä, 31‑kerroksinen Transformer‑enkooderi, jossa on Rotary Positional Embeddings. Saapuva 16 kHz yksikanavainen ääni muunnetaan 10 millisekunnin mel‑spectrogrammi‑kehyksiksi, jotka alennetaan kahdeksankertaisesti 80 millisekunnin enkooderikehysnopeudeksi, ja enkooderin yläpuolella oleva Conv1D‑kerros interpoloi ennusteet takaisin 10 millisekunnin syöte‑resoluutiolle. Malli tuottaa tensoria, jossa on puheentunnistajien aktiviteettitodennäköisyydet, muotoa T × 8, ja sen kahdeksan puhuja‑kanavaa on järjestetty kunkin puhujan ensimmäisen ilmestymisen mukaan äänitiedostossa.

Suoratoistossa malli käyttää Arrival-Order Speaker Cache -välimuistia ja FIFO‑jonoa, jotka esiteltiin NVIDIAn Streaming Sortformer -tutkimuksessa: välimuisti säilyttää puhujan tiedot aikaisemmista paloista, jolloin ensimmäinen kuultu ääni säilyttää tunnisteensa, kun taas jono tarjoaa viimeaikaisen kehyksen kontekstin jokaiselle käsittelyvaiheelle. Suunnittelu ei vaadi upotuksia tai ryhmittelyä, ja paloitetussa päätelmässä ei ole kiinteää rajoitusta äänikeston pituudelle.

Yksi tarkistuspiste palvelee neljää suositeltua latenssikonfiguraatiota: 0,32 s, 0,64 s ja 1,04 s, sekä offline‑tyylinen 30,4 s:n syötepuskurin. Kortti määrittelee tämän latenssin syötepuskuri‑latenssiksi — paloituksen pituus plus oikea konteksti, kerrottuna 80 millisekunnilla — ja huomauttaa, että luku ei sisällä laskennallista käsittelyaikaa. Tarkistuspiste voi toimia puskurilla, jonka koko on vain 80 millisekuntia, vaikka 0,32 s on alhaisin suositeltu konfiguraatio, ja lähtökehyksen resoluutio on säädettävissä 10 millisekunnin moninkertaisina.

Ilmoitettu tarkkuus ja nopeus

NVIDIAn mallikortti raportoi diarisaatiovirheraten, puhujamäärityksen tarkkuuden ja puhujamäärityksen keskimääräisen absoluuttisen virheen verrattuna diar_streaming_sortformer_4spk-v2.1 perusvertailuun, sisältäen päällekkäisen puheen ja nollasekun kollaarin jokaisessa vertailussa paitsi CALLHOME-Part2:ssa, jossa käytetään 0,25 s:n kollaaria. DIHARD III:ssä kortti raportoi täyden joukon virherateiksi 12,73 30,4 s‑profiilissa ja 13,55 0,32 s‑profiilissa, verrattuna perusvertailun 19,09 ja 19,85 arvoihin. NOTSOFAR1:n yksikanavaisissa tallenteissa se raportoi 11,00 versus 30,49 offline‑profiilissa; AMI Test SDM:ssä 11,14 versus 21,42; AliMeeting Test Near:ssa 6,40 versus 11,57; ja CALLHOME-Part2:ssa 9,10 versus 10,32. Kortti toteaa, että sen AMI-, AliMeeting- ja NOTSOFAR1‑tulokset laskettiin pakotetun kohdistuksen referenssimerkintöjen avulla, eikä eri referenssianotaatioilla arvioituja tuloksia ole suoraan verrattavissa.

Kortin nopeustaulukko raportoi reaaliaikakerroinnopeutuksen, joka määritellään kokonaisäänen keston ja kokonaiskäsittelyajan suhteena, arvoksi 1 340 innokkaassa tilassa ja 4 385 koottuna eräkoon yksi offline‑profiilissa, mitattuna RTX PRO 5000:lla BF16‑tarkkuudella. 0,32 s‑profiilissa vastaavat luvut ovat 12,5 ja 54.

Baseten suoritti oman arviointinsa, jossa myös mitattiin virherataa päällekkäisellä puheella ja ilman kollaaria. Se raportoi 9,8 % virherataa AISHELL-4:ssä alhaisen latenssiprofiilin aikana verrattuna 27,2 %:iin Streaming Sortformer v2.1:ssä, ja toteaa, että siirtyminen 30 s offline‑profiilista 0,32 s ultra‑alhaiseen profiiliin nostaa virherataa vain yhdellä‑kaksi prosenttiyksikköä. Baseten raportoi mallin ylittävän Meta Muse Voice Transcribe:n kaikilla testatuilla tietoaineistoilla, jopa ultra‑alhaisessa konfiguraatiossa, ja häviävän vain pyannote community-1:lle AMI:ssa.

Koulutusdata ja lisensointi

Mallikortti luettelee noin 10 000 tuntia todellisia keskusteluja (mukaan lukien Fisher English, AMI- ja ICSI‑kokouskorpukset, VoxConverse, AISHELL-4, AliMeeting, kolmas DIHARD‑haaste, CALLHOME, NOTSOFAR1, DISPLACE‑sarjat, lisensoidut David AI -tallenteet ja pseudo‑merkitty YODAS‑v2‑alijoukko) yhdessä 82 611 tunnin monipuheisten sekoitusten kanssa, jotka on simuloitu FastMSS‑työkalupaketilla noin 28 000 tunnin yksipuheisten tallenteiden perusteella. Koulutus aloitettiin NEST‑itsesupervisoidusta tarkistuspisteestä ja suoritettiin kahdeksalla solmulla, joilla kullakin oli kahdeksan A100‑80 GB‑GPU:ta kahdessa vaiheessa: offline‑koulutus simuloidulla datalla, jonka jälkeen suoratoiston hienosäätö tehtiin todellisen ja simuloidun äänen yhdistelmällä. Mallin käyttöä ohjaa OpenMDW‑lisenssisopimus, versio 1.1.

Baseten‑palvelun esiasetukset ja kapasiteetti

Baseten tarjoaa mallin kolmessa esiasetuksessa, joista kukin toimii yhdellä RTX PRO 6000:lla CUDA-graafimoottorin takana, joka on rakennettu NVIDIA:n NeMo‑suoratoisto‑silmukan ympärille, sen Mallikirjaston luettelossa kerrottujen tietojen mukaan, jossa malli kuvataan Streaming Sortformer v2.1:n seuraajaksi. Batch‑Diarization‑esiasetus on HTTP‑päätepiste tallennetulle äänelle, joka palauttaa puheenvuorot pyyntökohtaisella viiveprofiililla. Streaming Diarization on WebSocket‑päätepiste live‑äänelle, joka siirtää puheentunnistuksen keskustelun aikana ilman uudelleenyhdistämistä. Streaming Diarized Transcription yhdistää diarisaattorin NVIDIA:n Parakeet V2 -puheentunnistusmalliin, 600 miljoonan parametrin järjestelmään, ja palauttaa puheentunnistetut sanat aikaleimoilla, puhekohtaisten osien kanssa sekä päällekkäisyysliput. Baseten kertoo, että tämä esiasetus syöttää puheentunnistuksen per‑puheentunnistustoimintavektorit suoraan Parakeetin alku‑enkoodauskerroksiin, jolloin päällekkäistä puhetta transkriboidaan yhdellä läpikäynnillä, puheentunnisteet vahvistetaan saapumisen yhteydessä ja vahvistetut sanat eivät koskaan muutu.

Baseten raportoi, että yksi RTX PRO 6000 pystyy ylläpitämään yli 500 samanaikaista tunnin mittaista diarisaatiovirtaa 1,04 sekunnin profiililla, 200 virtaa 0,32 sekunnin profiililla ja 190 tunnin mittaista virtaa, kun transkriptio lisätään, kun taas erä‑esiasetus käsittelee 200 kuusiminuuttista äänitiedostoa minuutissa. Käyttäen identtisiä tiedostoja ja laitteistoa, Baseten ilmoitti, että sen optimoitu esiasetus tuotti noin 1,35‑kertaisesti suuremman erä‑läpäisyn kuin NVIDIA:n referenssiasetelma, jonka se testasi k6‑luodulla kuormituksella klusterissa yhden‑virtaisen ohjauksella idle‑replikassa.

Baseten sanoo myös, että mallin per‑puheentunnistustoimintasignaali, jota seurataan 10 millisekunnin välein, voi ohjata puheaktiivisuuden havaitsemista, puhekohtaista vuoronlopetuksen tunnistusta sekä vuoronvaihdon ja keskeytysten käsittelyä, vastaten noin 300 millisekunnissa ultra‑alhaisen latenssin asetuksilla.

Nemotron 3 Diarization on saatavilla Hugging Facessa repositoriona nvidia/Nemotron-3-Diarization ja Basetenin Mallikirjastossa, NeMo‑Framework v3.0 -integraatiolla ja tuella NVIDIA:n Ampere-, Ada Lovelace-, Hopper- ja Blackwell‑GPU:ille.

Jonas Reeve on tekoälyanalyytikko Unite.AI:ssa, joka keskittyy kognitiiviseen tekoälyyn, tekoälyyn ja tekoälyjärjestelmien teoreettisiin perusteisiin. Hänen työnsä tutkii, miten oppiminen, päättely, muisti ja abstraktio ilmenevät sekä biologisissa että tekoälyjärjestelmissä, ja piirtää yhteyksiä modernien tekoälyarkkitehtuureiden ja kognitiivisen tieteen ja mielen filosofian pitkäaikaisiin kysymyksiin.
Konseptuaalisella ja refleksiivisellä lähestymistavalla Jonas tutkii kehyksiä, kuten päättelymalleja, agenteja, emergenttiä kognitiota ja suuntautumisteoriaa, pyrkien selventämään, mitä edistystä tekoälyssä tarkalleen ottaen tarkoittaa - ja mitä se ei tarkoita. Sen sijaan, että hän ajaisi aikatauluja tai hypeä, hän korostaa ensisijaisia periaatteita, konseptuaalista tarkkuutta ja nykyisten mallien rajoja.
Jonas Reeven kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimituksen tarkastamia, jotta varmistetaan ettei artikkeleissa käsitellä tekoälykonsepteja epätarkasti tai vastuuttomasti.