AI 모델 및 플랫폼
NVIDIA, Nemotron 3 Diarization 오픈 가중치 스피커 모델 출시

NVIDIA는 2026년 9월 23일에 Nemotron 3 Diarization을 출시했으며, 이는 라이브 또는 녹음된 오디오에서 최대 8명의 화자를 식별하는 오픈 가중치 화자 구분 모델이며, Baseten은 배치, 스트리밍 및 화자 구분 전사 프리셋을 각각 RTX PRO 6000 GPU 하나에서 실행하는 당일 서비스 지원을 발표했습니다.
스피커 다이어리제이션은 각 화자가 말하는 시점을 기준으로 오디오 스트림을 구분하고, 각 음성의 타이밍을 출력하며, 모든 구간에 일관된 레이블을 할당합니다; 전사와 결합하면 전사된 단어를 해당 화자에게 귀속시킵니다. Baseten의 발표는 Nemotron 3 Diarization을 기존의 세그멘테이션‑임베딩 파이프라인과 튜닝을 단일 패스로 대체하는 오픈 엔드‑투‑엔드 모델이라고 설명하며, 화자를 320밀리초까지 짧은 간격으로 라벨링할 수 있다고 밝혔습니다.
아키텍처 및 지연 프로파일
NVIDIA의 모델 카드에 따르면, 이 모델은 실제 오디오에서 “who spoke when”를 판단하도록 설계되었으며, 스트리밍 및 오프라인 추론을 모두 지원하고, 상업적 또는 비상업적 사용이 가능합니다. 이 모델은 1억 개 파라미터, 31계층 Transformer 인코더에 Rotary Positional Embeddings를 적용했습니다. 들어오는 16 kHz 단일 채널 오디오는 10밀리초 멜 스펙트로그램 프레임으로 변환되고, 8배 다운샘플링되어 80밀리초 인코더 프레임 레이트가 됩니다. 인코더 위의 Conv1D 레이어가 예측을 다시 10밀리초 입력 해상도로 업샘플링합니다. 모델은 형태가 T×8인 화자별 활동 확률 텐서를 출력하며, 8개의 화자 채널은 각 화자의 첫 등장 순서에 따라 정렬됩니다.
스트리밍의 경우, 이 모델은 NVIDIA의 Streaming Sortformer 연구에서 도입된 Arrival-Order Speaker Cache와 FIFO 큐를 사용합니다: 캐시는 이전 청크의 화자 정보를 유지하여 처음 들은 목소리의 레이블을 유지하고, 큐는 각 처리 단계에 최신 프레임 컨텍스트를 제공합니다. 이 설계는 임베딩이나 클러스터링을 필요로 하지 않으며, 청크 기반 추론은 오디오 길이에 고정된 제한을 두지 않습니다.
단일 체크포인트는 0.32초, 0.64초, 1.04초의 세 가지 권장 지연 구성과 오프라인 스타일의 30.4초 입력 버퍼, 총 네 가지 구성을 제공합니다. 카드에서는 이 지연을 입력 버퍼 지연 — 청크 길이와 오른쪽 컨텍스트의 합에 80밀리초를 곱한 값 — 으로 정의하고, 이 수치는 계산 처리 시간을 제외한다고 명시합니다. 체크포인트는 최소 80밀리초 버퍼에서도 실행될 수 있지만, 0.32초가 가장 낮은 권장 구성이며, 출력 프레임 해상도는 10밀리초 단위로 조정 가능합니다.
보고된 정확도 및 속도
NVIDIA의 모델 카드는 다이어리제이션 오류율, 화자 수 정확도 및 화자 수 평균 절대 오차를 기준선에 대비하여 보고합니다. diar_streaming_sortformer_4spk-v2.1 기준선은 겹치는 발화를 포함하고 모든 벤치마크에 대해 0초 콜러를 적용했으며, CALLHOME-Part2만 0.25초 콜러를 사용합니다. DIHARD III에서는 30.4초 프로파일에서 전체 오류율이 12.73, 0.32초 프로파일에서 13.55로 보고되었으며, 기준선은 각각 19.09와 19.85였습니다. NOTSOFAR1 단일 채널 녹음에서는 오프라인 프로파일에서 11.00 대 30.49, AMI Test SDM에서는 11.14 대 21.42, AliMeeting Test Near에서는 6.40 대 11.57, CALLHOME-Part2에서는 9.10 대 10.32로 보고됩니다. 카드에서는 AMI, AliMeeting 및 NOTSOFAR1 점수가 강제 정렬 레퍼런스 레이블을 사용해 계산되었으며, 다른 레퍼런스 주석에 대해 채점된 결과는 직접 비교할 수 없다고 명시합니다.
카드의 속도 표는 실시간 계수(RTF) 가속도를 보고합니다. 이는 전체 오디오 길이를 전체 처리 시간으로 나눈 값으로, 오프라인 프로파일에서 배치 크기 1일 때 RTX PRO 5000 BF16 정밀도로 측정했을 때 eager 모드에서 1,340, 컴파일 모드에서 4,385로 나타났습니다. 0.32초 프로파일에서는 각각 12.5와 54의 값이 보고됩니다.
Baseten은 자체 평가를 수행했으며, 겹치는 발화를 포함하고 콜러 없이 오류율을 측정했습니다. 저지연 프로파일에서 AISHELL-4에 대한 오류율이 9.8%로, Streaming Sortformer v2.1의 27.2%에 비해 낮다고 보고했으며, 30초 오프라인 프로파일에서 0.32초 초저지연 프로파일로 전환해도 오류율이 1~2포인트만 상승한다고 밝혔습니다. Baseten은 모델이 테스트한 모든 데이터셋에서 Meta Muse Voice Transcribe보다 우수했으며, 초저지연 구성에서도 마찬가지였고, AMI에서만 pyannote community-1에 뒤졌다고 보고했습니다.
학습 데이터 및 라이선스
모델 카드는 약 10,000시간의 실제 대화(여기에는 Fisher English, AMI 및 ICSI 회의 코퍼스, VoxConverse, AISHELL-4, AliMeeting, 제3차 DIHARD 챌린지, CALLHOME, NOTSOFAR1, DISPLACE 세트, 라이선스된 David AI 녹음, 그리고 의사 라벨링된 YODAS‑v2 하위 집합이 포함됩니다)와 약 28,000시간의 단일 화자 녹음으로부터 FastMSS 툴킷을 사용해 시뮬레이션한 82,611시간의 다중 화자 혼합을 나열하고 있습니다. 학습은 NEST 자체 지도 체크포인트에서 초기화되어 8개의 노드, 각 노드에 8개의 A100‑80GB GPU를 사용해 두 단계로 진행되었습니다: 시뮬레이션 데이터에 대한 오프라인 학습, 이어서 실제와 시뮬레이션 오디오를 결합한 스트리밍 미세조정. 모델 사용은 OpenMDW License Agreement 버전 1.1에 의해 규정됩니다.
Baseten 서빙 프리셋 및 용량
Baseten은 세 가지 프리셋을 통해 모델을 노출하며, 각각은 NVIDIA의 NeMo 스트리밍 루프를 중심으로 구축된 CUDA-graph 엔진 뒤에서 RTX PRO 6000 하나씩을 사용합니다. 그 모델 라이브러리 목록에 따르면, 이 모델은 Streaming Sortformer v2.1의 후속 모델이라고도 설명됩니다. Batch Diarization 프리셋은 녹음된 오디오에 대한 HTTP 엔드포인트로, 요청당 지연 프로파일과 함께 화자 전환을 반환합니다. Streaming Diarization은 실시간 오디오용 WebSocket 엔드포인트로, 재클러스터링 없이 대화 중 화자 신원을 전달합니다. Streaming Diarized Transcription은 다이어라이저를 NVIDIA의 Parakeet V2 음성 인식 모델(6억 파라미터 시스템)과 결합하여 화자 태그가 달린 단어와 타이밍, 화자별 부분 결과, 겹침 플래그를 반환합니다. Baseten에 따르면 이 프리셋은 화자별 활동 벡터를 Parakeet의 초기 인코더 레이어에 직접 입력함으로써 겹치는 음성을 한 번에 전사하고, 화자 라벨은 도착 시 최종 확정되며, 커밋된 단어는 절대 수정되지 않는다고 합니다.
Baseten은 RTX PRO 6000 하나가 1.04초 프로파일에서는 500개 이상의 동시 1시간 길이 다이어리제이션 스트림을, 0.32초 프로파일에서는 200개 스트림을, 전사 기능이 추가될 경우 190개의 1시간 스트림을 지속할 수 있다고 보고했습니다. 배치 프리셋은 분당 6분 길이 오디오 파일 200개를 처리합니다. 동일한 파일과 하드웨어를 사용하여 Baseten은 최적화된 프리셋이 테스트한 NVIDIA 기준 설정보다 약 1.35배 높은 배치 처리량을 제공했다고 보고했으며, 이는 클러스터 내부에서 k6가 생성한 부하 하에 유휴 복제본에서 단일 스트림 제어와 함께 측정되었습니다.
Baseten은 또한 모델의 화자별 활동 신호가 10밀리초 간격으로 추적되어 음성 활동 감지, 화자별 발화 종료 감지, 발화 교대 및 중단 처리에 활용될 수 있으며, 초저지연 설정에서는 약 300밀리초 내에 응답한다고 밝혔습니다.
Nemotron 3 Diarization은 Hugging Face의 nvidia/Nemotron-3-Diarization 저장소와 Baseten의 Model Library에서 이용 가능하며, NeMo Framework v3.0 통합 및 NVIDIA Ampere, Ada Lovelace, Hopper, Blackwell GPU를 지원합니다.












