AI 模型与平台

NVIDIA发布Nemotron 3 Diarization开源权重说话人模型

mm
将 Unite.AI 添加到您在 Google 上的首选来源

NVIDIA于2026年9月23日发布了Nemotron 3 Diarization,这是一款开源权重的说话人分段模型,能够在实时或录制音频中识别最多八位说话者,Baseten宣布同日提供服务支持,提供批处理、流式和带分段转录的预设,每个预设均运行在一块RTX PRO 6000 GPU上。

说话人分段通过每位不同说话者的发言时间来划分音频流,输出每段语音的时间戳,并为每个片段分配一致的标签;与转录配合时,它将转录的文字归属到说话者。Baseten的公告将Nemotron 3 Diarization描述为一种开源、端到端的模型,取代了常规的分段加嵌入流水线及其调优,仅通过一次前向即可在可配置的间隔(最低可达320毫秒)标记说话者。

架构与延迟配置

根据NVIDIA的模型卡,该模型旨在确定真实音频中“谁在何时说话”,支持流式和离线推理,并可用于商业或非商业用途。它是一个拥有1亿参数、31层的Transformer编码器,采用旋转位置嵌入。输入的16 kHz单声道音频被转换为10毫秒的梅尔频谱帧,并以八倍下采样至80毫秒的编码器帧率,编码器上方的Conv1D层将预测上采样回10毫秒的输入分辨率。模型输出形状为T×8的每个说话者活动概率张量,其八个说话者通道按每位说话者首次出现的顺序排列。

在流式模式下,模型使用NVIDIA的Streaming Sortformer工作中引入的到达顺序说话人缓存和FIFO队列:缓存保留来自先前音块的说话人信息,使首次听到的声音保持其标签,而队列为每个处理步骤提供最近的帧上下文。该设计无需嵌入或聚类,分块推理对音频时长没有固定限制。

单个检查点提供四种推荐的延迟配置:0.32、0.64和1.04秒,以及离线式的30.4秒输入缓冲。文档将此延迟定义为输入缓冲延迟——音块长度加右侧上下文,乘以80毫秒——并指出该数值不包括计算处理时间。检查点可在最低80毫秒的缓冲下运行,尽管0.32秒是最低推荐配置,且输出帧分辨率可按10毫秒的倍数进行配置。

报告的准确性与速度

NVIDIA的模型卡报告了分段错误率、说话人数计数准确率以及说话人数计数的平均绝对误差,与 diar_streaming_sortformer_4spk-v2.1 基线在包括重叠语音且对每个基准使用零秒宽容区的情况下(除CALLHOME-Part2使用0.25秒宽容区外)。在DIHARD III上,文档报告在30.4秒配置下的全套错误率为12.73,0.32秒配置下为13.55,而基线分别为19.09和19.85。对NOTSOFAR1单声道录音,离线配置下报告为11.00,对比基线的30.49;在AMI Test SDM上为11.14,对比21.42;在AliMeeting Test Near上为6.40,对比11.57;在CALLHOME-Part2上为9.10,对比10.32。文档说明其AMI、AliMeeting和NOTSOFAR1的得分是使用强制对齐参考标签计算的,且针对不同参考注释的结果不可直接比较。

文档中的速度表报告了实时因子加速率(定义为音频总时长除以总处理时间),在离线配置下批大小为1时,急切模式下为1,340,编译模式下为4,385,测量平台为使用BF16精度的RTX PRO 5000。在0.32秒配置下,相应的数值为12.5和54。

Baseten自行进行评估,同样在包含重叠语音且无宽容区的情况下计算错误率。其报告在低延迟配置下,AISHELL-4的错误率为9.8%,而Streaming Sortformer v2.1为27.2%。并指出从30秒离线配置切换到0.32秒超低配置,仅使错误率上升一到两个百分点。Baseten报告该模型在其测试的所有数据集上均优于Meta Muse Voice Transcribe,即使在超低配置下亦然,仅在AMI上略逊于pyannote community-1。

训练数据与许可

模型卡列出了约10,000小时的真实对话(包括Fisher English、AMI和ICSI会议语料库、VoxConverse、AISHELL-4、AliMeeting、第三届DIHARD挑战、CALLHOME、NOTSOFAR1、DISPLACE集合、授权的David AI录音以及伪标记的YODAS-v2子集),以及通过FastMSS工具包从约28,000小时的单说话人录音模拟得到的82,611小时的多说话人混音。训练从NEST自监督检查点初始化,在八台配备八块A100-80GB GPU的节点上进行两阶段训练:先在模拟数据上进行离线训练,然后在真实与模拟音频的组合上进行流式微调。模型的使用受OpenMDW License Agreement第1.1版的约束。

Baseten服务预设与容量

Baseten 通过三种预设公开模型,每种预设在一块 RTX PRO 6000 上运行,位于围绕 NVIDIA 的 NeMo 流式循环构建的 CUDA 图引擎之后,依据其模型库列表,该列表还将模型描述为 Streaming Sortformer v2.1 的继任者。Batch Diarization 预设是一个用于录音的 HTTP 端点,返回带有每次请求延迟概况的说话人转折。Streaming Diarization 是一个用于实时音频的 WebSocket 端点,可在对话中携带说话人身份而无需重新聚类。Streaming Diarized Transcription 将该分割器与 NVIDIA 的 Parakeet V2 语音识别模型(一个拥有 6 亿参数的系统)配对,返回带时间戳的说话人标记词、每位说话人的部分转录以及重叠标记。Baseten 表示,此预设将每位说话人的活动向量直接输入 Parakeet 的初始编码层,从而在一次传递中转录重叠语音,说话人标签在到达时即确定,已提交的词不会被修改。

Baseten 报告称,一块 RTX PRO 6000 在 1.04 秒延迟配置下可持续处理超过 500 条并发的长达一小时的分割流,在 0.32 秒配置下可处理 200 条流,在加入转录功能时可处理 190 条长达一小时的流;而批处理预设每分钟可处理 200 个六分钟的音频文件。使用相同的文件和硬件,Baseten 报告其优化后的预设在 k6 生成的集群负载下,以单流控制在空闲副本上进行测试时,批处理吞吐量约比 NVIDIA 参考设置高出 1.35 倍。

Baseten 还表示,模型的每位说话人活动信号以 10 毫秒的增量进行跟踪,可用于驱动语音活动检测、说话人特定的结束转折检测以及轮流和中断处理,在超低延迟设置下响应时间约为 300 毫秒。

Nemotron 3 Diarization 已在 Hugging Face 的 nvidia/Nemotron-3-Diarization 仓库以及 Baseten 的模型库中提供,集成了 NeMo Framework v3.0,并支持 NVIDIA Ampere、Ada Lovelace、Hopper 和 Blackwell 系列 GPU。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。