AREX Feed Article
NVIDIA 开放 Nemotron 3 Diarization 权重:14.72% DER 排名 VoiceArena 榜首,支持 8 说话人流式分离
2026 年 9 月 23 日,NVIDIA 在 以开放权重形式发布了流式说话人分离(speaker diarization)模型 Nemotron 3 Diarization:参数量约 1 亿(99.2M),按 OpenMDW License Agreement 1.1 授权,注明可用于商业和非商业用途。在 上,这个模型以 14.72% 的分离错误率(Diarization Error Rate, DER)在 12 个系统中排名第一;第二名是 BUT FIT 的开源系统 DiariZen WavLM Large,成绩 19.34%——NVIDIA 博客据此称相对降低约 24%。
同一天公布的还有能力边界与生态进展:单个模型支持最多 8 个说话人通道、重叠语音和分块处理,推荐流式延迟最低 0.32 秒(技术上可压到 80 毫秒);Transformers 在发布当日即提供原生支持;训练数据包含 David AI 授权的多说话人对话与据此合成的 21 语种混合语音;设备端方案商 Argmax 也在 Argmax Pro SDK 3 中同步集成。
139 段会话、约 22 小时英语音频:榜首成绩的口径与成分
榜单页面当前标注为 v1 early results:139 段英语会话,其中 115 段线下、24 段线上,合计 21.97 小时音频、1,317.9 计分分钟;12 个系统与变体上榜,4 个开源、8 个是商业 API;每段会话有 2~8 名说话人,人数不提供给任何系统,参考标注经人工校验。评分采用 DIHARD 口径的 DER——遗漏语音、误报、说话人混淆三者相加,除以参考语音总时长;重叠语音按人头计秒,0 ms collar 下不给任何边界容忍。NVIDIA 博客补充的评测设置还包括:重叠语音计分、由各系统自己生成语音活动检测(VAD)。
前六名依次是:Nemotron 3 Diarization(14.72%)、DiariZen WavLM Large s80 MD v2(19.34%)、pyannoteAI Precision-3(20.56%)、pyannoteAI Precision-2(23.41%)、NVIDIA 上一代 Streaming Sortformer Diarizer 4spk v2(24.61%)、pyannote Community-1(30.61%)。模型类型标注为自动语音识别(ASR)的商业服务排在 40.71%~67.13% 之间:ElevenLabs Scribe v2 为 40.71%,Meta Muse Voice Transcribe 42.06%,AssemblyAI Universal-3.5 Pro 44.64%,Soniox v5 Async 49.78%,Speechmatics Enhanced 53.30%,Deepgram Nova-3 以 67.13% 垫底。
Nemotron 3 Diarization 的误差构成是遗漏 3.63%、误报 8.88%、说话人混淆 2.21%,Jaccard 错误率(Jaccard Error Rate, JER)为 25.53%,并在 83.5% 的会话里判对了说话人数量——DiariZen 这一项只有 56.8%。NVIDIA 博客还给出同源成绩:在 100 ms 和 250 ms collar 档位同样第一,线下与线上两类录音也均居首。
按到达顺序锁定输出通道:流式分离难在“记住谁是谁”
说话人分离要同时解决两件事:把语音检测出来并分给正确的说话人,以及在整个对话里保持这个分配——哪怕中间隔着沉默、插话,或某个说话人长时间不开口。流式推理放大了后一个难题:离线模型可以通览整段录音,流式系统每次只拿到一小块新音频和有限上下文,没有有效的记忆机制,同一个输出通道在这一块对应的人,到下一块可能就换成别人。
Nemotron 3 Diarization 沿用 Sortformer 的做法:输出通道按说话人首次出声的顺序固定,第一个新声音占据 speaker_0,下一个新人占据 speaker_1,依此类推。博客解释,这种按到达时间排序的设计让泛化标签保持稳定,不需要每个音频块重新求解一次说话人排列。流式记忆由两部分组成:Arrival-Order Speaker Cache(AOSC,按到达顺序保留早前块的说话人信息)和先进先出(FIFO)队列(提供最近帧的上下文);输入缓冲还带右上下文,博客给出的取舍是:多留一点有助于理解说话人切换,留少一点则更早给出结果。
结构上,模型接收 16 kHz 单声道音频,先生成 10 ms 帧步长的梅尔谱特征,再按 8 倍堆叠成 80 ms 帧,送入带旋转位置编码(RoPE)的 31 层 Transformer 编码器;其上由一层 Conv1D 把预测上采样回输入分辨率,默认输出 [T, 8] 张量——T 个时间步、8 个通道各自的说话概率,默认步长 10 ms、可配置为 10 ms 的倍数。两人同时说话时,两个通道可以在同一帧同时激活,重叠语音由此被原生覆盖,后处理再把概率转成带起止时间戳的说话人标签。
边界也写在明面上:8 个通道是匿名标签,speaker_2 不对应任何真实身份,下游应用要靠会议元数据、用户档案或说话人确认模型把通道映射到具体的人;录音超过 8 人时会漏检或错分;强噪声、严重混响、远场录音、领域偏移和超长对话都会推高各类误差。分块推理取消了模型强加的固定最大音频时长,但在异常长的录音上性能仍可能下降。分离模型只回答“谁在何时说话”,不给文字;要得到带说话人归属的转写,需要与能返回词级时间戳的 ASR 配对——博客示例用了 Parakeet TDT 0.6B v3 与 Nemotron ASR 3.5,同时提醒示例里按词中点对齐说话人的做法只是简单启发式,重叠处的词会被标为 ambiguous。
一组权重、四档工作点:30.4 秒离线档批量吞吐 15,113× RTFx
同一组权重提供四档推荐的输入缓冲延迟:30.4 秒(离线风格)、1.04 秒、0.64 秒和 0.32 秒;模型技术上能接受 80 ms 的输入缓冲,但 0.32 秒是最低推荐档。这个延迟按(块长 + 右上下文)× 80 ms 计算,只衡量推理前缓冲的音频,不含模型计算、网络传输、ASR 和应用处理——四档分别对应 340+40、9+4、6+2、3+1 个 80 ms 帧,说话人缓存、FIFO 长度等完整参数见模型卡。博客给出的选型提醒:延迟越低,精度和吞吐一般越低,工作点要对准端到端产品需求,而不是缓冲时长本身。
吞吐数字由博客按模型卡口径给出:在 NVIDIA RTX PRO 5000 上、BF16 精度、batch size 32、启用 torch.compile() 时,30.4 秒档的实时率加速比(RTFx,总音频时长除以总处理时间)达到 15,113×,上一代基线为 2,619×,约为其 5.8 倍,同时把 DIHARD III 的 DER 从 19.09% 降到 12.73%;1.04 秒档为 865× 对 136×,DER 从 19.60% 降到 13.18%。博客强调,这些是批量吞吐成绩,不能当作单路端到端延迟解读,部署前要在目标硬件上测完整管线。
对上一代 Sortformer v2.1:八个评测条件全部改善,两人对话是例外
NVIDIA 自己的对比实验覆盖 901 段针对不同条件的录音,横跨多语种电话语音、会议、近场与远场麦克风、多麦克风采集和困难声学环境,重叠语音全部计分;DIHARD III、AliMeeting、AMI 和 NOTSOFAR1 用 0 秒 collar,CALLHOME-Part2 用 0.25 秒,结果由 NeMo 的 e2e_diarize_speech.py 脚本生成,基线是上一代四说话人流式模型 diar_streaming_sortformer_4spk-v2.1。
在 1.04 秒延迟档,新模型在列出的全部 8 个评测条件上降低了 DER,相对降幅从 CALLHOME-Part2 的 9.0% 到 NOTSOFAR1 MHM 的 65.2%,八个数字的算术平均为 41.0%。博客特意说明:这是各条件相对改善的平均值,不是把所有录音合并计算出的池化 DER。在两个模型共有的 30.4 秒、1.04 秒、0.32 秒档位上,新模型在每个数据集上都更低;0.64 秒档上一代没有对应配置。
例外藏在按说话人数量拆分的子集里:CALLHOME 的两人子集上,新模型 DER 为 5.98%,略高于上一代的 5.68%;但 CALLHOME-Part2 全集从 10.32% 改善到 9.10%,增益集中在人数更多的子集。博客指出,优势在 DIHARD III、CALLHOME-Part2 和 NOTSOFAR1 的高说话人数量子集上进一步拉大,8 说话人支持让四人以上的会议和群聊进入覆盖范围。一个口径细节是:DIHARD III 把 5~9 人的录音并入同一组结果,而 9 人已超出模型 8 人的上限,这部分音频超出了规格覆盖。
训练数据里的 David AI 与运行条件:消融实验的 0.77 个百分点
训练数据由公开与授权两部分组成。博客写明,其中包含从 David AI 授权的多说话人标注真实对话;另一部分授权 David AI 音频被用作素材,生成大规模模拟英语与多语种混合数据,覆盖 21 个语种。消融结果是:把 David AI 数据加入训练后,复合 DER(compound DER)绝对下降 0.77 个百分点,从 11.19% 降到 10.42%,且在离线风格与超低延迟两个工作点上同时成立。
运行条件方面,模型接受 16 kHz 单声道的 .wav、.flac、.opus 和 .mp3 输入,运行环境为配备 NVIDIA Ampere、Hopper 或 Blackwell 系列 GPU 的 Linux 系统。
发布首日的使用方式:Transformers、在线 Demo 与 Argmax SDK
模型卡在发布当日就列出了 Transformers 原生支持:用 AutoProcessor 和 AutoModelForAudioFrameClassification 即可加载权重,Transformers 侧提供三种流式预设——low_latency(默认,1.04 秒)、very_low_latency(0.64 秒)和 ultra_low_latency(0.32 秒),处理器负责切块并附加前瞻帧,会话最后一块用 is_last_audio_chunk=True 收尾。已出现在主线(main)版本中,稳定版 v5.17.0 的文档尚未收录该模型,访问会跳转到主线版本。
NVIDIA 还在 ,提供合成对话、8 说话人模式、实时麦克风、多语种实时麦克风和音频文件上传;博客说明,部分 8 说话人场景在正式对话前有一段说话人上下文铺垫,用于演示该条件下的行为,不构成无铺垫的基准测试。
发布当天的生态跟进来自 Argmax:其在 中自称 launch partner(首发合作伙伴),为 Nemotron 3 Diarization 提供 Day 0(发布日同步)支持,并借这次发布推出专为该模型构建的 Pre-diarized Transcription API。Argmax 解释,此前为避免分离与识别的误差叠加,SDK 一贯先转写、后指派说话人,而这次实测表明先分离、后转写反而能得到更好的转写结果。NVIDIA 博客引述 Argmax 的 Atila Orhon 的话:“我们在覆盖多样且具挑战性真实条件的 11 个数据集上,用 OpenBench 测试了 6 个说话人分离系统,Nemotron 3 Diarization 在全部 6 个系统中取得最低 DER;尽管说话人上限是 8,它仍在 11 个数据集中的 5 个拿到最低分。与其前身 Sortformer v2.1——错误率要高 60%——相比,这是准确率上的巨大跃升。”Argmax 还说,此前使用 Sortformer v2 的不少客户已经在升级到新模型,并邀请参加 9 月 27 日悉尼 Interspeech 2026 的人到展台看现场演示。
两个来源都给这份成绩留了余地:NVIDIA 博客写明,VoiceArena 目前的数字是初步结果,可能随其完成 v1 评估与配对统计分析而变化;VoiceArena 页面也提醒,排名基于当前收录的会话,相近系统的名次可能随会话增加而变动,线上语料只有 24 段、样本偏小。榜首位置是否稳固,要等 VoiceArena 完成 v1 评估才有定论。