NVIDIA 在 Hugging Face 平台上发布了Nemotron 3 Diarization,一个开源权重的说话人分离模型。它回答关于任何一段对话的一个问题:谁在什么时候说话。这个 1 亿参数的模型最多可追踪 8 位说话人,包括声音重叠的情况。单个检查点同时适用于离线录音和实时流式场景。
能用了吗?可以。权重以 OpenMDW License 1.1 发布,允许商业使用。它在 Linux 上通过 NVIDIA NeMo 运行,可使用 Ampere、Ada Lovelace、Hopper 或 Blackwell GPU。

为什么需要说话人分离?
自动语音识别(ASR)给到你文字,但不会告诉你这些话是谁说的。没有归属信息,摘要工具就无法判断是谁做出的承诺、又是谁提出的异议。
说话人分离输出的是每位说话人处于活跃状态的时间区间。这些时间戳与 ASR 输出结合,就能生成带说话人归属的转写文本。会议工具、通话分析、播客流水线和语音智能体的记忆,都依赖这一步。
相比 Streaming Sortformer 有哪些变化
NVIDIA 早先的 Streaming Sortformer 检查点 diar_streaming_sortformer_4spk-v2.1 支持 4 位说话人。Nemotron 3 Diarization 把这个上限翻倍到 8 位。根据 NVIDIA 的发布说明,其目标场景是人们同时开口的杂乱多方音频。
架构如何工作
模型接收 16 kHz 单声道音频,格式支持 .wav、.flac、.opus 或 .mp3。它将音频转换为步长 10 ms 的梅尔频谱特征。特征再按 8 倍堆叠,从而产生 80 ms 的编码器帧。
一个 31 层、采用旋转位置嵌入(RoPE)的 Transformer 编码器处理这些帧。随后一个 Conv1D 层把预测结果上采样回 10 ms 分辨率。输出是一个 [T, 8] 的张量,表示每位说话人的活跃概率。
这种设计直接处理重叠。如果两个人同时说话,同一帧内会有两个通道被激活。
模型沿用了 Sortformer 按到达时间排序说话人的做法。第一个新声音占用通道 1,下一个占用通道 2,依此类推。这让标签在流式分块之间保持稳定,模型无需为每个分块重新匹配说话人与通道。
流式处理使用两套记忆机制。到达顺序说话人缓存(AOSC)保留来自较早分块中的说话人信息。一个 FIFO 队列则提供近期的帧上下文。标签是匿名的,将其映射到真实身份的工作留给下游应用完成。
4 档延迟运行点
输入缓冲延迟等于(分块 + 右侧上下文)× 80 ms。下表使用 DIHARD III 全集 DER 和模型卡中的 batch-32 编译吞吐数据。
| 配置 | 缓冲延迟 | DIHARD III DER | RTFx(batch 32,编译后) |
|---|---|---|---|
| 离线模式 | 30.4 s | 12.73% | 15,113× |
| 低延迟 | 1.04 s | 13.18% | 865× |
| 极低延迟 | 0.64 s | 13.28% | 579× |
| 超低延迟 | 0.32 s | 13.55% | 292× |
该延迟不含计算、网络和 ASR 耗时。模型技术上可以以 80 ms 缓冲运行,但 0.32 s 是最低推荐配置。
基准测试结果
在 Voice Arena 的初始 Diarization-Bench 结果中,该模型在 12 个系统、17 种配置中排名第一。测试覆盖 139 段英语对话,总计约 22 小时。它取得 14.72% 的 DER,而排名第二的系统为 19.3%,相当于约 24% 的相对降低。NVIDIA 指出,待 Voice Arena 完成 Version 1 评测后,这些结果可能发生变化。
在与 4 说话人基线对比、1.04 s 延迟条件下,全部 8 项评测场景的 DER 都有下降。相对降幅从 CALLHOME-Part2 的 9.0% 到 NOTSOFAR1 MHM 的 65.2% 不等。8 项场景的非加权平均降幅为 41.0%。
有一处回退。在 30.4 s 的 2 说话人 CALLHOME 上,DER 从 5.68% 升至 5.98%。而全集 CALLHOME-Part2 仍从 10.32% 改善到 9.10%。
吞吐同样大幅跃升。在 30.4 s 配置下,模型达到 15,113× RTFx,而基线为 2,619×。测试使用 BF16,运行在 NVIDIA RTX PRO 5000 上并启用 torch.compile()。这些是批处理数据,不是单流应用延迟。
训练数据
训练结合了约 10,000 小时真实对话与 82,611 小时模拟的多说话人混合音频。混合数据中包含从 David AI 获得授权的真实多说话人音频。加入 David AI 数据后,复合 DER 从 11.19% 降至 10.42%。用于模拟混合的授权源音频覆盖 21 种语言。
要点总结
- 1亿参数开放式权重模型可跟踪多达8个重叠的扬声器。
- 一个检查点涵盖了从离线(30.4 秒)到超低 0.32 秒流媒体播放的所有情况。
- 在 Voice Arena 的初始 Diarization-Bench 中排名第一,DER 为 14.72%。
- 与 Streaming Sortformer 相比,平均可降低 41.0% 的 DER,时间为 1.04 秒。
- OpenMDW-1.1 许可证允许商业用途;该模型通过 NeMo 在 NVIDIA GPU 上运行。
资料参考:
https://huggingface.co/blog/nvidia/nemotron-diarization
https://huggingface.co/spaces/nvidia/nemotron-diarization
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/jishu/72219.html