英文原标题:**Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization**
本文为英文原文的机器翻译摘要,原文见:Hugging Face Blog ↗
- NVIDIA 发布 Nemotron 3 Diarization,一个开放权重、1 亿参数的说话人分离模型,在 VoiceArena 的 Diarization-Bench 排行榜上以 14.72% 的 DER 排名第一。
- 该模型支持最多 8 个说话人,适用于实时和录制对话,能处理重叠语音、分块处理以及可定制的流式延迟。
- 模型采用 Sortformer 方法,按说话人首次出现的时间顺序排列输出通道,使说话人标签稳定,无需为每个音频块重新解决说话人排列问题。
- 训练使用了公开和授权的语音数据,包括来自 David AI 的多说话人真实对话,以及覆盖 21 种语言的大规模模拟混合数据;加入 David AI 数据后,复合 DER 从 11.19% 降至 10.42%。
- 模型输出匿名说话人通道的概率,需与 ASR 结合才能生成带说话人归属的转录文本;分离和 ASR 是不同任务,应分别评估。
关键数据
- 14.72% Diarization Error Rate (DER)
- 100M-parameter model
- 支持最多 8 个说话人
- 训练数据覆盖 21 种语言
- 加入 David AI 数据后复合 DER 从 11.19% 降至 10.42%
- 推荐输入缓冲延迟:30.4、1.04、0.64、0.32 秒
- 在 VoiceArena 初始 Diarization-Bench 中,对 12 个系统、17 种配置、139 段英语对话(约 22 小时)评估,排名第一
引语
- Speaker diarization classifies who spoke when
为什么值得看:该模型以开放权重和 1 亿参数在说话人分离基准上取得领先,并支持实时多说话人场景,有助于提升会议转录、对话分析等应用的说话人归属能力。