ASR 能听见内容,却不知道是谁说的
NVIDIA 发布的 Nemotron 3 Diarization 是一个托管在 Hugging Face 上的开放权重说话人分离模型,面向的问题很具体:在一段多人对话中,判断谁在什么时候说话。它最多跟踪 8 个说话人,也处理多人同时发言,并用同一个检查点覆盖离线录音和实时流式输入。模型规模为 1 亿参数,运行路径依托 Linux、NVIDIA NeMo 和 Ampere、Ada Lovelace、Hopper 或 Blackwell GPU,权重采用 OpenMDW License 1.1,允许商业使用。
这项能力常被误解为语音识别的附属功能。ASR 负责把声音变成文字,但不会自动告诉系统某句话是主持人、客户还是另一位工程师说的。没有说话人归属,会议摘要无法可靠判断谁做了承诺,客服分析也难以区分客户异议和坐席回应,语音代理更无法把对话中的信息写入正确的记忆来源。说话人分离输出的是时间区间和匿名声道,随后才能与 ASR 结果合并成带说话人标签的转录文本。
最大的变化不是参数,而是重叠语音的处理方式
Nemotron 3 相比 NVIDIA 早期的 Streaming Sortformer 检查点,最直观的变化是把支持上限从 4 个说话人提高到 8 个。更重要的是,它没有把“同一时刻只能有一个人说话”作为前提。模型输出一个 [T, 8] 的说话人活动概率张量,同一帧可以同时激活多个通道,因此两个人抢话、插话或短暂重叠时,系统不必先把音频强行切成单一说话人片段。
这背后是一条明确的架构选择。输入音频要求为 16 kHz 单声道,模型先用 10 ms 步长生成 Mel 频谱,再按 8 倍堆叠成 80 ms 的编码帧,由 31 层带旋转位置嵌入的 Transformer 编码器处理,最后通过 Conv1D 把预测上采样回 10 ms 分辨率。说话人标签按首次出现的顺序分配,后续流式分块沿用这个顺序,而不是每个分块都重新匹配身份。Arrival-Order Speaker Cache 保存此前的说话人信息,FIFO 队列提供最近帧上下文,这两种记忆机制共同维持了跨分块的标签稳定性。
低延迟不是一个数字,而是一组可选的代价
模型卡给出了四个运行点,恰好说明实时部署不能只引用一个“延迟”数字。离线风格配置的输入缓冲延迟为 30.4 秒,DIHARD III 全集 DER 为 12.73%,批量吞吐为 15,113× RTFx。低延迟、极低延迟和超低延迟配置分别为 1.04 秒、0.64 秒和 0.32 秒,对应 DER 为 13.18%、13.28% 和 13.55%,吞吐为 865×、579× 和 292× RTFx。
这些结果可以整理成一个更适合架构讨论的证据块:把缓冲从 30.4 秒压到 1.04 秒,DER 只增加 0.45 个百分点,但吞吐从 15,113× 降到 865×;继续压到 0.32 秒,DER 再增加 0.37 个百分点,吞吐则降到 292×。官方指出,0.32 秒是最低推荐设置,虽然技术上可以使用 80 ms 缓冲。更关键的是,这些延迟不包含模型计算、网络传输和 ASR 时间,因此不能直接当作用户从说话到看到带标签文本的端到端延迟。
榜单优势说明了模型进步,也暴露了评测边界
公开评测显示,Nemotron 3 的提升并非只来自支持更多说话人。在 Voice Arena 初始版 Diarization-Bench 中,它在 12 个系统、17 个配置里排名第一。测试包含 139 段英语对话,总时长约 22 小时,模型 DER 为 14.72%,下一名系统为 19.3%,相对降低约 24%。不过 NVIDIA 也注明,Voice Arena 尚未完成 Version 1 评测,排名和结果仍可能变化。
与 4 说话人基线在 1.04 秒延迟下比较,Nemotron 3 在全部 8 个评测条件上降低了 DER,相对降幅从 CALLHOME-Part2 的 9.0% 到 NOTSOFAR1 MHM 的 65.2%,八项条件的非加权平均相对降幅为 41.0%。但结果并非全面碾压:在两人对话的 CALLHOME、30.4 秒配置下,DER 从 5.68% 上升到 5.98%,而完整 CALLHOME-Part2 则从 10.32% 改善到 9.10%。这说明“支持八人”和“对所有场景都更准”不是同一个命题。
对产品团队而言,匿名标签仍是系统边界
训练数据规模解释了模型为何可能适应更复杂的多人音频。NVIDIA 使用了约 10,000 小时真实对话和 82,611 小时模拟多说话人混合数据,训练组合还加入了由 David AI 授权的真实多人音频。加入这部分数据后,compound DER 从 11.19% 降到 10.42%。但这些数字只能说明训练配方与总体误差变化,不能替代目标业务中的验证,尤其是不同语言、麦克风布局、通话压缩和多人重叠模式可能改变结果。
部署时还必须把说话人分离与身份识别拆开。Nemotron 3 的声道标签是匿名的,按到达顺序分配,模型本身不会告诉系统“speaker 1 是张三”。如果产品需要稳定的用户、坐席或会议成员身份,就要在下游结合账号信息、声纹、会话元数据或其他匹配机制,并处理标签漂移和误匹配的代价。更实际的判断是:若系统的瓶颈是多人重叠、实时分块和说话人归属,这个模型值得进入候选架构;若需求是低成本单流端到端转录,或必须直接获得实名身份,则不能把开放权重和榜单表现当成完整答案。