Nvidia 开源 Nemotron 3 用于实时说话人跟踪
核心要点
- 亿参数模型可同时识别多达8个说话人,时延低至320毫秒 英伟达让辨别谁在说话变得更加容易。
- 该公司发布了 Nemotron 3 Diarization,这是一种开放权重模型,专门用于解决音频处理中最烦人的问题之一:实时准确跟踪哪个说话者说了些什么以及他们说了什么。
- 该模型于 9 月 23 日在 Nvid

亿参数模型可同时识别多达8个说话人,时延低至320毫秒
英伟达让辨别谁在说话变得更加容易。该公司发布了 Nemotron 3 Diarization,这是一种开放权重模型,专门用于解决音频处理中最烦人的问题之一:实时准确跟踪哪个说话者说了些什么以及他们说了什么。
该模型于 9 月 23 日在 Nvidia 的 OpenMDW 1.1 许可证下发布,可在 Hugging Face 上和通过该公司的 NeMo 框架免费使用。它还可以通过 Baseten 和 DeepInfra 等推理提供商进行访问,据报道,在某些配置中,部署成本低至每音频小时 0.01 美元。
凯莱 询问有关任何股票的任何问题 — 凯莱财经在几秒钟内为您提供完整的、有数据支持的答案。询问格洛丽亚 →
Nemotron 3 Diarization 的实际用途
Nemotron 3 通过大约 1 亿个参数和 Nvidia 称之为 Streaming Sortformer 架构来解决这个问题。该模型可同时处理多达 8 个说话者,以 10 毫秒的分辨率生成说话者活动概率。它的粒度足以捕获那种通常会使转录软件变得混乱的快速串扰。
该系统以流式传输和离线模式运行。在流模式下,它可以使用低至约 320 毫秒的可配置延迟配置文件运行。
更值得注意的工程决策之一是使用 Nvidia 所谓的到达顺序扬声器缓存 (AOSC) 的单通道端到端设计。传统的二值化管道需要多个阶段:首先分割音频,然后提取说话者嵌入,然后对这些嵌入进行聚类以找出谁是谁。 Nemotron 3 将所有这些合并为一次前向传递,从而大大简化了部署。
该模型根据说话者在对话中首次出现的顺序来分配说话者标签。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
准确度跳跃显着
在使用其“低”延迟配置文件的 AISHELL-4 基准测试中,Nemotron 3 实现了 9.8% 的二值化错误率。其前身,2025 年 7 月发布的 Streaming Sortformer v2.1,在同一测试中得分为 27.2%。
分类错误率衡量说话者被错误归因、遗漏或错误检测的时间比例。
之前的模型,正式名称为 diar_streaming_sortformer_4spk-v2.1,也仅支持四个扬声器。将上限增加一倍至八人,为涉及小组讨论、小组通话和多方会议的用例打开了大门,在这些用例中,四位发言者的限制是一个真正的限制。
这符合 Nvidia 更广泛的战略
Nemotron 3 Diarization 并不是孤立出现的。它是 Nvidia 围绕代理人工智能和语音识别构建的不断增长的模型系列的一部分,旨在为语音驱动的应用程序创建完整的堆栈。
目标用例是会议转录、呼叫中心分析、播客制作以及多人通话且软件需要跟踪的任何场景。通过在 OpenMDW 1.1 许可证下开源权重,Nvidia 已经通过与 MLX 和 FluidAudio 的合作看到了早期集成。
某些推理提供商提供的每音频小时 0.01 美元的价格也值得注意。按照这个成本,处理一个完整的八小时工作日的会议音频大约需要八美分。
