谁在何时说话一目了然:用 NVIDIA Nemotron 3 Diarization 构建实时多说话人 AI

NVIDIA 在 Hugging Face 发布开源权重模型 Nemotron 3 Diarization,用 1 亿参数把“谁在何时说话”做成可实时流式处理的说话人分离能力,并以 14.72% 的 DER 登上 VoiceArena 排行榜第一。

一句话看懂:NVIDIA 在 Hugging Face 发布开源权重模型 Nemotron 3 Diarization,用 1 亿参数把“谁在何时说话”做成可实时流式处理的说话人分离能力,并以 14.72% 的 DER 登上 VoiceArena 排行榜第一。

事件核心:发生了什么

2026 年 9 月 23 日,NVIDIA 在 Hugging Face 博客发布 Nemotron 3 Diarization。这是一个开放权重、约 1 亿参数的说话人日志(speaker diarization)模型,官方称其在 VoiceArena 的 Diarization-Bench 排行榜上以 14.72% 的 Diarization Error Rate(DER)排名第一。模型最多支持 8 个说话人,同时覆盖离线录音与流式实时场景,可处理多人抢话重叠,并允许开发者调整流式延迟与分块长度。训练数据包括公开语音数据,以及从 David AI 授权的真实多人对话数据;官方称加入 David AI 数据后,复合 DER 从 11.19% 降至 10.42%。此前的 NVIDIA Streaming Sortformer 只支持 4 人,这次扩展到了 8 人。

为什么重要

语音识别解决“说了什么”,说话人日志解决“谁说的”。过去很多会议、客服通话、播客的转写文本虽然字对,但无法把每句话可靠归属到具体人,导致摘要、行动项、搜索和对话分析的价值大打折扣。Nemotron 3 Diarization 的关键在于把流式说话人跟踪做成开源权重模型,并采用“按首次出现时间排序”的输出策略,让说话人通道在长对话中保持稳定,减少跨音频块的身份跳变。对英伟达来说,这既是补齐语音 AI 工具链的一步,也是在开源模型生态中继续扩大影响力的动作。

对用户/开发者/创作者的影响

开发者可以把该模型的说话人时间戳与 ASR(自动语音识别)结果对齐,生成带说话人标签的转写文本,用于会议记录、客服质检、播客剪辑和多说话人语音助手。模型输出的是匿名通道,如 speaker_2,而不是真实身份,仍需结合会议元数据或声纹验证做映射。对创作者而言,长录音的分块处理和可调流式延迟意味着更灵活的部署选择。企业采购时需注意,8 人上限适合多数会议和访谈场景,但大型圆桌或复杂多人环境仍需验证实际表现。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是模型实际部署后的延迟、吞吐和准确率是否与排行榜一致;二是竞品如 pyannote、其他开源 diarization 方案是否跟进多人流式能力;三是授权数据在 21 种语言模拟混合训练中的泛化效果,是否会在中文等场景中出现明显差异。目前公开信息显示,模型权重和用法已在 Hugging Face 放出,后续生态集成值得观察。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 25208

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注