英伟达发布1亿参数免费模型Nemotron3,支持8人实时语音分割识别

英伟达发布约 1 亿参数的免费语音分离模型 Nemotron3Diarization,开放权重,可在实时或录音场景中区分最多 8 名同时说话的人。它的错误率在 VoiceArena 基准上明显低于现有系统,意味着多说话人识别这项能力正从高价方案走向可低成本部署。

一句话看懂:英伟达发布约 1 亿参数的免费语音分离模型 Nemotron3Diarization,开放权重,可在实时或录音场景中区分最多 8 名同时说话的人。它的错误率在 VoiceArena 基准上明显低于现有系统,意味着多说话人识别这项能力正从高价方案走向可低成本部署。

事件核心:发生了什么

2026 年 9 月 27 日,英伟达正式发布 Nemotron3Diarization,参数规模约 1 亿,专注语音分割聚类(Diarization)任务,也就是识别一段对话中“谁在什么时候说话”,并已开放权重数据。该模型支持实时音频和录音处理,最多可应对 8 人同时发言。

性能方面,它在 VoiceArena 语音分割基准(v1 版本)上以 14.72% 的 DER(分割错误率)排名第一,明显低于第二名系统的 19.3%。相比前代 Streaming Sortformer,在 1.04 秒音频缓冲条件下,该模型在 8 个测试场景中的平均错误率下降约 41%。为平衡延迟与准确率,它提供从 0.32 秒到 30.4 秒的四档动态音频缓冲设置。该模型还可与 Parakeet 等语音识别系统配合,自动生成带有匿名说话人标签(如 speaker_2)的文本。目前公开信息显示,参与人数增多、背景噪声过大或混响严重时,错误率会上升。

为什么重要

语音分离长期是会议记录、客服质检和多说话人交互中的技术门槛,过去高精度方案往往依赖闭源服务或更重的算力投入。英伟达这次把约 1 亿参数的轻量模型免费开放权重,等于把一项此前偏企业级的能力下放到开发者可直接调用的层面。

对行业竞争而言,这也延续了英伟达在 AI 模型层的布局逻辑:用开源模型带动推理需求,反过来巩固其算力生态。当多说话人识别能在边缘设备或实时商业场景中低成本运行时,语音 AI 应用的开发成本结构会发生变化。

对用户/开发者/创作者的影响

开发者可以用它搭建实时会议转写、智能客服坐席分析、多人播客自动分段等应用,并与现有语音识别链路组合,生成带说话人标签的文本。由于权重开放,本地部署和二次训练的门槛相对可控。创作者侧的影响更直接:多人访谈、圆桌讨论的后期整理可以更快区分发言人,减少人工标注。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

但需要注意,0.32 秒到 30.4 秒的缓冲档位意味着延迟与准确率需要按场景取舍,实时场景未必能直接套用最高精度配置。

值得关注的后续

一是该模型在实际产品中的落地情况,尤其是边缘设备和实时客服场景的延迟表现;二是英伟达是否围绕它提供配套 API 或推理优化工具,降低集成成本;三是竞品是否跟进开放类似权重的语音分离模型,推动这一细分方向的价格与能力竞争。

来源:AIbase

celebrityanime
celebrityanime
文章: 26004

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注