NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

NVIDIA 发布开源语音交互模型 NemotronLabs VoiceChat 11B,实现约 450 毫秒的对话切换延迟,并支持实时工具调用,把“能听会说”的语音助手带到了可商用落地的临界点。

一句话看懂:NVIDIA 发布开源语音交互模型 NemotronLabs VoiceChat 11B,实现约 450 毫秒的对话切换延迟,并支持实时工具调用,把“能听会说”的语音助手带到了可商用落地的临界点。

事件核心:发生了什么

NVIDIA 于 2026 年 8 月发布开源模型 NemotronLabs VoiceChat 11B,这是一个全双工(full-duplex)的语音到语音(speech-to-speech)模型。所谓全双工,意味着模型可以同时接收并处理用户的语音输入,而不必严格遵循“用户说完、模型再回答”的单向交互模式。NVIDIA 给出的关键数据是对话切换时间约 450 毫秒,考虑到人自然对话中约 200-300 毫秒的静默间隔,这一延迟已经接近真人对话节奏。

该模型另一个值得注意的能力是实时工具调用:在语音对话过程中,模型可以直接触发 API、查询数据库或调用外部工具,而非仅生成文字回复。模型以开源形式发布,开发者可以下载权重并部署到自有环境中。

为什么重要

目前公开信息显示,语音交互类大模型大多采用级联架构,即先做语音识别(ASR),再交由大语言模型生成回复,最后经过语音合成(TTS)输出。这种架构延迟通常在 1.5 秒到 3 秒之间,且对话体验“一问一答”,不够自然。NemotronLabs VoiceChat 11B 将语音理解与生成压缩在单个模型中,把端到端延迟压低到 450 毫秒,这是从“语音助手”走向“语音对话”的关键一步。

对 NVIDIA 而言,此举同时押注了两个方向:其一,开源策略直接对标闭源语音模型,试图在端侧与企业级语音场景建立开发者生态;其二,11B 的参数量意味着推理需要 GPU 算力支撑,NVIDIA 的硬件业务将与自家模型生态形成协同。更值得留意的是“实时工具调用”——语音不再只是聊天入口,而可能成为操作系统的交互层,让用户通过自然语言直接完成订票、查账、控制设备等实际操作。

对用户/开发者/创作者的影响

对开发者来说,开源 11B 模型意味着可以在本地或私有云部署语音助手,不必将音频数据发送给闭源 API,这对医疗、金融等重视数据合规的行业尤其有意义。约 450 毫秒的轮换延迟也降低了语音应用开发的体验门槛,团队可以把精力放在业务逻辑上,而非反复调优语音链路。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户而言,最直接的变化将是语音助手“像真人一样不打断你、也不让你等太久”;而对创作者和内容团队来说,语音播客、视频配音、互动剧情等场景可能率先受益,因为实时工具调用允许语音内容与外部数据源联动,例如在播客中随时查询天气、股价或新闻事件。

值得关注的后续

目前公开信息显示,该模型已发布权重,但训练数据、具体评测基准和许可证条款仍需以 NVIDIA 官方文档为准。后续可以观察:第一,11B 模型在手机、边缘设备上的推理速度是否具备实用价值,还是仍需依赖云端 GPU;第二,开源社区能否复现官方演示中的 450 毫秒延迟,实际性能够不够稳定;第三,主要云厂商和闭源语音模型是否会跟进全双工路线,引发新一轮价格与能力竞争。

来源:MarkTechPost(RSS)

celebrityanime
celebrityanime
文章: 18311

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注