千问一口气端出五款语音大模型,TTS价格腰斩七成、ASR砍掉九成五,把耳朵和嗓子全打包给了开发者

阿里千问于 9 月 23 日一次性发布 Qwen-Audio-3.1 系列五款语音大模型,覆盖识别、合成、实时交互与音频创作,同时把 TTS 价格下调约 70%、ASR 下调约 95%。这意味着语音能力从"单独采购的组件"变成开发者可以低成本批量调用的基础设施。

一句话看懂:阿里千问于 9 月 23 日一次性发布 Qwen-Audio-3.1 系列五款语音大模型,覆盖识别、合成、实时交互与音频创作,同时把 TTS 价格下调约 70%、ASR 下调约 95%。这意味着语音能力从”单独采购的组件”变成开发者可以低成本批量调用的基础设施。

事件核心:发生了什么

这次发布的五款模型分别对应不同环节:ASR 负责语音识别,TTS 负责语音合成,Realtime 负责实时全双工交互,另外两款 Next 版本基于新一代架构,把能力边界推向更复杂的音频任务。

具体来看,Qwen-Audio-3.1-ASR 支持 30 种语言和 16 种中文方言,首字响应延迟约 160 毫秒,在 KeSpeech 及 WSYue 的 11 个子集上平均字错误率 4.55%,内部测试的 16 种方言平均字错误率 10.38%。它还加入了角色分离转写和原生转写润色,能自动去除口头语、重复表达,并标注”谁在什么时候说了什么”。ASR-Next 则从”识别语音里的文字”扩展到理解情绪、环境声和机械声,支持声音描述、事件定位和音频问答。

TTS 侧强调表现力而非单纯发音准确,支持多语言、方言合成和跨语言音色迁移,并可通过指令控制情绪、语速和表达方式。TTS-Next 更进一步,可依据文本、时间戳和参考音频同时生成人声、音效与环境声,支持多音色复刻、多轮对话和 48kHz 输出。Realtime 采用全双工模式,可边说边听,而非把识别、模型、合成串成一条链。

为什么重要

降价幅度比模型能力更值得注意。TTS 降约 70%、Realtime 降约 85%、ASR 降约 95%,这基本把语音链路的调用成本压到接近”可忽略”的水平。过去很多 AI 应用不敢大规模用语音,不是因为效果不够,而是因为按分钟计费的 ASR 和 TTS 在规模化后成本迅速失控。价格下探后,语音输入、语音播报、会议转写、实时字幕这类功能更容易被直接集成进产品,而不必单独做成本核算。

对行业格局而言,语音长期是相对分散的赛道:识别、合成、实时交互往往由不同厂商分别提供。千问把五款模型打包,等于用一套 API 覆盖”耳朵和嗓子”,走的是平台化路线。这对专注单一环节的语音厂商会形成直接压力,尤其是在中文方言和实时交互这两个此前门槛较高的方向。

对用户/开发者/创作者的影响

对开发者来说,最直接的变化是接入成本。如果 ASR 降价 95%、TTS 降价 70% 属实,原先因预算被砍掉的语音功能可以重新纳入排期,例如长会议纪要、客服质检、有声内容批量生成。角色分离转写和首字 160 毫秒延迟,也让实时字幕、会议助手类产品的体验更接近可用状态。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者而言,TTS-Next 把配音、音效、环境声合并到一个模型里,播客、有声书、短片和游戏对白的制作流程可能被压缩。它支持时间戳控制和多角色音色一致,意味着过去需要主持人、音效师、混音师协作完成的段落,现在可以先由模型生成初版,再人工精修。不过目前公开信息显示,这类”通用音频生成”的实际成品质量和版权归属仍需验证。

值得关注的后续

第一,降价是否长期稳定。语音是算力密集型任务,大幅降价若伴随调用量激增,后续是否调整定价值得观察。第二,ASR-Next 和 TTS-Next 的开放程度,是直接开放 API,还是仅限特定平台试用,决定了开发者能否真正用上。第三,竞品是否跟进。语音赛道此前已有多个玩家,千问把价格打到这个位置,其他厂商大概率需要在价格或方言、实时交互等细分能力上做出回应。

来源:AIbase

celebrityanime
celebrityanime
文章: 25172

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注