阿里千问发布 Qwen-Audio-3.1:五款语音模型同发,ASR 价格直降 95%

阿里千问于 2026 年 9 月 23 日发布 Qwen-Audio-3.1 系列,一次性推出五款语音模型,覆盖识别、合成、实时交互与音频创作;全线降价,ASR 降幅最高约 95%,语音能力的调用门槛被大幅拉低。

一句话看懂:阿里千问于 2026 年 9 月 23 日发布 Qwen-Audio-3.1 系列,一次性推出五款语音模型,覆盖识别、合成、实时交互与音频创作;全线降价,ASR 降幅最高约 95%,语音能力的调用门槛被大幅拉低。

事件核心:发生了什么

这次发布包含五款模型:语音识别方向的 Qwen-Audio-3.1-ASR 与 ASR-Next,语音合成方向的 TTS 与 TTS-Next,以及实时交互模型 Realtime。升级重点有三处。其一,ASR 加入原生转写润色能力,可自动去除口头语与重复表达,并支持按角色标注“谁在何时说了什么”,便于会议和访谈形成可追溯记录;官方数据显示其支持 30 种语言、16 种中文方言,首字响应约 160 毫秒,在 KeSpeech 与 WSYue 的 11 个子集上平均字错率 4.55%。其二,TTS-Next 把文本、时间戳和参考音频统一起来,可一次性生成人声、音效与环境音,输出 48kHz,面向播客、有声书、影视与游戏。其三,Realtime 采用全双工架构,可边说边听、随时打断,并能识别情绪与沟通意图,在对话中调用 API、知识库和业务系统工具。价格方面,TTS 降约 70%,Realtime 降约 85%,ASR 降幅达 95%。

为什么重要

语音正从“单点能力”变成完整的能力栈:理解、生成、交互、创作。五款模型同时发布意味着开发者不必在不同厂商之间拼凑链路,尤其 ASR-Next 把处理对象从“语音中的文字”扩展到情绪、环境声和机械声,这类音频理解能力此前主要出现在闭源体系中。价格是更直接的变量:ASR 降价 95% 后,长音频转写、客服质检、会议记录等高频场景的算力成本结构会被重算,原本因成本被搁置的批量处理类应用具备上线可能。

对用户/开发者/创作者的影响

开发者侧,低延迟流式识别加工具调用,让实时语音助手、会议机器人和语音质检系统更容易落地,不必自建复杂后处理流程。创作者侧,TTS-Next 的音效与环境音一体化生成,可以压缩播客、有声书和短剧的音频制作环节。企业采购侧,语音模型价格集体下探,采购评估的重点会从“单次调用成本”转向“端到端流程成本”。普通用户最直观的变化是转写更干净、方言与行业术语识别更好,以及语音助手的打断体验更接近真人对话。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是降价后实际并发与限流策略是否同步放开,这决定开发者能否真正跑量;二是 ASR-Next 的音频理解能力是否开放完整 API,以及多模态音频问答的准确率表现;三是竞品是否在语音识别与实时交互上跟进调价,目前公开信息显示这一轮价格调整幅度在同类产品中较为激进。

来源:AIbase

celebrityanime
celebrityanime
文章: 25167

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注