一句话看懂:9月23日,千问上线 Qwen-Audio-3.1 系列共五款语音大模型,覆盖识别、理解、合成、创作与实时交互,并同步大幅降价,ASR 降幅最高约 95%。
事件核心:发生了什么
这次发布的 Qwen-Audio-3.1 是一套完整的音频能力栈,包含五款模型:语音识别 Qwen-Audio-3.1-ASR、音频理解 ASR-Next、文本转语音 TTS、音频创作 TTS-Next,以及实时交互 Realtime。目前 ASR、TTS、TTS-Next、Realtime 的 API 已在千问 AI 平台上线,ASR-Next 的 API 将随后推出。
能力上有几处具体升级:ASR 支持 30 种语言和 16 种中文方言,流式识别首字响应约 160 毫秒,并新增转录润色(自动去除口头语和重复表达)与端到端角色分离转录,可同时输出说话人标签、时间戳和文本。ASR-Next 把理解范围从“语音中的文字”扩展到情绪、环境音和机械音,支持声音描述、事件定位和音频问答推理。TTS 支持跨语言音色迁移,并通过指令控制情绪和语速;TTS-Next 面向播客、有声书、影视游戏,统一生成人声、音效与环境音,支持多角色复刻和 48kHz 输出。Realtime 基于多教师蒸馏架构实现全双工交互,可随时打断,支持对话中实时切换语言、情绪理解与工具调用。
价格方面,TTS 降价约 70%,Realtime 约 85%,ASR 最高约 95%。测试数据上,ASR 在开源方言测试集平均 CER 为 4.55%,自建中文方言集平均 CER 为 10.38%,方言转普通话的语义整句准确率平均 82.10%。
为什么重要
语音正在从单一功能变成大模型的标配入口。千问这次把识别、理解、合成、创作、实时交互打包成一条产品线,意味着竞争焦点从“单个模型跑分”转向“能力栈是否完整、是否便宜、能否直接接入应用”。ASR 最高约 95% 的降幅尤其值得注意:语音识别此前是许多 AI 应用的主要成本项之一,价格下探会直接改变实时字幕、会议记录、客服质检等场景的可行性边界。同时,官方称 ASR-Flash-Next 与 ASR-Flash 在四个测试集的八项指标中分别拿下五项和三项第一,全面超过此前的 Fun-ASR 级联系统,这是对既有技术路线的一次正面替换。
对用户/开发者/创作者的影响
开发者层面,五款模型已在千问 AI 平台开放 API,可分别用于语音转写、音频内容理解、语音合成和实时对话。降价后,长音频转写和实时语音 Agent 的单位成本明显降低,适合把语音能力嵌入客服、会议、教育或硬件产品。创作者层面,TTS-Next 定位播客、有声书和影视游戏,支持多角色复刻与 48kHz 输出,音效和环境音可一并生成,制作流程有机会从多工具拼接收敛到一次调用。目前公开信息显示,Realtime 已接入 Qoder、Qwen Office 等 Agent 产品,以及 Qwen AI 眼镜等智能硬件,说明它被当作人机交互的默认接口来推进。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 ASR-Next 的 API 何时正式开放,情绪与环境音理解能否在真实场景中稳定复现;二是降价是否伴随限流、配额或 SLA 调整,这决定开发者能否长期依赖;三是竞品是否跟进价格与技术路线,尤其是实时全双工和端到端语音理解方向。此外,方言识别与角色分离涉及录音数据合规,落地到企业场景时仍需关注相关要求。
来源:AIbase


