一句话看懂:阿里通义千问发布 Qwen-Audio-3.1,一次推出五款覆盖语音识别、语音合成与实时交互的音频模型,并将相关 API 价格最高下调 95%。音频能力的升级配合大幅降价,意味着语音类 AI 应用的调用成本正被快速压低。
事件核心:发生了什么
2026 年 9 月,阿里 Qwen 团队发布 Qwen-Audio-3.1,包含五款模型,覆盖 ASR(语音识别)、TTS(语音合成)和实时交互三条产品线。ASR 版本强化了多语言与方言识别,并能自动清理口语中的“嗯”“呃”等赘词和重复表达;ASR-Next 进一步支持多说话人分离、时间戳标注,还能识别情绪、环境音和机器噪声。TTS 版本支持多语言合成与自然的跨语言音色迁移,用户用一句文本提示就能控制情绪、语速和风格,例如要求“用尖锐、命令式的语气朗读,带着要求被尊重的感觉”。TTS-Next 则把语言模型与扩散方法结合,单次生成即可同时产出语音、音效和背景音。实时模型支持边说边听和即时打断,据 Qwen 介绍,它在检测到用户情绪低落时会放慢回应速度并表现得更有共情。价格方面,TTS 下调约 70%,实时模型约 85%,ASR 最高降幅达 95%。
为什么重要
语音一直是多模态大模型里商业化最直接的方向之一,但过去 ASR 和 TTS 的调用成本让不少实时对话、会议转录、客服机器人应用难以规模化。此次最高 95% 的降价,配合 ASR-Next 的情绪与环境音识别、TTS-Next 的音效一次生成,说明竞争焦点正从“能不能识别和合成”转向“单次调用能承载多少信息量、单价能压到多低”。对阿里云来说,这既是把 Qwen 音频能力推向开发者生态的动作,也是在音频 API 市场与国内外同类服务争夺定价权。
对用户/开发者/创作者的影响
开发者可以重新测算语音类产品的成本结构:实时语音对话、长时会议转录、多说话人分离这类高调用量场景,此前最容易受价格制约,现在单位成本明显下降。创作者则多了一个可控性更强的工具,情绪、语速、风格通过文本提示调节,跨语言音色迁移也降低了多语种配音的制作门槛。企业采购方需要留意的是,价格和模型能力都来自 Qwen 官方公布,实际稳定性、延迟和并发表现仍需在自有场景中测试,目前公开信息未给出详细的限流与 SLA 条款。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是降价后的实际调用体验是否同步提升,尤其是实时模型的打断响应和情绪识别准确率;二是 ASR-Next 的情绪、环境音、机器噪声识别在真实录音场景下的可用程度,这决定它能否进入质检、医疗记录等高要求领域;三是国内外音频 API 厂商是否会跟进调价,以及 Qwen 这套音频模型是否会有开源版本放出。


