一句话看懂:阿里通义千问发布 Qwen-Audio-3.1 音频全家桶,在升级 ASR、TTS、Realtime 三条产品线的同时新增 TTS-Next 与 ASR-Next,并宣布全线大幅降价,最高降幅达 95%。
事件核心:发生了什么
据通义千问官方账号 @Alibaba_Qwen 发布的信息,Qwen-Audio-3.1 一次性推出五个模型,覆盖语音识别、语音合成、实时交互与音频创作,官方将其定位为”一套完整的音频栈”。具体变化包括:ASR 强化多语言与方言识别,并新增文本润色能力,可自动去除口语填充词和重复内容,输出更干净、更有逻辑的转写结果;新模型 ASR-Next 支持多说话人识别,提供说话人标签、时间戳与对齐文本,同时能理解情绪、环境声与机器声,可用于声音描述、事件定位和音频问答推理。TTS 侧支持多语言与方言合成,并可通过指令控制情绪、语速和风格;新模型 TTS-Next 采用 LM 加扩散的统一框架,一次生成语音、音效和背景音,面向有声书、播客、游戏和广告场景。Realtime 支持边说边听、随时打断,官方称在感知到用户情绪低落时会放慢语速并作出共情回应。价格方面,TTS 约降价 70%,Realtime 约降价 85%,ASR 最高降价 95%。
为什么重要
这次更新的重点不只是模型数量,而是把音频能力的几个原本割裂的方向——听懂、说话、实时交互、声音创作——收拢到同一套体系下。目前公开信息显示,ASR-Next 把说话人分离、时间戳和声音事件理解放进同一个模型,TTS-Next 则尝试用统一框架同时产出人声与音效,这类整合在开源与闭源阵营中都还不多见。配合大幅降价,通义千问显然在用价格压缩竞争对手在语音 API 上的利润空间,争夺开发者和企业客户的接入量。对音频类 AI 应用而言,推理成本一直是制约规模化的关键变量,ASR 降价 95% 意味着大量此前不划算的场景(如全量通话质检、长音频归档)可能重新具备商业可行性。
对用户/开发者/创作者的影响
开发者最直接的变化是调用成本下降,尤其是以 ASR 为核心的长音频处理类应用,可以重新核算单位经济模型;Realtime 降价 85% 也让实时语音 Agent、陪聊、客服类产品的成本压力明显减轻。创作者可以关注 TTS-Next 的一站式生成能力,有声书、播客片头和游戏音效可能不必再拼接多个工具链。普通用户短期内可能感知不到底层变化,但会逐渐遇到更自然的方言语音、更干净的转写文本,以及能被打断、有情绪反馈的语音助手。需要注意的是,新模型的具体 API 开放时间与配额限制,目前官方仅表示”更多 API 即将推出”。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 ASR-Next 与 TTS-Next 的实际开放节奏和定价,是否与宣传一致;二是降价后语音 API 市场是否引发同类厂商跟进,形成新一轮价格竞争;三是 Realtime 的情绪感知与共情回应在实际通话场景中的准确率,以及是否涉及情绪数据合规问题。


