
一句话看懂:通义实验室发布新一代语音合成模型 Qwen-Audio-3.0-TTS,包含 Flash(低延迟)和 Plus(高质量)两个版本,在第三方评测中多项指标领先。其最直接的变化是支持 16 种语言、20 种方言,并允许用户用自然语言“指挥”声音的情绪、角色和场景,而非仅靠技术参数调优。
事件核心:发生了什么
通义实验室于近日发布 Qwen-Audio-3.0-TTS 实时语音合成模型。此次推出两个版本:Flash 版本面向实时交互场景,首包延迟控制在 300ms 左右;Plus 版本面向高精度生成场景,在自然度和音色还原上表现更优。在 Artificial Analysis 全球第三方权威榜单中,Plus 版本获得冠军。
模型更新重点解决了四个开发者在生产环境中遇到的真实问题:更广的语言覆盖(新增至 16 种语言)、更自然的指令控制(支持 Free-style 自然语言指令)、更精细的标签控制(支持 [gasp]、[giggles]、[angry] 等结构化标签)以及对复杂环境的鲁棒性(自动过滤噪声,保留音色)。除技术升级外,模型还配套推出了精品音色库,覆盖 20 种方言音色和 14 款以上小语种音色,输出采样率从 24kHz 跃升至 48kHz,单次合成支持最长 3 分钟。
为什么重要
本次发布的意义不在于“又一款新模型”,而在于它直接回应了语音合成从“能说话”到“会表达”的商业化痛点。此前业内多数模型在跨语言、多方言和噪声音色复刻上表现不稳定,导致出海和下沉市场项目需要投入大量后期标注与调整成本。Qwen-Audio-3.0-TTS 在 16 种语言中 10 种取得了最低 WER/CER(语音识别错误率),且 Plus 版本在所有语言的说话人相似度评测中排名第一,说明其在多语种和方言场景下具备了可规模化部署的能力。此外,自然语言指令控制降低了非 AI 专业开发者的使用门槛,可能加速语音合成在客服、直播、有声书、教育等垂直行业的快速落地。
对用户/开发者/创作者的影响
对开发者而言,Free-style 自然语言指令控制意味着不必掌握声学参数即能调整情绪、语速和角色,减少了二次开发工作量;Flash 版本 300ms 的低首包延迟可直接接入实时对话系统,如语音助手、电话客服。对内容创作者和出版商,48kHz 输出和最长 3 分钟单次合成在当前行业内属于较高规格,适合长音频制作,而精品音色库提供了开箱即用的方言和小语种方案。对出海企业,多语言覆盖和噪声音色复刻优化降低了海外部署的本地化成本。需特别指出的是,部分方言、小语种音色及 48kHz 高采样输出目前在阿里云百炼平台正陆续上线,其中 48kHz 功能预计于 7 月 24 日正式开放。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
其一,定价与性能平衡:Plus 版本在评测中表现最优,但其是否全量开放以及实时接口的延迟和价格是否对标现有主流 API,将直接影响开发者的选型判断。其二,生态集成度:Qwen-Audio-3.0-TTS 目前已上架阿里云百炼平台,后续是否会与通义系列其他模型(如 Qwen-VL、Qwen2)形成原生协作,影响其在多模态 AI 应用中的竞争力。其三,竞品跟进速度:同期国内外多家厂商(如 OpenAI、微软、科大讯飞、百度)均在推进实时语音合成,该模型能否在成本和效果上持续保持领先,还需观察后续迭代和客户反馈。


