首包延迟300ms、支持20种方言:通义千问Qwen-Audio-3.0-TTS正式开放

阿里通义千问团队发布新一代实时语音合成模型 Qwen-Audio-3.0-TTS,推出 Flash 和 Plus 两个版本,其中 Plus 版本在 Artificial Analysis 全球语音排行榜 Speech Arena 上排名第一。该模型支持 16 种语言和 20 种中文方言,首包延迟低至 300m…

首包延迟300ms、支持20种方言:通义千问Qwen-Audio-3.0-TTS正式开放

一句话看懂:阿里通义千问团队发布新一代实时语音合成模型 Qwen-Audio-3.0-TTS,推出 Flash 和 Plus 两个版本,其中 Plus 版本在 Artificial Analysis 全球语音排行榜 Speech Arena 上排名第一。该模型支持 16 种语言和 20 种中文方言,首包延迟低至 300ms,即日起可在阿里云百炼平台调用。

事件核心:发生了什么

7 月 20 日,阿里通义千问团队正式发布 Qwen-Audio-3.0-TTS 模型。本次共推出两个版本:Flash 版本面向实时交互场景,首包延迟约 300ms,适合智能助手等低延迟应用;Plus 版本侧重高质量生成,在 16 种语言上平均说话人相似度达到 82.75%,在该指标上排名行业第一。该模型在 Artificial Analysis 的全球语音评测榜单 Speech Arena 上表现超过 Gemini 3.1 TTS 和 ElevenLabs v3 等主流竞品。

模型核心能力升级集中在四个方面:支持 16 种语言及 20 种中文方言,且能保留方言特有表达特征;用户可通过“温柔客服语气”“直播带货风格”等自然语言指令直接控制语音生成,无需专业标注;支持 [gasp](喘息)、[angry](愤怒)等结构化标签,实现对呼吸、笑声等非语言细节的精确操控;具备强声学鲁棒性,即使参考音频存在高噪音或混响,也能自动过滤背景杂音并保留音色。

目前该模型已在阿里云百炼平台开放,开发者可通过 API 接入。伴随模型发布的语音库包含指令、方言和小语种等类型,支持 48K 高清音频输出,该能力预计于 7 月 24 日开放,单次合成最长可达 3 分钟。

为什么重要

Qwen-Audio-3.0-TTS 的发布是语音合成从“能说话”向“会表达”的阶段性跨越。此前的 TTS 产品大多在标准普通话和英语上表现较好,但在方言覆盖、口语化表达和非语言细节控制方面存在短板。该模型通过方言 20 种、自然语言指令、结构化标签三个切入点,降低了专业语音合成的使用门槛,同时提升了合成结果的情感表现力。从行业竞争角度看,它在 Speech Arena 上超越 Gemini 和 ElevenLabs,表明国产语音合成模型在全球化评测中已具备头部竞争力。对阿里云而言,将模型内置到百炼平台,也有助于拉通语音、文本和图像的整体 AI 生态。

对用户/开发者/创作者的影响

对开发者,最关键的变化是可以通过自然语言指令和标签来生成语音,大幅减少了以往需要手动标注音色、语速、情绪样式的工作量,适合快速构建智能客服、语音助手、有声读物生成等应用。对 AI 内容创作者,方言支持 20 种意味着可以生产更多本地化内容,例如地方方言播报、本地化配音等。对普通用户,Flash 版本的 300ms 首包延迟意味着实时对话场景(如语音助手、导航播报)的体验更接近真人对话,不再出现明显卡顿。此外,48K 高清输出对播客、有声书等对音质要求较高的场景也有实际提升。目前模型已经开放,开发者可在百炼平台直接测试和集成。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,48K 高清音频输出能力在 7 月 24 日开放后,是否会引发一批主打高品质音频的 AI 有声书或播客创作工具上线。第二,目前 Flash 和 Plus 版本的具体定价尚未公开,不同量级的使用成本将直接影响中小开发者的采用率。第三,方言场景下是否有其他厂商(如百度、讯飞)跟进类似的自然语言指令控制方式,以及第三方评测是否会在中文方言上做专项比拼,都将影响语音合成市场的竞争格局。

来源:AIbase

celebrityanime
celebrityanime
文章: 14524

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注