
一句话看懂:阿里巴巴最新发布的Qwen-Audio-3.0-TTS-Plus模型在第三方测评平台Artificial Analysis的文本转语音排行榜上以1236的Elo评分登顶,仅以微弱优势超越SpeechifyAI的Simba 3.2。这一结果意味着国产大模型在语音合成赛道已具备全球顶尖的听感竞争力,但推理速度偏慢仍是其商业化的主要短板。
事件核心:发生了什么
在Artificial Analysis最新发布的“Speech Arena”文本转语音排行榜中,阿里巴巴的Qwen-Audio-3.0-TTS-Plus以1236的Elo评分位列第一,紧随其后的是Simba 3.2(1234分)、Gemini 3.1 Flash TTS(1214分)和Sonic 3.5(1207分)。该模型提供两个版本:Flash版面向实时交互场景,延迟约300毫秒;Plus版则专注高质量语音输出。它支持16种语言,包括他加禄语、马来语、泰语、越南语及多种中国方言,用户可通过自然语言或标签指令(如[angry]、[giggles])控制说话风格。在防止克隆声音时,该模型对嘈杂或回声较大的参考录音处理能力也比前代更强。
为什么重要
这一排名直接说明了中国AI企业在语音合成领域的竞争力已进入全球第一梯队。对比此前由Hume AI的Octave v2或Sonic 3.5主导的局面,Qwen Audio 3.0的登顶意味着阿里在语音大模型的自研算法、多语言覆盖和情感控制能力上取得了实质性突破。更重要的是,该模型通过阿里云Model Studio以每百万字符27.60美元的价格开放API,表明阿里巴巴已将先进的TTS能力转化为可直接采购的云服务,而非仅限于内部产品使用。这对OpenAI、Google等依赖闭源TTS模型或高价API的厂商构成了定价和性能上的双重压力。
对用户/开发者/创作者的影响
对于AI应用开发者,特别是需要多语言、多风格语音合成的场景(如播客生成、智能客服、有声书制作),Qwen-Audio-3.0提供了一个低成本且排名领先的开箱即用选项。它的16种语言覆盖弥补了许多竞品对小语种支持的不足。不过,开发者也需关注其速度限制:仅16字符/秒的输出速度远低于Sonic 3.5的120字符/秒和Simba 3.2的30.2字符/秒。这意味着,若应用场景对实时性要求极高(如直播旁白、即时语音助手),Flash版可能是更合理的选择;而Plus版更适合延迟容忍度较高的后处理或批量生成场景。内容创作者则可以利用其自然语言风格控制标签,无需复杂编程即可调整语音情感,降低脚本配音的制作门槛。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,以下三点值得持续跟踪:第一,阿里是否会推出速度更快的优化版本,或降低Flash版的延迟以争夺实时交互市场;第二,竞品如ElevenLabs、OpenAI是否会基于这一排名调整价格或推出新模型;第三,该模型在实际大规模调用中的稳定性和隐私合规表现,尤其是在企业级文本转语音应用中如何满足数据不出境的本地化部署需求。若阿里能同步提升推理速度或推出边缘端模型,这一产品的市场潜力将进一步放大。


