通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜

通义千问于2026年7月23日发布全新文本转语音模型Qwen-Audio-3.0-TTS,推出Flash和Plus两个版本,凭借精细的语音控制、16种语言支持和3分钟超长文本一次合成能力,在Artificial Analysis TTS排行榜上登顶第一。

通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜

一句话看懂:通义千问于2026年7月23日发布全新文本转语音模型Qwen-Audio-3.0-TTS,推出Flash和Plus两个版本,凭借精细的语音控制、16种语言支持和3分钟超长文本一次合成能力,在Artificial Analysis TTS排行榜上登顶第一。

事件核心:发生了什么

通义千问(Qwen)正式推出Qwen-Audio-3.0-TTS模型,包含两个版本:Flash 定位实时交互场景,侧重低延迟;Plus 面向高质量语音生成场景。核心能力提升包括:支持通过内联标签精细控制语气的“whisper”(耳语)、“angry”(愤怒)、“breaths”(呼吸声)和“laughs”(笑声);支持自由风格的自然语言指令,例如“像睡前故事一样慢读”;覆盖16种语言;即使参考音频有噪音也能输出干净语音;支持单次生成长达3分钟的长文本。该模型已登上Artificial Analysis TTS排行榜首位。

为什么重要

Qwen-Audio-3.0-TTS的发布意味着阿里在语音生成领域的技术能力进入行业第一梯队。登顶TTS排行榜说明其合成质量、多语言覆盖和长文本处理能力已获得权威评测认可。更重要的是,它没有停留在单一技术指标上,而是同时提供了实时交互(Flash)高质量生成(Plus)两个方向,这直接对应了智能助手、客服系统、有声读物和虚拟主播等实际商用场景。相较于市面上多数TTS模型要么侧重速度、要么侧重质量,Qwen选择双版本并行,在竞争格局中填补了“兼顾灵活性”的空白。

对用户/开发者/创作者的影响

对开发者而言,Qwen-Audio-3.0-TTS提供了更细粒度的语音控制接口——通过内联标签就能在1秒内切换语气和情绪,开发智能交互应用(如语音助手、教育软件)的门槛进一步降低。同时,一次生成3分钟长文本的能力减少了分片拼接的工程负担。对内容创作者,自然语言式的指令(“用低沉的声音缓慢读”)使得非技术人员也能直接操控语音风格,有声书、播客、视频配音等场景的创作成本大幅下降。对企业用户,多语言覆盖和抗噪能力意味着出海产品、客服系统可以直接使用该模型,减少自研或外部采购的投入。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,定价与API开放范围。目前阿里云已公布API文档,但正式商业化定价和免费额度尚未完全公开,这直接决定中小开发者能否快速接入。第二,竞品跟进速度。百度、讯飞、OpenAI(Whisper/TTS系列)等玩家大概率会在3-6个月内推出类似的多版本、长文本能力,阿里能否保持领先取决于迭代速度和开源策略。第三,Flash版本的实时性实测。虽然定位“实时交互”,但具体延迟数据(如端到端响应时间)仍需第三方评测,这将影响其在智能对话、实时翻译等场景的实际可用性。

来源:X:通义千问 / Qwen (@Alibaba_Qwen)

celebrityanime
celebrityanime
文章: 14895

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注