阿里巴巴统一实验室发布 Qwen-Audio-3.0-TTS,一种跨 16 种语言的 Flash 和 Plus 层托管文本转语音模型

阿里巴巴统一实验室(Tongyi Lab)于 2026 年 7 月 20 日发布了 Qwen-Audio-3.0-TTS,这是一个面向开发者的托管文本转语音模型,支持 16 种语言并以“Flash”和“Plus”两种层级提供。这意味着阿里在语音合成领域推出了更细分、更商业化的服务,直接对标当前市场上日益增长的…

阿里巴巴统一实验室发布 Qwen-Audio-3.0-TTS,一种跨 16 种语言的 Flash 和 Plus 层托管文本转语音模型

一句话看懂:阿里巴巴统一实验室(Tongyi Lab)于 2026 年 7 月 20 日发布了 Qwen-Audio-3.0-TTS,这是一个面向开发者的托管文本转语音模型,支持 16 种语言并以“Flash”和“Plus”两种层级提供。这意味着阿里在语音合成领域推出了更细分、更商业化的服务,直接对标当前市场上日益增长的 AI 配音和语音交互需求。

事件核心:发生了什么

根据 MarkTechPost 的报道,阿里巴巴统一实验室正式推出了 Qwen-Audio-3.0-TTS。该模型是一个“托管”服务,意味着用户无需自行部署或训练模型,而是通过 API 直接调用。其最显著的特色是同时提供“Flash”层和“Plus”层——这可能对应了不同的响应速度、合成质量或计算成本。在语言支持方面,Qwen-Audio-3.0-TTS 覆盖了包括中文、英文、日文、韩文、法文、德文等在内的 16 种主流语言。发布时间为 2026 年 7 月 20 日,信息源为 MarkTechPost 的研究文章。

为什么重要

该发布在 AI 语音合成领域的竞争格局中有明确的标志意义。首先,“托管 + 分层”的模式正在成为语音 API 的标配,阿里此举直接对标了此前 OpenAI 的 TTS 服务和微软的 Azure Speech 语音服务的分层策略。通过 Flash(推测为低延迟、性价比模式)和 Plus(推测为高保真、情感丰富模式)的分级,阿里试图覆盖从实时对话到高质量内容制作的不同场景。其次,支持 16 种语言意味着该模型在发布时就具备较强的跨语言能力,这对于面向海外市场或需要多语种内容创作的开发者而言,降低了切换不同语音引擎的集成成本。对阿里自身而言,这是其“Qwen”系列大模型生态在语音模态上的重要补全,强化了从文本、图像到语音的 AI 多模态闭环。

对用户/开发者/创作者的影响

对于开发者来说,这意味着可以直接通过阿里云的 API 集成一个覆盖 16 种语言且分层定价的语音合成能力,无需自研模型或从头训练。对于内容创作者(如播客、短视频、有声书制作者),Plus 层的高质量输出可能成为提升作品听感的新工具,而 Flash 层适合对实时性要求高的场景。对于企业用户,特别是那些需要多语种客服或语音助手的公司,Qwen-Audio-3.0-TTS 提供了一个统一的跨语言解决方案,有望减少外包配音或多家供应商切换的负担。不过目前公开信息显示,具体的 API 调用价格、Flash 和 Plus 的详细性能参数(如延迟、自然度评分)尚未完全披露,需要等阿里云官方文档更新后才可评估性价比。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

以下三点值得持续跟踪:第一,阿里云何时开放该模型的付费 API 以及 Flash 和 Plus 的定价细节——这将直接影响开发者的实际采用率。第二,该模型是否会像阿里系的其他 AI 模型一样推出开源版本。如果开源,将对小型团队和研究者产生更大的冲击。第三,竞品反应——百度、字节跳动的火山引擎、科大讯飞等国内企业在听到阿里发布新 TTS 模型后,是否会在短期内推出类似的分层语音合成方案。此外,海外需关注 OpenAI 及 ElevenLabs 是否有相应的价格调整或功能升级。

来源:MarkTechPost Research

celebrityanime
celebrityanime
文章: 14558

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注