AI 音乐生成器 Suno 现在能生成朗读语音了

Suno 在原有 AI 音乐生成之外,上线了公开测试版的 Speech 功能,可以按脚本或提示词生成配音,并同时配上一段 AI 背景音乐。它把语音合成和音乐生成塞进同一条音轨,试图在竞争激烈的 TTS 市场之外,找到自己的差异化入口。

一句话看懂:Suno 在原有 AI 音乐生成之外,上线了公开测试版的 Speech 功能,可以按脚本或提示词生成配音,并同时配上一段 AI 背景音乐。它把语音合成和音乐生成塞进同一条音轨,试图在竞争激烈的 TTS 市场之外,找到自己的差异化入口。

事件核心:发生了什么

2026 年 10 月 2 日,Suno 宣布 Speech 功能在网页端和移动端同步进入公开测试。用户可以在“Create”标签下找到 Speech 选项,输入提示词或自定义脚本来生成朗读语音。它提供两种模式:Simple,用一段描述性提示生成内容,比如“一个海盗船长在给他的船员打气”;Advanced,则允许直接填入完整脚本。高级设置还能调整 AI 声音的性别、说话风格,以及每次生成之间的语音变化幅度。Speech 单条音轨最长约 8 分钟。

Suno 首席产品官 Jack Brody 在公告中表示,音乐始终是 Suno 的核心,但公司的愿景一直延伸到其他人类表达形式,Speech 是首个把语音和音乐作为一整条连贯音轨同时生成的音频模型。背景音乐可以通过开关关闭,只保留干净人声。

为什么重要

AI 语音生成并不新鲜。DeepMind 做深度学习语音合成已有约十年,Adobe 有文本转语音工具,ElevenLabs 自 2023 年推出后也已成为这个赛道最知名的平台之一。Suno 此时入局,更像是在为自己的产品线寻找第二增长点——它的音乐生成器已经吸引了大量诉讼,单一业务的法律与平台风险都在累积。

更值得注意的是产品形态:Suno 没有把 Speech 做成一个纯粹的 TTS 工具,而是把配音和配乐打包成一条音轨。这在当前主流语音合成产品里并不常见,等于把“音乐生成”的既有能力复用到语音场景,形成组合式输出。对一家以音乐模型起家的公司来说,这是一次围绕同一套音频生成能力的横向扩张,而不是从零搭建一个语音模型。

对用户/开发者/创作者的影响

对内容创作者来说,Speech 的定位比较明确:短篇叙事、诗歌配乐、戏剧化旁白、演讲式配音,这类既需要人声又需要氛围音轨的场景可以直接在一个工具里完成,不用再分别找 TTS 和音乐生成工具做拼接。8 分钟的上限也意味着它更适合短视频、播客片段、广告旁白,而不是长篇有声书。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者而言,目前公开信息显示 Suno 并未在公告中提及 Speech 的 API 或对外开放接口,所以短期内它更像是一个面向终端用户的创作功能,而不是可被集成的底层能力。如果后续开放 API,它和 ElevenLabs 等纯语音平台会形成直接对比:Suno 的卖点是音画一体,ElevenLabs 的优势则在于更成熟的语音克隆和开发者生态。

对普通用户来说,门槛很低:不需要音频编辑经验,用一段文字描述或现成脚本就能出成品。Suno 自己也承认功能远非完美,Brody 说“Beta 就是 Beta”,并举例称英式口音偶尔会飘到澳大利亚再飘回来,戏剧性停顿有时会过于戏剧化。

值得关注的后续

第一,Speech 是否以及何时开放 API。如果只停留在消费级产品,它很难撬动已经用 ElevenLabs 等平台做集成的开发者;一旦开放接口,音频生成市场的竞争格局会多一个变量。

第二,语音质量和口音控制的迭代速度。Suno 明确表示会围绕用户反馈持续改进,口音漂移、停顿控制这类问题能否在几次版本更新内收敛,会直接影响它在专业配音场景里的可用性。

第三,版权和合规压力是否会随之扩大。Suno 的音乐业务本就面临多起诉讼,语音合成叠加音乐生成后,训练数据来源、声音模仿边界、商用授权规则都可能成为新的争议点,目前公开信息尚未披露 Speech 的具体合规安排。

来源:The Verge

celebrityanime
celebrityanime
文章: 26897

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注