Gemini 3.8 文本转语音功能来了

Google DeepMind 于 2026 年 9 月 23 日发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,把语音生成从固定预设变成可用自然语言“导演”的创作过程。

一句话看懂:Google DeepMind 于 2026 年 9 月 23 日发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,把语音生成从固定预设变成可用自然语言“导演”的创作过程。

事件核心:发生了什么

两款新模型定位不同。Gemini 3.8 Flash TTS 面向深度创作与角色设计,支持用自然语言提示从零生成全新音色,覆盖超过 100 种语言和方言,官方称可访问 2000 多个成品音色,包括墨西哥西班牙语、魁北克法语、苏格兰英语等地区变体。Gemini 3.8 Flash-Lite TTS 则面向高并发、低成本场景,如批量配音和语音代理。

更关键的是控制粒度:用户可逐行给出台词、节奏、情绪、口音甚至插话和背景对话等指令。仅需 30 秒音频样本即可复刻音色,并配有同意验证、SynthID 水印和 C2PA 凭证。语音重混(调整音色、音高、语速、口音)标注为“即将推出”。模型已接入 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids。

为什么重要

此前 TTS 多停留在选音色、调语速的层面,Gemini 3.8 把“表演指导”写进了提示词,相当于把配音导演的部分工作交给模型。这延续了 Gemini Audio 家族从 3.5 Live Translate、3.5 Transcribe 到 3.8 Live 的扩张节奏,也说明大模型竞争正从文本、图像生成转向音频这类更强调时序与表现力的模态。对闭源 API 生态而言,它强化了 Google 在“模型即创作工具”上的位置;对开源方案来说,音色复刻的合规工具链可能成为新的门槛。

对用户/开发者/创作者的影响

创作者可以用它做有声书、播客、游戏角色对白,逐行控制情绪和口音,减少后期剪辑成本。开发者通过 Gemini API 可把语音代理接入客服、教育或互动媒体,Flash-Lite 更适合大规模、低单价场景。企业侧需注意:音色复刻要求拥有使用权并经过同意验证,SynthID 和 C2PA 也意味着生成音频可被追溯,采购时应把合规审查纳入流程。目前公开信息未披露具体定价和推理延迟,实际成本仍需等 API 计费页面确认。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是语音重混功能何时正式上线,以及自定义音色能否跨项目稳定复用、减少漂移;二是 Flash 与 Flash-Lite 的价格和吞吐差异,是否真能支撑实时语音代理;三是竞品在情感可控 TTS 上的跟进速度,以及水印与监管要求是否影响部分地区上线。

来源:Google DeepMind

celebrityanime
celebrityanime
文章: 25218

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注