一句话看懂:Google DeepMind 于 2026 年 9 月 23 日发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,把语音生成从固定预设变成可用自然语言“导演”的创作过程。
事件核心:发生了什么
两款新模型定位不同。Gemini 3.8 Flash TTS 面向深度创作与角色设计,支持用自然语言提示从零生成全新音色,覆盖超过 100 种语言和方言,官方称可访问 2000 多个成品音色,包括墨西哥西班牙语、魁北克法语、苏格兰英语等地区变体。Gemini 3.8 Flash-Lite TTS 则面向高并发、低成本场景,如批量配音和语音代理。
更关键的是控制粒度:用户可逐行给出台词、节奏、情绪、口音甚至插话和背景对话等指令。仅需 30 秒音频样本即可复刻音色,并配有同意验证、SynthID 水印和 C2PA 凭证。语音重混(调整音色、音高、语速、口音)标注为“即将推出”。模型已接入 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids。
为什么重要
此前 TTS 多停留在选音色、调语速的层面,Gemini 3.8 把“表演指导”写进了提示词,相当于把配音导演的部分工作交给模型。这延续了 Gemini Audio 家族从 3.5 Live Translate、3.5 Transcribe 到 3.8 Live 的扩张节奏,也说明大模型竞争正从文本、图像生成转向音频这类更强调时序与表现力的模态。对闭源 API 生态而言,它强化了 Google 在“模型即创作工具”上的位置;对开源方案来说,音色复刻的合规工具链可能成为新的门槛。
对用户/开发者/创作者的影响
创作者可以用它做有声书、播客、游戏角色对白,逐行控制情绪和口音,减少后期剪辑成本。开发者通过 Gemini API 可把语音代理接入客服、教育或互动媒体,Flash-Lite 更适合大规模、低单价场景。企业侧需注意:音色复刻要求拥有使用权并经过同意验证,SynthID 和 C2PA 也意味着生成音频可被追溯,采购时应把合规审查纳入流程。目前公开信息未披露具体定价和推理延迟,实际成本仍需等 API 计费页面确认。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是语音重混功能何时正式上线,以及自定义音色能否跨项目稳定复用、减少漂移;二是 Flash 与 Flash-Lite 的价格和吞吐差异,是否真能支撑实时语音代理;三是竞品在情感可控 TTS 上的跟进速度,以及水印与监管要求是否影响部分地区上线。


