Google的新AI转录功能会删掉你的“嗯”和“啊

Google 在 Gemini 3.5 Pro 迟迟未发布的情况下,先推出了三款 Gemini Audio 新模型,其中全新的 3.5 Transcribe 可以在语音转写时自动删除“嗯”“啊”等语气词,并支持超过 85 种语言。这标志着语音交互从“听清”向“理解并整理”迈了一步。

一句话看懂:Google 在 Gemini 3.5 Pro 迟迟未发布的情况下,先推出了三款 Gemini Audio 新模型,其中全新的 3.5 Transcribe 可以在语音转写时自动删除“嗯”“啊”等语气词,并支持超过 85 种语言。这标志着语音交互从“听清”向“理解并整理”迈了一步。

事件核心:发生了什么

据 The Verge 报道,Google 于 2026 年 8 月 26 日更新了 Gemini Audio 系列,一次性推出三款基于 Gemini 3.5 的模型:3.5 Live、3.5 Live Experimental 和全新的 3.5 Transcribe。这一动作的背景是,Google 此前承诺在 6 月发布的 Gemini 3.5 Pro 至今仍未上线。

最值得关注的是 3.5 Transcribe。Google 称它是上一代转录模型 Chirp 3 的一次“重大升级”,尤其在多语言表现和词错率方面有显著改善。它具备三个核心能力:一是自动去除“um”“uh”等填充词;二是允许用户提供自定义词汇表,自动适配专业术语和特殊拼写,减少手动修改;三是支持在预录音频中区分最多三个说话人,并提供词级时间戳。该模型还支持超过 85 种语言。

另外两款 Live 模型则侧重于实时语音交互:3.5 Live 优化了打断处理、语言识别和实时视觉处理能力;3.5 Live Experimental 更进一步,会在处理复杂推理任务时实时逐步叙述自己的思考过程。

为什么重要

这次更新有两个关键信号。第一,Google 在旗舰 Pro 模型跳票的情况下,先以音频模型试水,说明语音交互被提到了更优先的位置——AI 竞赛的焦点正在从纯文本生成转向多模态实时交互。第二,“去除语气词”和“自动格式化”看似小而轻,其实指向一个更务实的方向:AI 不再只是生成内容,而是开始主动“清理”人类表达中的噪音,让转录结果更接近可交付的成品。

从技术路线看,3.5 Transcribe 支持自定义词汇表,意味着模型正在向垂直场景渗透——医疗、法律、金融等术语密集的行业,通用转录模型往往不够用,按需定制词汇成为差异化竞争的实用切入口。这比单纯堆参数更能落地。

对用户/开发者/创作者的影响

普通用户:语音输入的效率会明显提升。过去用语音转文字后还需要手动删掉语气词、调整标点,现在模型直接输出更干净的文本,适合写邮件、记录想法等日常场景。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

开发者:这三款模型即日起通过 Gemini API 在 AI Studio 和 Antigravity 中提供公开预览,支持英语。对做语音笔记、会议纪要、字幕生成、播客转录等应用的产品来说,可以省掉大量后处理逻辑——尤其是“去除填充词”和“多说话人区分”这两个能力,此前往往需要额外模型或复杂规则来实现。

创作者与内容团队:播客、采访、视频字幕的转录效率有望提升,特别是需要多语言支持或涉及专业术语的项目,自定义词汇功能可以减少字幕校对时间。不过目前只在 macOS Gemini 应用和部分地区的 Android Rambler 听写功能中上线,Chrome 支持尚未推出,覆盖范围仍然有限。

值得关注的后续

1. Gemini 3.5 Pro 何时落地:音频模型先行的策略是否意味着 Pro 版遇到延迟,还是团队有意分线推进,值得继续观察。

2. 价格与开放范围:目前公开预览阶段的定价尚未公布,API 正式商用后调用成本如何——这直接决定中小开发者是否用得起。

3. 竞品反应:OpenAI 的 Whisper 系列和亚马逊的 Transcribe 都是直接竞品。如果 Google 在多语言和术语定制上确实拉开差距,竞品的迭代速度会是一个观察点。另外,“去除语气词”的处理是否会让转录内容失真,也可能引发关于 AI 转录“是否该忠于原话”的讨论。

来源:The Verge

celebrityanime
celebrityanime
文章: 20497

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注