Google 推出 Gemini 3.5 Transcribe,支持 AI 语音转文字

Google 正式发布 Gemini 3.5 Transcribe,一个面向语音转写场景的专用 AI 模型,能自动去除“嗯”“啊”等语气词并即时修正口误,输出更干净的文字。它已在 Pixel 11 的 Gboard 中运行,接下来将覆盖 Chrome、macOS Gemini 应用和开发者 API。

一句话看懂:Google 正式发布 Gemini 3.5 Transcribe,一个面向语音转写场景的专用 AI 模型,能自动去除“嗯”“啊”等语气词并即时修正口误,输出更干净的文字。它已在 Pixel 11 的 Gboard 中运行,接下来将覆盖 Chrome、macOS Gemini 应用和开发者 API。

事件核心:发生了什么

在 Gemini 3.5 Pro 尚未发布的情况下,Google 先推出了同属 3.5 分支的专用模型 Gemini 3.5 Transcribe,主打 AI 语音转文字。相比上一代语音引擎 Chirp 3,新模型从语音到成稿的速度提升约 70%,实时语音错误率从 7.32% 降至 5.5%,提升幅度不算大,但胜在能自动清理语音输入中的“嗯”“呃”等非流利表达,并在说话过程中实时修改口误。此外,它支持 85 种语言,可在预先录制的音频中区分至多三个说话人,并能调用用户自定义词汇表处理专业术语。

该模型已率先搭载于 Pixel 11 的 Gboard “Rambler” 功能,并自发布日起在 macOS 版 Gemini 应用中生效。开发者方面,Google 的 AI 开发平台 Antigravity 和 AI Studio 均已接入该模型,允许开发者通过 Gemini API 调用。

为什么重要

语音输入长期受困于口语不连续性和识别错误,传统转写引擎只能做“听写”,无法理解语义。Gemini 3.5 Transcribe 的思路是用大模型直接理解“你想说什么”,而非逐字记录“你说了什么”。这意味着语音转写正从单纯的识别任务,转向语义级的内容编辑与重构,是端侧与云端 AI 在交互入口上的一次落地升级。

对 Google 而言,此举也填补了 Gemini 3.5 产品线的空窗期,并为其语音生态——从 Pixel 硬件、Gboard 输入法到 Chrome 浏览器、开发者工具——提供了一个统一的底层能力。相比通用大模型竞争,这种嵌入系统级交互的专用模型,更容易形成实际的用户粘性。

对用户/开发者/创作者的影响

普通用户:在 Pixel 11 上使用 Gboard 语音输入时,能得到更干净、更接近书面语的文字,减少修改错别字的操作。Google 表示今年晚些时候会将 Rambler 扩展到更多支持“Gemini Intelligence”的设备,并计划在 Chrome 浏览器中上线,届时在任意网页输入框内都可以用语音生成邮件、评论或聊天内容。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

开发者:通过 Gemini API 或 Antigravity 平台,开发者可直接集成这一语音转写能力,用于会议记录、视频字幕、语音笔记等应用。值得注意的是,该模型在 Antigravity 中可结合屏幕上下文和聊天历史(需用户授权),这意味着语音助手类应用有机会实现更上下文相关的交互。

创作者与内容生产者:对于需要快速产出逐字稿或访谈整理的用户,新模型能显著缩短后期清理口语表达的时间。但也需要留意,AI 会主动修改你原话的措辞,在追求高度精确引用的场景(如法律、新闻采访)中,这种“美化”可能并不合适。

值得关注的后续

一是 Chrome 浏览器版本的具体上线时间与功能限制,目前 Google 只表示“即将推出”,尚未明确是否对所有用户免费开放。二是该模型是否会以独立 API 形式收费,以及定价如何与 Chirp 3 或其他转写服务竞争。三是竞品反应——OpenAI 的 Whisper 系列和苹果的语音识别均在持续迭代,Gemini 3.5 Transcribe 的语义级清洗能力是否会成为行业标配,值得观察。最后,AI 转写过程中对原话的主动改写,也可能会引发关于“转写准确性与忠实性”的讨论,尤其在正式记录场景下的使用边界。

来源:Ars Technica

celebrityanime
celebrityanime
文章: 20578

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注