Gemini 3.5 Transcribe 发布:更精准的实时语音转写模型

Google 于 2026 年 8 月 26 日发布 Gemini 3.5 Transcribe 语音转写模型,主打低错误率、实时流式转写和智能清理口头语。该模型相比前代 Chirp 3 在延迟和词错误率上显著提升,并已开放给开发者通过 Live API 和 Interactions API 接入。

一句话看懂:Google 于 2026 年 8 月 26 日发布 Gemini 3.5 Transcribe 语音转写模型,主打低错误率、实时流式转写和智能清理口头语。该模型相比前代 Chirp 3 在延迟和词错误率上显著提升,并已开放给开发者通过 Live API 和 Interactions API 接入。

事件核心:发生了什么

Google 音频团队正式推出 Gemini 3.5 Transcribe,这是其最新一代语音转文本模型,定位为“精准且智能”的实时转写工具。与常见语音识别模型不同,它直接处理原始音频并输出格式化文本,能够自动修正自我纠正语句(如“周二见——不,周三”)、删除“嗯”“啊”等填充词,并完成内容排版。

该模型提供两种接入方式:一是通过 Live API 使用 gemini-3.5-transcribe-live,支持双向连续流式传输,延迟低于秒级;二是通过 Interactions API 使用 gemini-3.5-transcribe,处理录音文件、会议记录和通话日志,支持说话人分离(最多三人,三人以上为实验功能)和词级时间戳。

据第三方评测机构 Artificial Analysis 数据,该模型在流式模式下的平均词错误率(WER)为 4.0%,非流式场景为 2.6%;在 FLEURS 多语言基准上,流式 WER 为 5.50%,非流式为 5.04%。相比前代 Chirp 3,最终转写完成时间改善约 70%。模型支持自动识别超过 85 种语言,并适配自定义词汇表以处理专业术语和特殊拼写。

为什么重要

Gemini 3.5 Transcribe 的发布意味着语音转写从“听写工具”向“语音理解入口”演进。Google 将上下文理解、函数调用和自定义词汇表直接整合进转写流程,使模型不再只是机械转换声音,而是能识别说话者意图,甚至可将图像生成、文件分析等任务委派给其他 Gemini 模型处理。

这一技术路线也对现有语音 AI 市场构成直接竞争压力。相比通用大模型附带语音能力,Google 选择以独立模型加双 API 的形式切入开发者和企业市场,试图在实时客服、会议纪要和语音代理等垂直场景中建立壁垒。0.7 秒级延迟的数据表现,也指向端到端模型架构在工程优化上的进步,而非简单堆叠参数。

对用户/开发者/创作者的影响

开发者:可通过 Google AI Studio 或 Gemini Enterprise Agent Platform 调用 API。实时语音代理、字幕生成、通话后分析等场景的开发门槛降低,尤其是流式 API 的亚秒级延迟和自动断句功能,减少了开发者在后处理环节的工程量。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

终端用户:Android 端 Gboard 的新 Rambler 功能以及 macOS 版 Gemini 应用已率先集成。用户可用语音进行文字编辑、拼写修正和风格切换,转写时填充词被自动过滤,输出文本更接近可直接发布的成品。

创作者与办公人群:多说话人识别和时间戳功能对播客剪辑、会议记录整理具有实操价值。但需注意,三人以上说话人识别目前仍处于实验阶段,不适合高密度讨论场景的正式生产使用。

值得关注的后续

目前公开信息显示,Gemini 3.5 Transcribe 尚未公布具体定价和配额策略,开发者需关注 Google AI Studio 中模型上线后的计费标准。其次,Chirp 3 用户是否会被强制迁移、旧版 API 的维护周期也是企业客户需要评估的兼容性问题。最后,该模型目前在 macOS 和 Android 端的集成方式是否推广至 iOS 或 Chrome 浏览器全量版本,值得跟踪观察。

来源:Hacker News 热门(buzzing.cc 中文翻译)

celebrityanime
celebrityanime
文章: 20731

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注