Google debuts Gemini 3.5 Transcribe, a speech-to-text model that powers Gboard Rambler and is coming to Chrome, in public preview for developers and enterprises (Abner Li/9to5Google)

Google 发布了新一代语音识别模型 Gemini 3.5 Transcribe,并开放公开预览。该模型已驱动 Gboard 的 Rambler 输入功能,未来还将进入 Chrome 浏览器,语音转文字能力正在成为 Google 系统级 AI 的关键入口。

一句话看懂:Google 发布了新一代语音识别模型 Gemini 3.5 Transcribe,并开放公开预览。该模型已驱动 Gboard 的 Rambler 输入功能,未来还将进入 Chrome 浏览器,语音转文字能力正在成为 Google 系统级 AI 的关键入口。

事件核心:发生了什么

据 Techmeme 报道,Google 于 2026 年 8 月 26 日正式推出 Gemini 3.5 Transcribe,这是一款面向开发者和企业的语音转文字(speech-to-text)模型,目前处于公开预览阶段。该模型首发落地于 Gboard 键盘的 Rambler 功能,用户已经可以体验其端侧语音输入能力。Google 同时确认,Gemini 3.5 Transcribe 后续将集成到 Chrome 浏览器中,为网页场景提供系统级的语音识别支持。这是 Google 首次在 Gemini 3.5 系列中单独拆分出专用转写模型,意味着语音识别不再作为多模态大模型的附属能力,而是以独立产品形态对外输出。

为什么重要

Gemini 3.5 Transcribe 的发布有两点行业信号。其一,Google 正在加速将 AI 能力从云端推理下沉到端侧场景——Gboard 和 Chrome 都是高频、低延迟的入口,语音转写模型直接嵌入这些产品,说明端侧推理的算力成本已经进入可商用区间。其二,独立的转写模型意味着 API 经济进一步细分,开发者不再需要调用完整的多模态大模型来完成单纯的语音转文字任务,可以用更低成本和更低延迟获得专用能力。这也会给 OpenAI Whisper 系列、以及各类垂直语音服务商带来直接竞争压力。对 Google 而言,Chrome 和 Android 的生态覆盖是差异化壁垒,Gemini 3.5 Transcribe 的实际体验将成为衡量其 AI 生态渗透率的关键指标。

对用户/开发者/创作者的影响

对普通用户而言,Gboard 的 Rambler 和未来的 Chrome 集成意味着语音输入将更流畅、更准确,离线或弱网场景下的可用性也会改善。对开发者来说,公开预览意味着可以通过 API 将 Gemini 3.5 Transcribe 集成到自己的应用、会议工具或内容生产流程中,替代以往需要自建模型的方案。对创作者和内容团队来说,字幕生成、采访转写、播客整理等环节可能迎来更低的成本和更快的处理速度。不过目前公开信息尚未披露 API 的定价细节、速率限制以及支持的语言范围,这些将直接影响中小团队是否愿意迁移。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,Gemini 3.5 Transcribe 仍是公开预览状态,后续有三个观察点值得跟踪:第一,Chrome 集成的时间表和默认开启范围,这决定了端侧语音识别能否成为浏览器标配;第二,API 正式商用后的定价策略,能否比现有专用语音服务更有竞争力;第三,竞品反应——尤其是 OpenAI 和开源社区是否会在转写模型精度或响应速度上跟进,这可能改变开发者对闭源与开源方案的选择偏好。

来源:Techmeme

celebrityanime
celebrityanime
文章: 20578

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注