Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking

Google DeepMind 于 2026 年 9 月 15 日发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者主打低成本高并发,后者主打复杂任务的多步推理,均已在 Gemini API、Google Workspace…

一句话看懂:Google DeepMind 于 2026 年 9 月 15 日发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者主打低成本高并发,后者主打复杂任务的多步推理,均已在 Gemini API、Google Workspace、Search 和 Gemini app 上线。

事件核心:发生了什么

两款模型针对不同场景分工。Gemini 3.8 Live 定位规模化与成本效率,支持近实时视觉输入、对话中自动切换 97 种语言,并能在后台执行工具与 API 调用而不打断对话。Gemini 3.8 Live Extended Thinking 面向高复杂度任务,边推理边说话,用“让我查一下……”这类提前口头提示确认请求,并实时播报任务进展。

数据方面,Extended Thinking 在 Artificial Analysis 语音到语音质量指数得 82.6 分,位列第一;τ-Voice 智能体任务完成率 68.6%,Sierra τ-Voice-banking 基准 35.1%,Big Bench Audio 97.7%。Gemini 3.8 Live 在 Speech Agent Arena 排名第二。官方称两款模型在 ServiceNow EVA-Bench 上推动复杂工作流的帕累托前沿,兼顾准确率与对话质量,且价格相对其他前沿模型有竞争力。

为什么重要

语音一直是人机交互中体验最难做顺的环节:延迟、打断、上下文丢失、任务执行与对话抢资源,都是工程难题。这次发布的关键不在“能说话”,而在于把推理、视觉理解、后台工具调用三条链路并行化——Extended Thinking 在思考时不静音,Live 在跑 API 时不断线。目前公开信息显示,这是把语音智能体从演示推向生产环境的一次工程收敛。对 Google 而言,语音也是把 Gemini 铺进 Workspace、Search 和手机入口的天然通道,与 OpenAI、Anthropic 在实时多模态上的竞争直接相关。

对用户/开发者/创作者的影响

普通用户能在 Gemini app、Search 和 Workspace 里直接用语音处理更长的任务,比如边看屏幕边提问、边等结果边继续聊。开发者可通过 Gemini API 搭建语音智能体,官方给出的基准覆盖了银行等强流程场景,意味着客服、外呼、辅助操作类应用的可落地性提高。创作者可关注实时视觉加语音的组合,用于直播解说、素材讲解等互动形式。企业采购方则可对照 EVA-Bench 等指标评估替换成本,但需注意这些分数由厂商参与提交,实际部署仍需自测。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 API 定价与并发限制是否公布更细的档位,这直接决定语音智能体的单位成本。二是 97 种语言的中途切换在真实口音与噪声环境下是否稳定。三是竞品是否跟进“边推理边说话”的并行架构,以及第三方基准能否复现官方分数。

来源:Google DeepMind

celebrityanime
celebrityanime
文章: 23664

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注