​Google 官宣 Gemini 3.8 Live,首创“边说边想”颠覆行业交互

Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音模型,首次在低延迟语音流中实现多步深度推理,让 AI 能“边说边想”,并已开放 API 供开发者调用。

一句话看懂:Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音模型,首次在低延迟语音流中实现多步深度推理,让 AI 能“边说边想”,并已开放 API 供开发者调用。

事件核心:发生了什么

据 AIbase 报道,Google 正式推出新一代原生端到端语音大模型 Gemini 3.8 Live,以及面向高复杂度任务的 Gemini 3.8 Live Extended Thinking。两者均基于 Google 原生音频技术体系,重点优化实时对话延迟与自然度,包括更敏感的语气起伏、自然打断和上下文理解。Extended Thinking 版本的核心变化在于:系统在保持实时连续对话的同时,可在后台执行多步逻辑分解、代码调试或技术诊断,不再因难题而中断交流。相关能力自发布当日起通过官方 API 和开发工作站开放。

为什么重要

此前主流语音交互架构普遍面临一个取舍:快速响应只能做浅层对话,深度推理则需长时间静默等待。Gemini 3.8 Live 系列试图把这两个目标合并到同一条低延迟语音链路中,目前公开信息显示其在多项多模态与语音推理基准评测中排名靠前。这意味着语音助手的能力边界从日常闲聊扩展到实时排障、数学推导、外语同步辅导和多任务流式指令执行等专业场景,对客服、编程辅助、智能硬件等依赖全双工语音的产品形态构成直接竞争压力。

对用户/开发者/创作者的影响

对开发者而言,官方 API 已可直接调用超低延迟原生音频接口,用于构建具备高级推理能力的全双工语音 agent,减少了自行拼接语音识别、推理与合成链路的工程成本。企业用户可优先评估其在客服、实时编程协助和协同办公中的落地效果。普通用户短期内能感知到的变化,主要是语音助手在复杂问题上不再长时间沉默。创作者则需关注语音交互内容形态是否会因“边说边想”而出现新的表达方式。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 API 的实际定价与并发限制,这决定中小开发者能否规模化接入;二是 Extended Thinking 在真实业务流中的延迟表现,评测排名与实际体验可能存在差距;三是 OpenAI、Anthropic 等竞品是否跟进类似“后台推理+实时语音”的架构。

来源:AIbase

celebrityanime
celebrityanime
文章: 23765

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注