一句话看懂:Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking,把实时语音交互和“延长思考”能力做成同一代模型的两个版本。对开发者来说,这意味着低延迟语音 Agent 和复杂推理场景可以用同一套 API 覆盖。
事件核心:发生了什么
据 Peter Yang 在 X 上的分享,Google 通过官方博客发布了 Gemini 3.8 Live,以及一个名为 Gemini 3.8 Live Extended Thinking 的变体。他给出的原话是“Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking”,并附上了 blog.google 的链接。发布时间显示为 10 月 5 日。
同一账号在此前还发布了一个实操教程:用 Gemini Live API 搭建一个通过实时语音通话教日语的 AI 语言学习应用,其中提到用自研 spec skill 做关键设计、用 Gemini Live API 接入语音、再用 Nano 生成场景插画。这条内容标注为付费合作(Paid partnership),说明它属于生态推广而非纯新闻。目前公开信息仅到产品名称与发布时间,具体参数、定价、可用地区尚未在素材中披露。
为什么重要
把“Live”和“Extended Thinking”放在同一代模型下,是 Google 在实时交互与深度推理两条路线上的合并动作。实时语音对延迟极其敏感,而延长思考需要更多推理算力,两者通常要用不同模型、不同成本结构处理。如果同代产品能同时覆盖,开发者在做语音 Agent 时就不必在“响应快”和“想得深”之间二选一。
竞争层面,OpenAI 的实时语音 API、Anthropic 的推理模型都在争夺同一个 AI 应用开发市场。Google 的优势在于把模型、API 与 Gemini 应用生态打包,降低创作者和中小团队的上手门槛。
对用户/开发者/创作者的影响
开发者可以关注 Gemini Live API 的接入方式:实时语音适合客服、语言陪练、语音助手类产品,Extended Thinking 则适合需要多步推理的任务。Peter Yang 的日语学习应用就是一个典型场景——语音对话负责交互,图像生成负责内容包装,这类组合正在成为 AI 应用的常见结构。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
创作者可以留意模型是否开放更低成本的调用档位,以及语音与图像能力是否在同一 API 下统一计费。企业采购方则需等待官方公布可用地区、速率限制与合规说明,目前公开信息显示这些细节尚未明确。
值得关注的后续
一是 Gemini 3.8 Live 与 Extended Thinking 的定价和免费额度是否区分,直接影响语音类应用的毛利。二是 OpenAI、Anthropic 是否跟进同代实时加推理的组合产品。三是 Gemini Live API 的开发者生态能否借这类教程和合作内容快速扩大。


