一句话看懂:Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,核心变化是让 AI 在连续语音对话中同步完成推理和后台任务调用,语音助手不再只是“能听会说”。
事件核心:发生了什么
Google 近期推出两款语音模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,已陆续上线 Gemini API、Google AI Studio 等开发者平台,并落地到 Search Live、Gemini Enterprise、Google Workspace、Gemini Live 等场景。
两款模型最实际的变化,是支持在持续语音对话中执行后台工具调用和 API 调用。用户无需中断对话,就能触发联网搜索或任务执行。模型还支持自动识别 97 种语言、对话中实时切换语言,以及接近实时的视觉定位,并会用“让我查一下……”这类语音提示反馈当前状态。
性能方面,目前公开信息显示,Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 语音到语音质量指数中得分 82.6;Gemini 3.8 Live 在 Speech Agent Arena 排名第二。Extended Thinking 版本在 T-Voice 测试中得分 68.6%,Sierra T-Voice 基准为 35.1%,Big Bench Audio 达 97.7%。Google 还宣布与 Agora、LiveKit、Vercel、Pipecat、Fishjam、Vision Agents 等平台合作,并说明两款模型生成的音频均嵌入不可见 SynthID 水印。
为什么重要
过去语音助手的瓶颈不在于识别准确率,而在于“说话时不能思考,思考时不能执行”。这次升级把对话、推理与任务执行放进同一条实时链路,等于把语音交互从问答工具推向可持续运行的多任务智能体形态。
对 Google 而言,这也是把 Gemini 从文本和图像场景延伸到实时语音入口的一步。配合 Workspace、Search Live 和 Enterprise 场景,语音有可能成为企业知识检索、会议协作和客服自动化的新交互层。开放 API 和第三方集成合作,则是在争夺开发者生态,避免语音智能体能力被锁定在自家产品内。
对用户/开发者/创作者的影响
普通用户很快会在搜索、会议和移动助手中感受到变化:提问后不用等待跳转页面,AI 可以直接在对话中查资料、调工具并继续回答。开发者则多了一条构建语音 AI 应用的路径,通过 Gemini API 或 LiveKit、Pipecat 等框架,把实时推理和工具调用接进现有产品,而不必自建整套语音编排链路。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
创作者和企业采购方需要留意两点:一是语音内容生成门槛继续降低,但 SynthID 水印意味着 AI 音频可被识别;二是企业部署时,后台 API 调用能力越强,权限、数据边界和审计要求就越不能省。
值得关注的后续
一是 Gemini 3.8 Live 系列在 API 上的定价与配额是否适合长时间常驻语音场景;二是 OpenAI、Anthropic 等竞品是否跟进“语音中同步推理与工具调用”的能力;三是 SynthID 水印在第三方平台和真实内容分发中能否被一致识别,以及企业版落地时数据合规如何处理。
来源:AIbase


