一句话看懂:Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,让语音对话在持续进行的同时完成推理、联网搜索和工具调用,语音 AI 正从“能听会说”转向可连续执行任务的智能体。
事件核心:发生了什么
Google 近期推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款新模型,已陆续上线 Gemini API、Google AI Studio 等开发者平台,并接入 Search Live、Gemini Live、Gemini Enterprise 与 Google Workspace 等场景。核心变化是:模型在连续语音对话中可在后台调用工具和 API,用户不必中断交流去等待搜索或任务执行;同时支持自动检测 97 种语言、对话中切换语言,以及近实时视觉定位,并能用“让我查一下……”这类语言提示反馈当前状态。
性能方面,Extended Thinking 版本在 Artificial Analysis 语音到语音质量指数中得分为 82.6;Gemini 3.8 Live 在 Speech Agent Arena 排名第二。Extended Thinking 版本在 T-Voice 测试中得分 68.6%,Big Bench Audio 达到 97.7%。Google 还与 Agora、LiveKit、Vercel、Pipecat、Fishjam、Vision Agents 等平台合作,方便开发者集成;两款模型生成的音频均嵌入不可见的 SynthID 水印,用于识别 AI 生成音频。
为什么重要
实时语音交互过去主要集中在转录、对话和响应速度上,任务执行往往要跳出语音通道。Gemini 3.8 Live 把后台工具调用、近似实时推理和语音输出放进同一条链路,意味着语音 AI 的产品形态可能从“语音助手”向“可持续在线的智能体”演进。这对 Google 自身生态尤为关键:Search、Workspace 和企业产品都能借此获得统一的语音任务入口,也加剧了与 OpenAI、Anthropic 等厂商在实时多模态和 Agent 能力上的竞争。
对用户/开发者/创作者的影响
对普通用户,语音助手有望在导航、查询、办公协作等场景中少打断、多办事;对开发者,Gemini API 与 LiveKit、Pipecat 等实时音视频框架的打通降低了集成门槛,但后台工具调用也带来权限管理、延迟和成本控制问题。对创作者和企业采购方,SynthID 水印意味着 AI 生成音频具备可追溯标识,在合规和内容审核上更明确;目前公开信息显示,这些能力的具体定价与商用限制仍以 Google 官方文档为准。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是后台工具调用在实际网络环境下的稳定性和延迟表现;二是开发者平台的定价、配额及企业数据合规政策是否跟进;三是 OpenAI 等竞品是否在实时语音 Agent 方向推出对等能力,以及 SynthID 水印能否被行业广泛接受为识别标准。
来源:AIbase


