Gemini3.8Live升级语音智能:对话、推理与任务执行进一步融合

Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,核心变化是让 AI 在连续语音对话中同步完成推理和后台任务调用,语音助手不再只是“能听会说”。

一句话看懂:Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,核心变化是让 AI 在连续语音对话中同步完成推理和后台任务调用,语音助手不再只是“能听会说”。

事件核心:发生了什么

Google 近期推出两款语音模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,已陆续上线 Gemini API、Google AI Studio 等开发者平台,并落地到 Search Live、Gemini Enterprise、Google Workspace、Gemini Live 等场景。

两款模型最实际的变化,是支持在持续语音对话中执行后台工具调用和 API 调用。用户无需中断对话,就能触发联网搜索或任务执行。模型还支持自动识别 97 种语言、对话中实时切换语言,以及接近实时的视觉定位,并会用“让我查一下……”这类语音提示反馈当前状态。

性能方面,目前公开信息显示,Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 语音到语音质量指数中得分 82.6;Gemini 3.8 Live 在 Speech Agent Arena 排名第二。Extended Thinking 版本在 T-Voice 测试中得分 68.6%,Sierra T-Voice 基准为 35.1%,Big Bench Audio 达 97.7%。Google 还宣布与 Agora、LiveKit、Vercel、Pipecat、Fishjam、Vision Agents 等平台合作,并说明两款模型生成的音频均嵌入不可见 SynthID 水印。

为什么重要

过去语音助手的瓶颈不在于识别准确率,而在于“说话时不能思考,思考时不能执行”。这次升级把对话、推理与任务执行放进同一条实时链路,等于把语音交互从问答工具推向可持续运行的多任务智能体形态。

对 Google 而言,这也是把 Gemini 从文本和图像场景延伸到实时语音入口的一步。配合 Workspace、Search Live 和 Enterprise 场景,语音有可能成为企业知识检索、会议协作和客服自动化的新交互层。开放 API 和第三方集成合作,则是在争夺开发者生态,避免语音智能体能力被锁定在自家产品内。

对用户/开发者/创作者的影响

普通用户很快会在搜索、会议和移动助手中感受到变化:提问后不用等待跳转页面,AI 可以直接在对话中查资料、调工具并继续回答。开发者则多了一条构建语音 AI 应用的路径,通过 Gemini API 或 LiveKit、Pipecat 等框架,把实时推理和工具调用接进现有产品,而不必自建整套语音编排链路。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

创作者和企业采购方需要留意两点:一是语音内容生成门槛继续降低,但 SynthID 水印意味着 AI 音频可被识别;二是企业部署时,后台 API 调用能力越强,权限、数据边界和审计要求就越不能省。

值得关注的后续

一是 Gemini 3.8 Live 系列在 API 上的定价与配额是否适合长时间常驻语音场景;二是 OpenAI、Anthropic 等竞品是否跟进“语音中同步推理与工具调用”的能力;三是 SynthID 水印在第三方平台和真实内容分发中能否被一致识别,以及企业版落地时数据合规如何处理。

来源:AIbase

celebrityanime
celebrityanime
文章: 23788

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注