Google 为 Gemini 3.8 live 的 agent 加入诡异头像

Google 在 Gemini 3.8 Live 的基础上加入 Live Avatar,为实时语音模型配上带口型同步和面部表情的虚拟形象,面向企业客户开放。这意味着未来接你客服电话或做销售答疑的,可能是一个会看、会听、会说的 AI 头像。

一句话看懂:Google 在 Gemini 3.8 Live 的基础上加入 Live Avatar,为实时语音模型配上带口型同步和面部表情的虚拟形象,面向企业客户开放。这意味着未来接你客服电话或做销售答疑的,可能是一个会看、会听、会说的 AI 头像。

事件核心:发生了什么

据 Engadget 报道,Google 上周刚发布 Gemini 3.8 Live 与 Live Extended Thinking 模型,主打可靠、可上生产环境的实时语音对话能力。9 月 25 日前后,Google 又推出 Gemini 3.8 Live with Live Avatar,把近实时视觉形象与对话模型结合,形成”能听、能看、能说”的动态虚拟人。

官方演示中包含写实和卡通两类头像,具备较精准的口型同步、自然表情和”流畅的轮流对话”能力。头像背后由 Gemini 的推理能力驱动,可在对话过程中触发工具调用、在后台拉取数据而不中断交流。企业可从预设头像库中选用,也能基于高质量参考图定制,以保留品牌形象或角色特征。该功能目前仅通过企业白名单开放,且每个生成内容都嵌入 SynthID 水印。

为什么重要

语音 agent 的竞争正从”能对话”转向”有存在感”。纯语音模型缺少视觉锚点,用户难以判断对方状态;加上头像后,AI 客服、销售、虚拟助手有了可被感知的交互界面,这直接关系到企业采购时的接受度。对 Google 而言,把 Gemini 的推理、工具调用、多模态输入与水印体系打包成企业级方案,是在与 OpenAI、Anthropic 等争夺同一批 B 端客户。目前公开信息显示,Live Avatar 走的是闭源、企业 allowlist 路线,而非开放给个人开发者随意调用。

对用户/开发者/创作者的影响

普通用户短期内更可能在客服或销售场景遇到这类头像,而非主动使用。开发者若想接入,需先成为 Gemini Enterprise 客户,个人侧暂无公开 API。创作者和品牌方可关注头像定制能力——用参考图锁定形象与风格,意味着虚拟代言人、角色 IP 的批量生产门槛在降低,但同样受 allowlist 与 SynthID 约束。对企业采购方来说,评估重点会落在对话延迟、工具调用可靠性、水印合规以及用户对”AI 脸”的接受度上。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Live Avatar 何时从白名单扩展到更广泛的 API 或自助平台;二是真实客服场景的落地反馈,尤其是用户对写实头像的抵触情绪是否会拖累采用率;三是竞品是否跟进类似”语音+视觉形象+推理”的打包方案,以及 SynthID 这类水印能否成为行业默认要求。

来源:Engadget

celebrityanime
celebrityanime
文章: 25534

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注