一句话看懂:Google DeepMind 在 Gemini 3.8 Live 基础上推出 Live Avatar,把实时对话能力与低延迟流式视频生成结合,让企业级 AI 智能体拥有可定制、能看能听能说的虚拟形象,目前已上线 Gemini Enterprise。
事件核心:发生了什么
2026 年 9 月 24 日,Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,距离上一版 Gemini 3.8 Live 发布仅一周。新功能把实时视频生成与语音对话原生耦合,虚拟形象具备精准口型同步、自然表情和流畅的轮流对话能力。官方给出的关键指标是支持 97 种语言的原生语音到语音同步,切换语言时口型和表情会动态适配,不损失视频保真度、不出现视觉漂移。技术上还引入异步工具调用,模型可以在对话不断流的情况下后台调用工具、拉取数据。企业除使用预设形象库外,还可基于一张参考图生成保留人物特征和品牌风格的定制形象,但定制功能目前仅对企业白名单开放。
为什么重要
Live Avatar 的意义不在“虚拟人”这个概念本身,而在于它把多模态对话从文本和语音推进到实时视频层面,并且做成了企业级可交付产品。过去数字人方案通常依赖独立渲染管线,延迟高、与对话模型割裂;这次 Gemini 把视频生成、语音、推理和工具调用放进同一个原生模型,说明大模型厂商的竞争正从单点能力转向“实时多模态智能体”的整合能力。异步工具执行则解决了一个实际痛点:企业场景里的任务往往需要查询后台系统,如果每次都打断对话,体验会明显下降。此外,SynthID 水印被直接织入音视频输出,反映出生成式内容合规正在成为产品设计的默认前提。
对用户/开发者/创作者的影响
企业客户可以直接在 Gemini Enterprise 中调用该能力,适合客服、互动导览、酒店入住办理等需要连续对话加后台操作的场景。开发者可通过 API 文档接入,但定制形象需要申请白名单,短期内中小团队的使用门槛仍然存在。对内容创作者而言,可定制的响应式虚拟形象意味着品牌 IP 的互动化门槛降低,但水印机制也意味着 AI 生成内容会被标记来源,无法完全隐藏生成属性。多语言同步能力对出海业务和跨境客服的实用价值较高,不过目前公开信息显示,官方尚未披露具体定价、并发上限和各语言的实际延迟数据。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是定制形象的白名单何时放开、以什么价格和审核条件开放;二是 97 种语言的实际延迟与视频保真度是否在不同网络环境下保持一致;三是竞品是否跟进类似的实时视频对话能力,以及企业采购中这类功能会被归入客服工具还是大模型平台预算。另外,SynthID 水印的实际检测效果和监管认可度,也会影响其在合规敏感行业的落地速度。


