Gemini 3.8 Live 携 Live Avatar 登场,让 Google 的 AI 有了面孔

Google 在 Gemini 3.8 Live 中上线 Live Avatar,让 AI 以会对口型、有表情的动画形象实时对话,但目前只面向 Gemini Enterprise 企业客户。

一句话看懂:Google 在 Gemini 3.8 Live 中上线 Live Avatar,让 AI 以会对口型、有表情的动画形象实时对话,但目前只面向 Gemini Enterprise 企业客户。

事件核心:发生了什么

据 The Verge 报道,Google 为 Gemini 3.8 Live 推出名为 Live Avatar 的功能。用户与模型对话时,可以看到一个动画 AI 形象实时回应,形象会根据语音内容对口型,并呈现不同面部表情。该功能当前仅向 Gemini Enterprise 客户开放,普通消费者暂时用不到。

Live Avatar 支持 97 种语言,Google 表示它在语言切换时不会降低视频清晰度,也不会出现画面漂移。官方演示视频中,该形象用英语和日语交替说话,嘴部动画与两种语言均能对齐,并可在讲话时把信息调取到屏幕上。这一功能发布的大约一周前,Google 刚公开 Gemini 3.8 Live 模型,称其能“近乎实时地处理视觉输入”。除提供预设形象库外,Google 也允许企业机构创建自有形象,输出内容会附带不可见的 SynthID 水印,并设有“尊重身份”的防护措施。

为什么重要

多模态大模型的竞争,正从“能不能听懂、看懂”转向“以什么形态出现在用户面前”。给 AI 一张会说话的脸,意味着语音、视觉输入、语言生成和实时渲染被放进同一条推理链路,对延迟和算力的要求明显更高。对企业市场来说,虚拟形象是可直接落地的界面层:客服、培训、导览、销售演示都可以套用,而不必自研一套动画系统。Google 把首发限定在企业版,也说明它更看重可计费、可管控的商用场景,而非先做大众娱乐功能。SynthID 水印的加入,则回应了深度伪造和身份冒用方面的合规压力。

对用户/开发者/创作者的影响

普通用户短期内变化不大,Live Avatar 尚未进入面向个人的 Gemini 订阅。企业采购方需要评估的是:它能否接入现有知识库和业务流程,97 种语言支持是否符合跨境服务需求,以及自建形象在品牌一致性上是否比预设形象更划算。开发者目前公开信息显示还没有对应的 API 细节,若后续开放接口,实时视频生成会带来明显的推理成本,需要重新算一笔账。内容创作者则要留意水印与身份防护规则——用它生成的形象做营销素材,可能受平台标注要求约束。竞品方面,OpenAI 和 Anthropic 目前都没有推出同类的实时虚拟形象产品,这一轮 Google 算是先占了一个位置。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Live Avatar 是否会下放到个人版 Gemini,以及定价怎么定;二是企业自建形象的权限边界和审核流程是否透明;三是实时对口型所依赖的算力成本,会不会限制它在移动端和低带宽场景的可用性。

来源:The Verge

celebrityanime
celebrityanime
文章: 25395

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注