一句话看懂:Google 为 Gemini 3.8 Live 加入可选虚拟形象,让 AI 用实时语音配口型与用户对话,目标场景是企业客服、接待与培训。它把「语音助手」推向「有脸的数字员工」,但拟人化带来的观感与信任问题也随之而来。
事件核心:发生了什么
Google 发布 Gemini 3.8 Live 更新,新增可选择的虚拟头像(Avatars)。技术上是把 Gemini 的实时语音能力与低延迟视频生成结合,让头像的口型与 AI 朗读的文本同步,看起来像在和你面对面说话。Google 研究科学家 Shuo-yiin Chang 与软件工程师 CJ Zheng 表示,这使 AI 具备了更强的「视觉存在感」。
该功能面向企业用户,企业可从预设头像库中选择,也能定制符合品牌形象的头像,例如在制服上加入公司 Logo。Google 设想的用途包括客服、前台接待和员工培训。安全方面,头像视频带有 SynthID 水印,用于标识内容由 AI 生成。此外,Gemini 3.8 Live 支持 97 种语言并自动切换;更强的 3.8 Live Extended Thinking 版本在多项基准测试上超过 GPT-Live-1 Astra 和 Grok Voice Think Fast 2.0,且按每小时输入音频计算的运行成本更低。
为什么重要
过去一年,大模型竞争集中在文本与推理能力,实时语音是较新的战场。Google 这次把语音、视频生成和角色形象打包,实际上是在把 AI 从「工具」推向「界面」——用户不再面对输入框,而是面对一个会说话的形象。对企业而言,这意味着客服机器人可以更接近真人交互的体验,降低用户的距离感。
但「更像真人」也是双刃剑。TechRadar 原文用「creepy(瘆人)」形容这种观感,说明拟人化并非天然加分。当 AI 拥有面孔和声音,用户对它的期待、信任乃至被欺骗的担忧都会被放大。SynthID 水印是必要的合规动作,也侧面说明行业已经意识到深度伪造风险。
对用户/开发者/创作者的影响
对企业采购方,Gemini 3.8 Live 提供了一条相对低门槛的路径:无需自建数字人管线,就能在客服或培训场景接入带形象的多语言 AI。开发者需要关注的是 API 是否开放头像选择与定制、水印是否可验证,以及低延迟视频生成对算力和成本的实际要求。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对创作者和内容团队,这类能力可能最先落在虚拟主播、多语言课程和品牌代言场景,但定制头像的授权、肖像权与品牌合规需要提前理清。目前公开信息显示,该功能以企业为导向,个人用户的可用性尚不明确。
值得关注的后续
一是头像功能何时从企业试点扩展到更广泛的 API 与开发者生态;二是 SynthID 水印在实际平台上的检测与执行力度;三是 OpenAI、xAI 等竞品是否跟进实时视频形象,以及这类「有脸 AI」在客服场景的真实留存与投诉数据。价格与推理成本的变化,也会决定它能否规模落地。
来源:TechRadar


