一句话看懂:旧金山 AI 初创公司 Tavus 发布 Griffin 模型,号称首个”Human Interaction Model”,能实时理解并生成语音、表情、语气和手势;在一分钟视频通话测试中,48% 的参与者误以为它是真人,而此前同类系统最高只有 2%。
事件核心:发生了什么
据 The Decoder 报道,Tavus 推出了名为 Griffin 的模型,公司将其定义为”Human Interaction Model”(HIM),一类专门用于实时面对面交流的模型:它同时处理语音、面部表情、语调、手势和停顿,并在接收与生成视频两个方向上工作。数据方面,Tavus 的一项研究中,48% 的参与者在完成一分钟视频通话后认为 Griffin 是真人;而此前系统在同类测试中最高仅 2%。Tavus 还引用了一项由 Nvidia 进行的独立测试,在衡量 AI 音视频直接对话”像人程度”的打分中,Griffin 得 3.83 分,真人得 3.92 分,此前最佳 AI 模型为 2.80 分。目前名为 Griffin-Lite 的预览版已向”部分测试者”开放,作为研究预览;更完整版本将在”安全问题解决后”推出。Tavus 成立于 2020 年,累计融资约 6400 万美元,最初为销售和营销场景制作个性化 AI 视频,后扩展到数字角色实时视频对话。
为什么重要
这组数据的价值不在”像人”本身,而在于它把门槛推到了一个新量级:从 2% 到 48%,说明实时视频虚拟人在短时交互中已经能跨过不少人的真伪判断线。对行业而言,这意味着视频虚拟人不只是营销素材或数字人直播的噱头,而是开始具备”可对话界面”的属性——可以承载客服、教学、面试练习等需要双向交流的场景。同时,Tavus 把更完整版本卡在”安全问题”上,也说明这类高拟真度系统与深度伪造、身份冒用、同意机制之间的张力,正在成为产品能否大规模上线的关键变量,而不只是技术问题。
对用户/开发者/创作者的影响
对开发者,Griffin 代表的是一类新的 API 形态:不再是单纯的文本或语音接口,而是需要同时调度语音识别、语音合成、面部驱动与实时视频生成的多模态推理管道,对延迟和算力成本的要求更接近实时通信而非批处理。对创作者和企业采购方,潜在用例已被 Tavus 点明:辅导教学、练习困难对话、基于摄像头的技术支持。这类场景过去要靠真人或预录内容,现在可以用可控的虚拟角色承接一部分。但要注意,目前公开信息显示 Griffin-Lite 仅限邀请测试,完整版本尚未开放,实际可用性、定价和并发能力都还没有公开数据。内容创作者若使用此类工具,建议在涉及真人形象、声音克隆时明确授权和标注。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Griffin-Lite 的测试反馈能否复现 48% 这个数字,以及完整版上线的审核标准具体是什么;二是竞品是否跟进”实时视频对话”路线,这会决定它是单点突破还是新品类起点;三是定价与延迟指标,若实时视频推理成本过高,实际落地场景可能仍集中在低频、高价值的对话练习与技术咨询,而非大规模客服替代。


