一句话看懂:Tavus 发布视频交互模型 Griffin,在 54 人盲测的 1 分钟视频通话中,48% 的参与者误以为对面是真人,远高于其上一代系统的 2.4%。它被官方定义为第一个”人类交互模型(HIM)”,主打全双工实时音视频交互。
事件核心:发生了什么
据 @MaxForAI 与 Tavus 官方信息,Tavus 推出新模型 Griffin,并为其提出一个新类别:Human Interaction Model(HIM,人类交互模型)。测试方式是让 54 名来自美国和欧洲的参与者在不知情的前提下,与 Griffin 进行 1 分钟视频通话;结果显示 26 人(约 48%)认为自己在和真人对话。作为对照,Tavus 上一代系统 Phoenix-4.5 在同样测试中,41 人里仅 1 人被骗过,通过率约 2.4%。Tavus 据此称 Griffin 是首个通过实时视频图灵测试的模型。
为什么重要
关键差异不在”说话像不像人”,而在技术路线的变化。Griffin 不再是 ASR → LLM → TTS → 数字人逐段串接的传统 Pipeline,而是一个 full-duplex(全双工)的 video-to-video 系统:它说话的同时仍在感知,感知的同时也能输出。系统不到一秒就重新判断应继续、停下、插话还是等待。这带来的直接能力是打断、停顿、判断对方在思考还是说完了,以及在你举着物体到镜头前时一边说话一边看你在做什么。目前公开信息显示,在 NVIDIA 的 VideoFDB 全双工音视频 Benchmark 中,Griffin-Lite 的 generation 与 perception 两项均排第一,生成侧 3.83 分(人类参考 3.92),感知侧 3.73 分(人类 4.20)。行业层面,这指向实时多模态与算力调度路线的竞争,而非单纯堆参数。
对用户/开发者/创作者的影响
对开发者,全双工 video-to-video 意味着需要重新思考 Agent 的交互接口,若开放 API,实时音视频推理的延迟与算力成本将是采用门槛。对创作者和企业,数字客服、虚拟主播、在线教育陪练等场景的拟人度会明显提升,但 48% 是特定测试条件下的结果,不等于所有场景都能复制。对普通用户,交互入口可能从聊天输入框转向摄像头,问题不再是写 Prompt,而是”对着它说话”。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Griffin 是否对外开放 API 及定价、延迟表现;二是能否在更长通话、嘈杂环境和方言口音下维持识别率;三是竞品与监管是否跟进,尤其是实时生成人脸的标识与合规要求。目前 48% 这一数据来自 Tavus 自测,独立复现结果仍待观察。
来源:@MaxForAI


