卧槽。。。有点吓人,第一个通过图灵测试的视频模型出现了。。。 刚刚 @tavus 发布了一个叫 Griffin 的新模型,他们直接给它定义了一个新类别:Human Interaction Model,HIM,人类交互模型。 Tavus 找了 54 个美国和欧洲的参与者,让他们和 Griffin 进行 1 分钟视频通话,事先不告诉对面是 AI。 聊完之后,有 26 个人(48%)认为自己刚才是在和真人视频。 而 Tavus 上一代系统…

Tavus 发布视频交互模型 Griffin,在 54 人盲测的 1 分钟视频通话中,48% 的参与者误以为对面是真人,远高于其上一代系统的 2.4%。它被官方定义为第一个"人类交互模型(HIM)",主打全双工实时音视频交互。

一句话看懂:Tavus 发布视频交互模型 Griffin,在 54 人盲测的 1 分钟视频通话中,48% 的参与者误以为对面是真人,远高于其上一代系统的 2.4%。它被官方定义为第一个”人类交互模型(HIM)”,主打全双工实时音视频交互。

事件核心:发生了什么

据 @MaxForAI 与 Tavus 官方信息,Tavus 推出新模型 Griffin,并为其提出一个新类别:Human Interaction Model(HIM,人类交互模型)。测试方式是让 54 名来自美国和欧洲的参与者在不知情的前提下,与 Griffin 进行 1 分钟视频通话;结果显示 26 人(约 48%)认为自己在和真人对话。作为对照,Tavus 上一代系统 Phoenix-4.5 在同样测试中,41 人里仅 1 人被骗过,通过率约 2.4%。Tavus 据此称 Griffin 是首个通过实时视频图灵测试的模型。

为什么重要

关键差异不在”说话像不像人”,而在技术路线的变化。Griffin 不再是 ASR → LLM → TTS → 数字人逐段串接的传统 Pipeline,而是一个 full-duplex(全双工)的 video-to-video 系统:它说话的同时仍在感知,感知的同时也能输出。系统不到一秒就重新判断应继续、停下、插话还是等待。这带来的直接能力是打断、停顿、判断对方在思考还是说完了,以及在你举着物体到镜头前时一边说话一边看你在做什么。目前公开信息显示,在 NVIDIA 的 VideoFDB 全双工音视频 Benchmark 中,Griffin-Lite 的 generation 与 perception 两项均排第一,生成侧 3.83 分(人类参考 3.92),感知侧 3.73 分(人类 4.20)。行业层面,这指向实时多模态与算力调度路线的竞争,而非单纯堆参数。

对用户/开发者/创作者的影响

对开发者,全双工 video-to-video 意味着需要重新思考 Agent 的交互接口,若开放 API,实时音视频推理的延迟与算力成本将是采用门槛。对创作者和企业,数字客服、虚拟主播、在线教育陪练等场景的拟人度会明显提升,但 48% 是特定测试条件下的结果,不等于所有场景都能复制。对普通用户,交互入口可能从聊天输入框转向摄像头,问题不再是写 Prompt,而是”对着它说话”。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Griffin 是否对外开放 API 及定价、延迟表现;二是能否在更长通话、嘈杂环境和方言口音下维持识别率;三是竞品与监管是否跟进,尤其是实时生成人脸的标识与合规要求。目前 48% 这一数据来自 Tavus 自测,独立复现结果仍待观察。

来源:@MaxForAI

celebrityanime
celebrityanime
文章: 26881

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注