模型多源确认83°

Griffin模型通过视频图灵测试

精选理由

Tavus的Griffin让近半人误认为真人对话,全双工技术实现实时互动,远超同类系统表现。

Tavus团队开发的Griffin模型让48%的实时对话者误以为是真人,远超同类系统不足3%的通过率。该模型在NVIDIA全双工AI视频基准(VideoFDB)的感知与生成两项均排名第一。Griffin能实现全双工对话,在说话的同时持续倾听和观看,并生成整个画面而非仅换脸。

原文 · shao__meng

首个通过「视频图灵测试」的模型:Griffin 来自 @tavus 团队的 Griffin 让 48% 的实时对话者误以为对面是真人,在此之前同类系统不足 3%,他们还在 NVIDIA 全双工 AI 视频基准(VideoFDB)上感知与生成两项均排名第一,厉害! 全双工对话是最关键的技术差异点 传统语音 AI 是“回合制”的:说完才听。Griffin 能在说话的同时持续倾听和观看:用户 Mars 讲述无聊约会时,它会实时笑、点头、插话提问,而不是等她说完。 生成整个画面,不只换一张脸 Tavus 明确强调 Griffin "generates the whole frame, not just a face"。Simon Says 演示中它要同时听指令、看手势、做全身动作。这区别于市面上大多数“唇形同步 + 换脸”式数字人。 视觉实时融入对话 用户举起孔雀玩具,Griffin 即兴编入故事;教魔方时能看着用户的手实时指导,并在对方思考时安静等待,时机感本身就是智能的体现。 时间与情境感知 焊接指导演示中,Griffin 能为动作计时,“时间也是对话的一部分”,这暗示模型对物理世界节奏有内在感知。 技术背景补充 Griffin 并非单点突破,它是 Tavus 四模型体系的统一层:Sparrow-2(对话轮次理解,TurnBench 第一)+ Phoenix-4.5(实时人物渲染,宣称 134ms 延迟、单图零样本生成新身份)+ Raven-1(语音/视频/屏幕三路多模态感知,上下文刷新 <300ms),Griffin 将三者整合为实时交互整体。 Tavus @tavus Introducing Griffin, the first model to pass the video Turing test. 48% of people who talked to it live thought it was a real human. Previous systems have had a pass rate <3%. It is #1 on NVIDIA's benchmark for full-duplex AI video. It’s the first Human Interaction Model (HIM). Your browser does not support the video tag. 🔗 View on Twitter 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 1 👀 312 ⚡