AI数字人学会察言观色,近半测试者误认成真人
一个男人对着镜头拧魔方,屏幕里的女孩盯着他手上的动作,时不时点头提醒。他卡住了,她没有插话,只是安静等着。这看起来像一次普通的视频通话,但屏幕里的女孩并不存在——她的脸、声音、每一次点头和停顿,全部由 AI 实时生成。
10 月 1 日,美国 AI 视频公司 Tavus 发布 Griffin 模型,定义为全球第一个「人类交互模型」。数据显示,在一分钟视频通话测试中,54 名参与者有 26 人认为自己是在和真人聊天,比例接近 48%。而上一代系统在同样测试中,41 人里只骗过 1 个,比例 2.4%。从 2.4% 到 48%,这不是常规迭代。过去数字人拼的是「脸像不像」,Griffin 想证明的是 AI 已开始学会「像人一样聊天」。

Tavus 发布的演示视频本身就是一次 AI 视频通话。联合创始人 Hassaan Raza 与屏幕中的女孩 Vanessa 像老同事一样互相打趣,她接得住笑点,停顿自然,没有数字人特有的机械感。更能说明问题的是技术博客中的测试片段:Griffin 指导人拧魔方时,会等对方准备好再开口;在焊接主板时,能理解「沉默」也是信息,在该做下一步时主动开口;玩「西蒙说」游戏时,每个动作都是现场生成。还有「抢话」能力——有人告诉它自己升职了,它在对方话没说完时就做出反应,两人短暂同时说话却不乱线索。
过去的数字人采用「级联」架构:语音识别转文字,大语言模型生成回复,语音合成念出文字,形象驱动模型让脸动起来。每多一次交棒就多一份延迟和信息丢失,且必须等你说完才处理,于是有了一两秒的尴尬停顿。Tavus 上一代方案已被 15 万开发者和企业使用,但真人测试通过率仅 2.4%。

Griffin 的思路是把接力赛变成一个大脑同时处理所有事情。Tavus 将其描述为「全双工、视频到视频」模型,由两大部分构成。第一部分是「连续对话建模」,每隔不到一秒重新评估对话状态,综合你说什么、怎么说、什么表情、镜头里有什么,决定该说话、点头、嗯一声还是继续听。它输出的是整套控制信号,涵盖情绪、姿态、表情和手势。第二部分是音视频生成引擎。语音侧自研 Tavec 编解码器,把 48kHz 音频压缩成每秒 100 帧、每帧 40 个数值的连续表示,最小以 10 毫秒为单位输出声音,还能用约 10 秒录音克隆声音。视频侧通过「蒸馏」把庞大模型压缩:先分布匹配蒸馏把几十步压到几步,再改造成自回归结构,最后用 Self-Forcing 方法训练避免画面漂移。最终 Griffin 以 320 毫秒为一块实时生成 720p 视频,从听到声音到脸上做出反应平均延迟 0.43 秒,Tavus 称这只有次快方案的一半。
Griffin 抛掉了前几代依赖的 3D 人脸先验,只用一张参考照片就能实时生成画面里每一个像素,椅子的晃动、墙上的影子、手指动作和背景都在控制之内。第三方评测中,在 NVIDIA 的 VideoFDB 基准上,Griffin-Lite 在「生成」赛道拿到 3.83 分(满分 5 分),比第二名高出 1 分多,离人类参考值 3.92 只差 0.09;在感知赛道也以 3.73 分排名第一。

2024 年 GPT-4o 靠端到端语音模型取代三段式流程,让 AI 语音第一次有了插话、语气和停顿。Griffin 做的,是把这场端到端革命从声音推进到了画面。
Griffin 真正的冲击在于重新定义了数字人该比拼什么。过去行业主线是「做一张更像的脸」,HeyGen、Synthesia 主打预生成口播视频,国内直播带货、政务客服数字人也是同一逻辑。这条路线解决的是「播」而非「聊」。一旦进入实时对话,级联架构的天花板就暴露无遗。Griffin 把赛道核心指标从「像不像」换成了「懂不懂」——卖点不是某一帧画面有多高清,而是什么时候点头、什么时候插话、什么时候闭嘴。
更多推荐阅读

Mistral发布1T参数大胖猫模型,激活仅49B
今天早些时候,美国开源了 glm5.2 级别的模型。随后,欧洲的 Mistral 发布了 Mistral Large 4,又名 Le Chonk 大胖猫。 该模型总参数 1.05T,每次只激活 49B,另带一个 1.6B 的视觉编码器。它采用细粒度混合专家(MoE)结构,模型拆成很多“专家”,每处理一个词只叫醒其中一小部分,因此 1T 模型每算一个词的开销接近 49B 模型。原生多模态,能读文字...
2026-10-07
xAI联创宣判:数学两千年英雄时代落幕
两千多年来,人类最聪明的大脑一直在攀登数学这片山脉。从欧几里得到怀尔斯,每征服一座山峰都要赌上一生。但xAI联合创始人Christian Szegedy认为,这个属于数学的英雄时代正在结束。 Szegedy在长文《数学何去何从?》中,将数学家比作丛林里徒手攀岩的探险家,AI则是一架飞机,已把旗插上没人爬过的山顶。孤独攀登者的时代正在结束,测绘整片大陆的时代正在开启。 Szegedy少年时在匈牙...
2026-10-06
OpenAI疯狂28天首日:模型提速50%却遭评论区翻车
Codex负责人Tibo宣布启动“疯狂28天”计划:未来28天每天要么交付一项Codex/Work改进,要么进行一次完整额度重置。第一天,Tibo宣布GPT-6 Astra和GPT-6.1 Sol默认推理速度提升约50%,达到50TPS,覆盖官方订阅及Sign in with ChatGPT接入的第三方生态。 但评论区几乎无人关注提速,满屏冷嘲热讽。此前9月29日GPT-6.1 Sol上线后因负...
2026-10-06
AI研究员为何计划逃离湾区买地避难
一些Anthropic最期的员工,最近开始考虑在美国偏远地区买地。他们想过,如果AI真的失控,那里或许可以成为避难的地方。 “一切再也无法平静如初。”一些研究员的电脑上贴着同一句话。 事实上,逃离的念头并非突然出现。十多年来,一群聚集在旧金山湾区的AI安全研究人员,一直在讨论AI失控之后可能发生什么。那时候,Anthropic甚至还没有成立。 有人在伯克利设立共享办公空间,在私人Slack频...
2026-10-06
英伟达押注的Reflection开源新模型对标智谱
英伟达投资的 Reflection 发布首个开源模型 Beam,对标智谱 GLM-5.2。官方称两者在高级推理测试上分数相当,Beam 推理算力仅需后者的三分之一到四分之一。彭博和金融时报称其为美国在开源模型领域对中国的反击。但 Beam 与国内其他头部开源模型如 Qwen3.8、GLM5.3、Kimi K3、DSV4F 仍有差距。 Reflection 由谷歌 DeepMind 两位研究员 M...
2026-10-06
把35个判断交给内核:这个开源项目拿下黑客松总冠军
在进化酒馆黑客松深圳收官之战中,项目 mu(μ)获得全场冠军。它将 Jev 深度融合进 Harness,试图解决 Agent 把工具、日志、技能、上下文全部交给大模型导致效率低、Token 浪费的问题。 mu 建立在开源 Coding Agent pi 之上,主要改造模型外的 Harness,设计了 35 个判定点,覆盖用户输入、工具调用、上下文管理、任务完成判断和多 Agent 通信等环节。例...
2026-10-06