AI看视频不再靠抽帧,谷歌新功能让模型主动找重点
近六周内,谷歌接连发布三款Flash模型,却未在业界激起太大水花。在AI竞赛中,谷歌常显迟缓,尤其在编程与推理领域落后于OpenAI和Anthropic。然而,模型在代码、文本与图像生成上终将出色,真正的难点在于让AI理解物理世界——包括视频、音频、运动、三维空间及事物间的互动。

9月1日,谷歌推出“主动视频理解”功能,试图破解这一难题。它让AI不再被动逐帧看视频,而是自主判断画面重点、回溯时机及观看方式,以提升理解精度。官方演示中,模型能准确数出掌声次数,克服了传统固定帧率采样易漏动作的缺陷。谷歌依托YouTube、Maps和Search等现实数据入口,具备独特的世界触达能力。

传统AI理解视频依赖逐帧提取静态画面,每秒1帧的采样会错过短暂动作,长视频更会撑爆上下文窗口。谷歌为Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite接入主动视频理解后,模型可自主循环判断观看片段、速度及依赖的媒体类型,并调用内部工具精读。开发者无需再编写大量胶水代码。基准测试显示,该功能使token消耗降低最多88%,分析成本降低66%,准确率提升7%。在LongVideoBench上,Gemini 3.7 Flash开启主动理解后,性价比最优。有开发者结合Agora对话式AI搭建演示,模型能分析视频、数清手指排列并提取带时间戳的关键时刻,支持实时语音。

这一功能可类比字幕组提供文化背景注释,未来在观赛时可实时解析战术、显示跑位路线及历史数据,或辅助争议判罚解释。家庭监控中,AI能过滤风吹草动等无效警报,聚焦语义价值实体,如识别幼儿攀爬或宠物异常状态并推送精准预警。

目前,该能力已通过Google AI Studio和Gemini Enterprise Agent Platform的API调用,支持上传视频和YouTube链接,按标准token计费,无额外费用。未来将推送至Gemini App的Flash用户,并为YouTube的“Ask YouTube”功能提供支持。YouTuber MrBeast计划在视频中介绍Gemini等产品,并借助其应对野外环境。

以往用户与视频交互单向线性,查找信息需拖拽进度条或依赖评论时间戳。“Ask YouTube”将改变此状,用户可随时提问,AI精准定位帧并总结答案,使海量视频转化为结构化知识库。尽管谷歌短期内难回旗舰模型第一梯队,但若胜负取决于理解并互动世界的AI,竞争或刚开始洗牌。未来AI将用懂温度、懂逻辑的眼睛,与人类共观世界。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05