对话式视频编辑来了:谷歌Gemini Omni让AI懂物理

AI 测评 来源:新闻/公众号 发布时间:2026-08-28 更新于 2026-08-29 预计阅读 3 分钟

谷歌在I/O大会上正式发布Gemini Omni,被业界称为视频界的"Nano Banana"时刻。DeepMind的Hassabis表示,这是迈向万能生成模型的第一步,也意味着AI正从预测文本转向模拟现实。Omni将推理与生成能力合二为一,可以生成逼真的视频、图像和交互式模拟,还能表现出对动能、重力等物理规律的直觉,把复杂概念直接可视化。用户可以与模型对话,用自然语言下达编辑指令,甚至克隆自己的数字分身。

产品负责人强调,Gemini Omni并非Veo的简单升级,而是从地基重新写过的模型。它的训练目标被确立为"多模态进、多模态出"——图像、音频、视频、文本共同参与学习,互相作为上下文。这种架构上的变化,使得模型能够以统一的内部表征处理不同模态的信息,而不是为每种任务分别设计网络。正因如此,评估Omni需要同时跑视频生成、视频编辑、图像生成、文本对齐、音频同步五条管线。这些能力之间存在此消彼长的权衡,团队必须在各个维度之间小心取舍,才能找到符合实际需求的最佳平衡点。

多模态联合训练带来了意想不到的涌现能力。Omni没有被显式训练过风格迁移,却能把一段视频自动转成蜡笔画风格;没有被专门教过"续写情节",却能在走廊怪物出场的场景中自然延续画面。这些能力不是工程师预先设计出来的,而是模型在大量多模态数据中自己"长"出来的。各模态互相印证、互相增强,让Omni的整体表现超越了单一模态模型。可以说,Omni已经不只是"执行指令的模型",而是在对世界的运行规律进行观察和模拟——这正是多模态架构带来的独特价值。

在应用层面,Gemini Omni支持对话式视频编辑,用户只需一句话就能修改视频内容;数字分身功能则允许用户克隆自身形象与声音,并植入任意场景。以创意内容生产为例,过去完成这类操作需要专业的剪辑软件和漫长的学习过程,如今通过对话即可完成,门槛被大幅降低。但强大的能力也伴随着滥用风险。谷歌为此推出了Avatar Flow安全机制:用户必须一次性注册多角度面孔和录音,通过完整验证后才能生成数字分身,不能通过随意上传一张图片来绕过身份确认。这套机制要求用户先完成一次标准化的生物信息采集,包括不同角度的面部图像和一段清晰的录音,这些信息将用于生成专属的数字化形象,让冒用他人面孔变得困难。同时,所有由Omni生成的视频都将强制嵌入SynthID和C2PA双层水印。即便视频被转载、裁剪或二次编辑,检测工具仍能识别出AI生成的痕迹,为溯源和问责提供了技术保障。

Hassabis评价说,这是走向AGI(通用人工智能)的一步。从更宏观的视角看,Gemini Omni的发布标志着AI竞争的重点已经发生转移:不再只是文本生成,而是对整个世界的生成、编辑与模拟。AI正从"预测下一个词"的模型,进化为能够理解物理规律、参与动态内容创作的世界模拟器。这一转向,或许才是Gemini Omni真正值得关注的里程碑。

标签: AI 测评 AI

更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速

世界模型专家刘宇加盟理想,机器人基座模型研发提速

理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。

2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启

AI办公赛道巨头混战,Agent创业窗口反而开启

2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。

2026-09-05
AI报告读着累?新指标用隐喻率量化可读性

AI报告读着累?新指标用隐喻率量化可读性

Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。

2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%

AI科学家K Pro上岗,全球最大药企研发提速70%

Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。

2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。

2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明

AI攻克费马大定理:Claude 11天写出1300万行证明

Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。

2026-09-05
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部