语言模型之外另一条AGI路径:生数从世界模型出发
中国AGI正形成两条路径:一条让机器理解、运用语言,另一条让机器认知、推演并改造世界,二者终会交汇。
过去三年,通往AGI的主叙事几乎都从语言开始:更多文本、更大参数、更长上下文、更强推理,加上工具调用与智能体。这条路已证明其力量,让机器能读写、编程、检索、规划,并接管部分原本只存在于屏幕里的复杂工作。
但当任务从“在网页上完成表格”变成“把灯泡拧进灯座”,问题变了。机器人不仅要看见物体,还要判断手指如何接触、转动会发生什么、拧偏是否停下、下一步如何纠正。它需要的不仅是能描述世界的模型,而是一套能在行动前预演后果、行动后复盘得失的内部世界。这正是AGI竞争出现分岔的地方。

同样脱胎于清华实验室的智谱与生数,提供了两组中国样本:前者以语言模型与智能体为核心,后者以世界生成、实时交互与世界动作模型为线索。它们像在同一座山的两面攀爬:一面从人类已编码的语言和知识出发,另一面从世界持续发生的变化与反馈出发。
要看清第二条路的难点,最好把镜头拉回一双正在工作的手。把灯泡拧进灯座,最难的是螺纹刚碰到灯座的一瞬间:手指需感到阻力,旋转偏了玻璃会卡住,握太紧动作会变形。人的手不会先算公式再行动,而是一边看、一边碰、一边根据反馈调整力道。这才是“手巧”的本质:行动前判断后果,接触后知道如何改。
今天的机器人离这件事仍有距离。它能看懂“把灯泡拧上去”,也能复刻训练过的轨迹,但当位置偏了、材质变了、物体打滑时,真正考验它的是有没有一个会预演后果、理解反馈的“内在世界”。这也是世界模型成为AI新前沿的原因。不久前亮相的Motus2,正是生数沿着这条路线,走到“手必须真的碰到世界”这一关时给出的新答案。

世界模型在不同领域正从不同入口撞向同一问题。视频生成想让模型学会世界如何随时间展开;空间智能希望生成可从不同视角检验的环境;机器人和自动驾驶则必须回答:如果我向左移两厘米、夹爪收紧一点、手腕多转五度,世界会怎样?底层都绕不开同一闭环:智能体观察世界,采取行动,行动改变世界,新世界再产生新观察。
今年6月,李飞飞与World Labs团队在《A Functional Taxonomy of World Models》中,从POMDP框架出发,将世界模型概括为三种功能:输出像素观测的渲染器、输出几何或物理状态的模拟器、输出下一步行动的规划器。两个月后,朱军团队发布《General World Models from First-Principles》,进一步追问:模型若要真正通用,这些能力应如何在同一个循环中耦合、成长和自我修正?前者拆开功能部件,后者关注部件之间如何转起来:理解此刻世界,预测不同条件下的未来,采取改变世界的行动,再让真实反馈进入下一轮理解与决策。这就是通用世界模型第一性原理:理解、想象、行动,是一条不能断开的因果链。
朱军团队将通用世界模型分为五级:L1世界生成,学习世界如何演化;L2与世界交互,外部输入持续改写后续状态;L3在世界中行动,模型动作进入环境并获得反馈;L4是能围绕长期目标自主感知、规划、探索和学习的世界智能体;L5走向多个机器人、数字智能体、人类与工具之间的协同组织。

AGI的两条坡并非互相替代。大语言模型以文本、代码、符号和工具为主要材料,关心机器如何从读懂一句话走向组织目标、调用外部能力并完成复杂任务。生数押注另一组原材料:时间、空间、视觉、动作和反馈。从Vidu视频生成,到Vidu S1实时交互,再到Motubrain和Motus系列世界行动模型,底层反复追问:模型能否从“生成一个看上去成立的世界”,走向“在一个会被自己改变的世界里持续行动”?语言可以告诉机器人“把桌面收拾好”,却不会自动告诉它杯子里还有没有水、纸张是否被压住、抽屉为何拉不动、玻璃边缘是否正滑出手指。即便模型给出漂亮计划,落到物理世界仍要面对距离、重力、摩擦、遮挡、形变、延迟和不可逆失误。
因此,智谱与生数这一对同出清华的对照组,并不处在同一窄赛道。语言模型让机器更好理解、表达、推理并调用人类已有知识系统;后者努力让机器获得对具体世界的动态理解,行动前预演,行动后校正。这是AGI的南北坡:有人沿语言和符号向上,有人沿时空和行动向上。峰顶未必近在眼前,但两条路都已不能缺席。
以生数科技为例,其核心判断不是“生成了多少虚拟世界”,而是能否将理解、预测、行动与反馈形成可验证、可持续迭代的闭环。沿朱军团队的五级路线,Vidu让模型学习世界如何演化,Vidu S1让外部输入持续改变后续状态,Motus与Motubrain把问题推到“模型动作会如何改变世界”。最新Motus2是这条链路在灵巧操作上的推进:同一套共享参数模型既提出候选动作,也预演后果、评估哪步更接近目标,并将反馈用于改进下一次选择;结合第一视角人类数据、机器人域适配与触觉反馈,试图让机器人不只会模仿动作,也开始理解行动后果。这仍是从L3向更高自主性迈出的一步,而非终点。
在2026外滩大会上
更多推荐阅读

OpenAI称霍奇猜想取得进展,千禧难题接连被攻?
《纽约时报》最新追访披露了OpenAI与数学家Tristan Buckmaster冲突的更多细节。最关键的一条是,OpenAI更新了用户数据说法:Buckmaster过去两个月的Codex提示词绝不可能影响内部模型,7月3日之后的用户输入也不可能进入该系统。这比此前“无法完全排除匿名用户数据曾帮助改进模型”的表态更明确,但仍属单方面说法,无公开技术材料可供独立核查。 数据争议未落地,OpenAI...
2026-09-11
300亿美元VAST Data在前,中国AI存储第一股能否破局?
2026年4月,VAST Data完成约10亿美元融资,估值达300亿美元,客户包括xAI、CoreWeave和美国空军。资本市场正用真金白银为AI存储软件定价。与此同时,北京的XSKY也在寻找答案。2026年8月30日,北京星辰天合科技股份有限公司再次向港交所递交上市申请,华泰国际担任独家保荐人。这是它第二次冲刺港股,半年前首次递表因超过六个月有效期而失效。若成功上市,XSKY有望成为港股首家以...
2026-09-11
陶哲轩怒批AI抢发千禧难题杀死开放科学
昨晚,OpenAI官宣其内部模型破解了千禧年难题之一的纳维-斯托克斯方程。但事件迅速引发争议。有说法称,纽约大学数学家Tristan Buckmaster和Leven Alpöge经过数月探索,发现了一条极有希望的解题路径。OpenAI得知后,调集海量算力沿该方向暴力穷举,并试图控制成果发布,甚至要求对方在共同发表时删除Anthropic合作者的署名。OpenAI研究员Sebastien Bube...
2026-09-11
梅涛AI视频新品Vivago R1上线,告别抽卡时代
AI视频创作智能体Vivago R1结束两个月内测后正式上线,主打“确定性交付”,官方称要让AI视频告别抽卡模式。其母公司vivago.ai此前全球用户超7000万,曾登顶Product Hunt日榜第一。 实测中,输入《三体》小说片段后,R1可自动生成大纲、剧本、分镜、图片资产及视频片段,并支持直接输出合并成片,音效同步生成。成片整体质感尚可,但存在加速液充盈感不足、飞船显影突兀等bug。产品...
2026-09-11
OpenAI暂停200美元ChatGPT Pro新订阅
OpenAI宣布暂停200美元/月ChatGPT Pro档新订阅。负责Codex的产品负责人Tibo在X上表示,为确保现有用户继续获得良好的Astra使用体验,将暂停该套餐新订阅,因为该档给系统带来的压力最大,这是为维持广泛访问采取的最小措施。其他套餐和API不受影响,已订阅用户照常续费和使⽤。OpenAI表示正尽快增加算力。目前购买页已变灰,20x档显示“此计划暂不开放新购买,现有订阅不受影响”...
2026-09-11
AI狂飙2030:GDP暴涨,钱却流向富人
到 2030 年,如果 AI 已能自主完成大量工作,美国经济会怎样?Anthropic 最新经济学报告给出一个看似矛盾的答案:经济高速增长与就业萎缩可能同时发生。 报告设定三种情景。温和情景下,AI 覆盖约 20% 全经济任务,企业实际采用其中五分之一,最终约 4% 任务受影响,一半增强人类、一半自动化。到 2030 年,美国 GDP 比无 AI 基准高 1.6%,当年增速从约 2% 升至 2....
2026-09-11