清华曹婷:机器人从60分到100分靠自进化
具身智能的讨论核心正在改变:从谁有更多数据能做出更强基础模型,转向谁能把机器人真正部署到现场,并让它持续做成任务。
过去两年,行业争论围绕基础模型展开:VLA还是世界模型?端到端还是分层架构?如今,当模型走出实验室,新问题压过路线之争:机器人能不能在真实现场稳定工作?
在硅谷,这已成为一批研究者和投资人的共同感受。投资人Georgi Koreli转述Physical Intelligence联合创始人Karol Hausman的判断:机器人数据稀缺正在缓解,真正未解决的是从“能做”到“可靠完成任务”的最后一段路。从0到60%的zero-shot能力主要是数据问题,从60%走向可部署,还没人能解决。
国内,清华大学智能产业研究院(AIR)教授曹婷与她发起的域变换(Z-Trans)更早押注同一问题。2026年,从z0到Zetta ζ,再到Zeva,团队密集开源上下文因果学习世界模型、闭环在线学习Agent和支持全部署周期的训推基础设施,把研究焦点从“机器人出厂时会什么”推向“机器人部署后还能学会什么”,并率先将这套面向真实物理部署的范式定义为:具身自进化。

答案藏在真实交互里。一只机械臂伸向透明塑料水杯,第一次用力过猛,第二次位置不对,第三次调整动作拿起水杯,之后类似杯子都能成功抓起。几次尝试间,模型没有重新训练,权重也没更新,却从与物理世界交互中学会了下一次该怎么做。
这正是域变换攻下“可部署鸿沟”的方式:让机器人从“部署即定型”走向“部署后进化”,在真实工作中越用越强。
大模型成功建立在更多数据、更大参数量与更多算力带来能力涌现的逻辑上。早期具身智能也复制这条路径:采集更多操作数据,训练更大VLA和WAM模型,再微调适配任务。这条路能提高初始能力,却在真实部署时遭遇瓶颈。模型优化的是对数据中动作的复现,企业需要的却是任务稳定成功。于是,具身模型越来越多、Demo越来越惊艳,真正能进入工厂、实验室和家庭长期工作的机器人依然很少。
所谓“60分”,不是精确及格线,而是对产业阶段的概括:预训练解决基础操作能力,部署要求解决它能否在环境变化、执行误差和长尾情况中“持续做成”。前者可主要依靠离线数据提升,后者不能靠继续离线堆叠数据自然得到。根本原因在于,物理世界持续变化无法被离线数据穷举。每换一个环境就重新采集、fine-tune和部署,成本高且无法形成规模效应。

因此,从60分到可部署,缺的不是再做一次离线训练,而是一种新能力:机器人能在部署中利用真实反馈持续纠偏,把每次成功和失败转化为下一次行动的经验。下一阶段竞争,将从谁拥有更多离线样本,转向谁能率先建立部署后的学习闭环。
域变换率先明确提出和定义的,是具身智能在真实物理世界中的自进化范式:物理智能体在部署环境中持续交互,通过反馈与经验沉淀自主修正策略,并不断提升任务成功率。它不是否定预训练,也不是不要数据,而是重新划定二者位置:预训练是能力起点,部署是进化起点,真实交互成为持续增长的数据来源。
曹婷的第一次关键选择,是进入微软亚洲研究院,担任首席研究主管,研究边缘智能与神经网络训推系统。她带领团队攻克极低比特模型量化、基于查表的大模型高效推理等技术,使复杂神经网络进入微软Office、Windows、Bing等产品。这段经历塑造了她的判断:算法指标不是终点,只有模型能在真实硬件、真实成本和真实业务约束下运行,技术才完成从论文到产业的跃迁。
第二次选择,是2025年夏天加入张亚勤院士创建的清华AIR,研究对象从有限硬件中的AI转向不断变化的物理世界。但团队很快发现,模型在固定设置下能完成动作,环境稍有变化就可能失败,失败中的宝贵信息又被传统系统直接丢弃。

第三次选择由此出现:与清华AIR副院长刘云新教授共同发起域变换,把物理智能自进化的研究推向产业。两人共同底色是对“算法—系统—硬件”协同的长期积累,关心的不只是更高分模型,而是如何把模型变成能部署、学习并长期运行的系统。
域变换自进化闭环的内核是Zeva:不更新参数,也能从机器人每一次交互中学习真实物理条件,并把学到的用于后续动作。现有上下文学习主要依赖人类示范,Zeva创新提出上下文因果学习(ICCL):让机器人从自己的交互轨迹中提取动作与状态变化的因果关系,同时过滤背景、光照等无关相关性。机器人不是模仿别人做过什么,而是在当下部署物理条件下,理解自己的动作为什么成功或失败,并应用到下一次改进。
Zeva核心机制分三阶段:因果交互提取,CTE把视觉状态、执行动作和观察效果组合为“因果交互状态”,编码为任务阶段与交互信号;双时标因果记忆,BIT保留近期尝试动态信息,PIM在同一episode多次尝试间按相似度合并巩固有用证据;上下文策略注入,系统从记忆检索匹配当前任务阶段的交互证据,为冻结基础策略构造Causal Prompt。模型参数没变,但每次决策依据的上下文已不同。
这条路线最反直觉之处在于:模型不更新,能力却可持续增长。它把推理上下文变成学习通道,也把真实失败从“无效样本”变成学习信号。在Zeva公开实验中,冻结模型在多个典型具身基准任务上累计成功率从26%提升到73%;在RoboCasa365-Atomic5
更多推荐阅读

刘慈欣坐镇AI科幻大赛,百万大奖寻找完整故事
初中时看《科幻世界》很痴迷,从《三体》到《逃出母宇宙》,想象力第一次被插上跨越星河的翅膀。这几年我试着用AI把脑海中的场景画出来、做成视频,也收获了不少关注。看到RunningHub与第十七届华语科幻星云奖联合发起全球AIGC长片创作大赛,内心某个角落被激活了。大赛9月8日启动报名,10月9日先导片提交截止,11月3日正式作品截止,约两个月创作时间。这是我一定要参与,也强力推荐给朋友的比赛。 奖...
2026-09-10
中国首部AI长剧导演:三年后99%影视内容都将用上AIGC
9月6日晚,导演李东珅在北京朝阳一文创园接受采访。他是国内首部AI长剧《后西游记》的导演。该剧共30集、每集约40分钟,画面和人物演绎均由AIGC完成,2026年8月31日在芒果TV上线并登陆湖南卫视黄金档。芒果超媒连续两个交易日“20CM”涨停,9月1日报收20.38元,两日市值增加约116.5亿元。 李东珅曾拍过《河西走廊》《中国》等纪录片,自称“国内拍历史类纪录片已是天花板”,但去年他感到...
2026-09-10
AI不需要K8s?他们放弃数百万营收转向AI Infra
“做事情就得边开车边修轮子,你得往正确的方向走,不能等坐上保时捷了才出发。” 四年前,法国一场 CNCF 大会上,主持人问大模型创业者:“Kubernetes 能为 AI 带来什么?”对方脱口而出:“AI 不需要 K8s。”随即又找补说也用了一点点 K8s 管底层集群。台下坐着的梁胜与秦小康对此格外敏感:写 Python 的大模型开发者关注权重、上下文和推理延迟,而非 Pod 编排与容器调度。 ...
2026-09-10
GPT-4o核心研究员连辞OpenAI和Anthropic
9日凌晨,Jacob Coxon在X上宣布从Anthropic辞职。他过去三年在OpenAI和Anthropic做预训练研究,是GPT-4o核心贡献者。今年年初,他因Anthropic的安全声誉从OpenAI跳槽过去,几个月后却连整个AI行业一起退出。他将当前AI竞赛称为“一场傲慢的赌博”,认为不该从私人公司的Slack里发动。 Coxon认为,两家公司问题不同:OpenAI很多人没有真正内化文...
2026-09-10
AI打破助听器30年暴利,深圳公司把价格打到十分之一
一个塞在耳朵里的小东西,卖到十万一副。全球近九成助听器市场份额被五家外资公司把持:索诺瓦(峰力)、Demant(奥迪康)、WS听力、瑞声达、斯达克。旗舰产品在中国线下卖到七至十万一对,美国也要三四万。过去二十年,市场格局几乎少有波动。 垄断的根源是一道技术难题:音频分离。在嘈杂环境中锁定人声并不容易,谁能解好这道题,谁就有资格定高价。五家公司用芯片和算法做到七八十分,再用遍布全球的验配门店,把市...
2026-09-10
豆包工作更新实测:浏览器录制回放与本地Office编辑上线
AI圈现在卷得最凶的地方,是你的电脑桌面。OpenAI不断强化桌面端应用,Anthropic相继推出Claude Code和Claude Cowork。字节这边也没闲着,豆包工作又上了一波新:浏览器录制与回放、本地Office编辑、任务执行环境自由切换。 用过一圈AI办公工具的人,多少都有同一种体感:AI会的越来越多,自己却没轻松多少。原因在于,AI虽然已经坐进了你的桌面,但它还是不知道你每天都...
2026-09-10