0.2秒急停!因果智能让机器人真懂物理世界

0.2秒急停!因果智能让机器人真懂物理世界

AI 资讯 来源:新闻/公众号 发布时间:2026-10-09 更新于 2026-10-09 预计阅读 5 分钟

这是一台机器人正在关闭微波炉门时,因人手突然插进来而紧急悬停的时间。当金属易拉罐被混在蛋糕盘里端向微波炉,机械臂会先挑出易拉罐,确认安全后再将盘子送入炉内。即便用手电筒闪机器人的“眼睛”,它依然置若罔闻。这些画面不是动作回放,也不是碰巧猜对,而是系统基于对物理世界因果规律的理解,实时推理出的一连串动作。驱动这套机器人的系统代号为CRIS-0,背后是UCSD助理教授、CMU因果学派学者黄碧薇创立的因果智能企业Aether AI。三个月前,量子位曾报道过这家公司的因果智能路线,如今Aether AI亮出了官方Demo。

0.2秒急停、秒级重规划!因果智能走进真实世界

在具身机器人落地场景中,最让工程师头疼的是无处不在的意外。传统机器人面对突发扰动,要么重复旧坐标导致碰撞,要么全流程报错卡死;端到端黑盒模型在长程任务中极易产生累积误差。CRIS-0给出的破局解法是“因果”——让机器人从“看到什么”走向“理解为什么发生、改变什么会影响结果”。

0.2秒急停、秒级重规划!因果智能走进真实世界

在Coffee Preparation测试中,机器人抓取咖啡机时遭遇人为移位、光照突变,CRIS-0平均2秒内识别因果变量改变并完成实时重规划,10次随机扰动中实现9次有效恢复。咖啡机被推开时,系统追踪“把手相对位姿”这一关键因果变量,只修正接近和抓取阶段,无需回归原位重启。在“客厅寻物与整理”长程任务中,系统把目标拆解为原子化、可验证的因果阶段,每步执行前置与后置条件检查。它会把普通书本整理至茶几,却把涉及隐私的账单收纳进抽屉;面对两个相似饮料罐,先晃动感知重量与液体状态,确认空罐后才扔进垃圾桶。在Personal Pick and Place测试中,面对“给我拿一瓶适合晨跑后喝的饮料”等20条模糊指令,系统取得18次精准抓取与放置,通过结合时间、用户状态与环境上下文,把“运动后需要补充能量且避免高糖”作为隐藏因果变量抽取出来。

0.2秒急停、秒级重规划!因果智能走进真实世界

CRIS-0背后是Aether AI设计的因果原生Agent架构。第一,任务即状态:提取物理因果变量。系统不关心图像像素,而是追踪任务进度条。例如铺桌布时,实时追踪桌布是否被夹爪抓住、角点离目标位置距离、是否发生滑移。一旦滑脱,系统知道是“抓住”这一因果变量不满足,任务状态退回重新抓取阶段,而非推翻重来。第二,统一工具接口:拒绝单一策略包揽一切。系统由Planner调度,通过Unified Tool Interface整合规则运动函数、技能策略模型、导航模块、验证器和因果世界模型。其中CausalWM关注Action对环境的影响,先看当前状态,再预测候选动作会导致哪些因果变量改变,最后推导未来状态,相当于让机器人在伸手前先“排练”。第三,结构化循环与原生安全内建。系统形成状态识别→工具选择→执行→验证→调整的任务图,每步验证物理条件,未达成则启动三级恢复机制。成功恢复路径会被记录沉淀,下次更熟练。安全判断内嵌在每个因果阶段,关门时突然出现的人手属于危险变量,系统0.2秒刹停;若任务是递水,人手则是交互目标变量,不会乱停。

CRIS-0的系统级能力背后有研究支撑。Aether AI的因果智能体框架RSIAgent在OSWorld 2.0上取得78.98%的Partial Score,不更新模型参数却能提升开源模型Agent能力,超过GPT-6 Astra等闭源模型。第一版因果世界模型CausalWM在机器人世界模型基准TriWorldBench登顶Leaderboard,取得Top-1。这两层是本次Demo的主要贡献者。另外两层也在推进:模块化神经架构,各模块对应不同因果机制,可组合可替换;Causation Transformer,学习因果关系而非统计依赖。物理世界不相信死记硬背。过去大语言模型爆发很大程度上是因为语言本身是被人类高度符号化的系统。

标签: AI 资讯 AI

更多推荐阅读

字节发现DeepSeek时强时弱原因:输入位置每隔4个Token就变

字节发现DeepSeek时强时弱原因:输入位置每隔4个Token就变

字节Seed团队发现,DeepSeek-V4存在一种“神鬼二象性”:同一道题、同样的内容,仅在前面加入几个无关字符,模型答案就会在正确与错误之间反复横跳,且以4个Token为周期规律性变化。 研究人员最初用DeepSeek-V4官方推理代码中的FP8量化函数做补全测试。正确答案应为8,但模型有时会答成32。他们在代码前加入由等号组成的装饰性文档字符串,仅调整等号数量,代码、补全位置和答案均不变,...

2026-10-09
OpenAI解雇三名安全研究员,联名公开信曝内幕

OpenAI解雇三名安全研究员,联名公开信曝内幕

上周,OpenAI解雇三名员工,称其违反敏感信息访问与处理规定,涉嫌在既定程序外向第三方AI安全评估组织分享机密信息。三人分别是从事模型对齐研究的Jasmine Wang、参与OpenAI与外部安全评估机构技术沟通的Tomek Korbak,以及从事AI安全及模型对齐研究的Mikita Balesni。 三人随后在社媒发表致OpenAI领导层的公开信。Mikita Balesni称,被解雇是因为...

2026-10-09
苹果10月13日发布会剧透:你家将成最大AI终端

苹果10月13日发布会剧透:你家将成最大AI终端

过去十几年,苹果把越来越多设备放进用户的口袋、背包和手腕,却始终没能在客厅找到稳固位置。如今,一封写着「Welcome home」的邀请函,宣告苹果准备重新争取这个位置。苹果已官宣将于当地时间 10 月 13 日在纽约举行新品发布活动,预计推出配备屏幕的家庭中枢、新一代 HomePod mini,以及更新后的 Apple TV 4K。贯穿三款设备的核心,是屡次跳票的新一代 Siri AI。邀请函上...

2026-10-09
谢扬推出Qoni:给Agent发一张工牌

谢扬推出Qoni:给Agent发一张工牌

谢扬认为,Personal Agent 的终点不该是更聪明的命令行。他做的 PA infra 于国庆节后上线。同一天,ChatGPT 上线交互 UI,图形化 Personal Agent 路线之争正式开始;谢扬的 Qoni 也上线,定位为给 Agent 发工牌的基建系统。 当前 Agent 没有身份,也没有公认鉴权方法。用户只能把身份、账户信息开放给 Agent,让它假冒自己办事。类似问题互联网...

2026-10-09
谷歌Gemini 4 Argon突袭:已对部分用户开放

谷歌Gemini 4 Argon突袭:已对部分用户开放

海外科技圈爆料,谷歌下一代模型 Gemini 4 Argon 已密集现身多个平台,并对部分 Pro 用户开放。它已登录 Google Cloud,在编程工具 Antigravity 中被设为默认模型,甚至开始在代码库直接提交代码。科技媒体 TestingCatalog 和 Benzinga 跟进证实,内部系统已上线相关发布卡片。种种迹象显示,Gemini 4 Argon 最快本周甚至数小时内突袭发...

2026-10-09
全球首款量产AI汽车巴黎首秀:从AI里“长”出来的车

全球首款量产AI汽车巴黎首秀:从AI里“长”出来的车

2026年巴黎,AIVA品牌首款量产车AIVA ME7在巴黎时装周期间完成全球首秀。AIVA总裁、产品经理李博与时尚传媒集团品牌运营总经理沙小荔、超模雎晓雯、设计师陈鹏、商业财经博主小lin说同台,但这场首秀不聊续航和加速,而是探讨AI如何真正走进生活。 AIVA ME7的核心是“灵动光眸”。李博表示,眼睛是心灵的窗户,放在车上就应在传统大灯位置,这不是刻意设计,而是生命体相互交互的本能需要。现...

2026-10-09
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部