GPT-6操控宇树G1进厨房干活,无需额外训练
GPT-6 Astra接上宇树G1,进厨房干活了。在斯坦福团队的最新项目HomeBody中,宇树G1先探索一个从未见过的厨房,随后就能根据语言指令收拾物品、丢掉纸盒,甚至把不在眼前的药找出来递到人手里。比如让它把咖啡袋集中放到中间,再丢掉指定的牛奶和橙汁纸盒,G1就会在厨房里来回搬运,把咖啡袋归拢到岛台上,再处理要丢弃的纸盒。一句“帮我把药拿来”,即使药不在当前视野里,它也能从之前保存的画面中找到线索,走到对应抽屉前,打开抽屉、取出药,再递给人,期间还能把丢纸盒的任务一并完成。
从Robocurve此前让GPT和Claude控制机械臂完成桌面抓放测试,到这次G1走进厨房,大模型控制机器人的任务范围又往外扩了一圈。这一次,机器人不只要判断眼前抓什么,还得记住东西在哪,再把走路、抓取、放置连成一串。更值得注意的是,团队表示,部署到这个新厨房时,系统不需要额外采集训练数据,也无须再训练一套专用动作策略,泛化性相当可以。

不过,事情还没简单到“买台机器人,登录GPT”这一步。HomeBody的核心思路可以概括为一句话:让GPT把机器人技能当工具调用。Astra负责理解目标、安排步骤,再调用导航、抓取、开抽屉等技能,把任务一步步做完。整个过程分成三步。
第一步,先逛一圈,把厨房记下来。机器人接到指令“你是一台厨房机器人,请探索这个空间”,Astra会选择值得观察的位置,引导G1移动。机器人一边走,一边记录相机画面、激光雷达扫描,以及自身的关节姿态和途经位置。这些观察会被保存下来,成为后续任务可以调用的空间记忆。

第二步,把现实厨房搬进模拟器。Astra担任Real2Sim智能体,在Isaac Sim仿真平台里搭出一个数字厨房。系统还会把SLAM测得的几何信息交给模型,用真实测量约束重建结果。随后,系统会把真实世界的定位地图与数字厨房对齐到同一个坐标系,再将拍到的画面、内容描述和对应位置关联起来。之后再找东西,机器人就能先从记忆里查线索,再走回对应地点。
第三步,给个目标,让它自己安排动作。用户说“收拾一下厨房”,再补充咖啡袋放哪里、哪些纸盒要扔。Astra会结合当前画面、地图、空间记忆、手里有没有拿着东西,以及上一步的执行结果,选择接下来调用哪项技能、操作哪个目标。取药demo就用到了这种能力。

GPT负责安排,身体到底谁来控制?此前Robocurve让GPT、Claude控制机械臂,是让模型根据相机画面和机器人状态,通过工具调用指定夹爪的位置、朝向和开合状态,再由底层模块转换成具体动作。HomeBody同样采用工具调用,但交给GPT的是更完整的技能:导航、抓取、放置、开抽屉,以及从抽屉中取物。
机器人系统常见分工是:System 2是视觉语言模型,负责看图、理解指令、决定做什么;System 1是视觉语言动作模型,负责生成动作命令;System 0是底层控制器,负责协调身体执行。HomeBody调整的正是中间这一环:让System 2直接调用技能库,由技能模块规划具体动作,再交给底层控制系统执行,不必经过一个学习型VLA。技能库里装的是已经写好、可复用的电机技能,有统一接口,大模型只需告诉它“去哪里、抓什么、放到哪”。比如抓取,Astra只需在画面中点出目标物体,再指定使用左手还是右手,抓取技能内部的感知模块会圈出物体、估计深度,结合相机标定确定三维位置,并计算抓取姿态。运动规划器再规划机械臂怎么伸过去、怎样避开障碍,最后交给控制模块执行。每项技能执行后,都会把结果反馈给Astra,再由它决定下一步。遇到偏差时,技能模块会先自行调整、重试,解决不了再交回大模型重新安排。至于走路、伸手时怎样保持平衡,则属于System 0的工作,HomeBody使用预训练的AMO控制策略。
这也解释了为什么不需要额外训练,不等于整套系统从未训练过。HomeBody不用为新厨房重新训练专用动作策略,但现成的感知模型、运动规划和预训练控制器,仍是机器人能把活干起来的基础。不过,省去针对新环境的训练,并不意味着部署和运行没有成本。目前,HomeBody的感知、规划和技能执行运行在一台搭载RTX 4090的笔记本上,Astra则在远端负责决策。前期重建数字厨房需要准备时间和API成本;实际执行任务时,模型推理也会让动作之间出现等待。即使软件流程顺利跑通,长时间干活还得过硬件这一关,比如手指舵机过热,就是系统目前面临的限制之一。
所以,把GPT接上宇树机器人确实能让机器人进厨房干活,但背后还得有一整套感知、规划和控制系统配合。至于现在就买台G1、接上GPT的API,坐等它帮你做家务——还没这么简单。
自Robocurve用GPT-6 Astra控制机器人开始,机器人/具身圈几乎一夜之间进入“大模型时代”。目前主要有几条路线:第一条是Robocurve最早采用的方案,大模型直接接收相机画面和机器人状态,输出夹爪的目标位置、朝向和开合程度,再由底层逆运动学模块转换成关节动作执行,完成后重新观察,形成闭环。第二条路线是让大模型充当System 2,搭配负责生成动作的VLA,Anthropic
更多推荐阅读

Sonnet 5.5发布:速度提升30%,成本暴降,性能反超Opus
就在OpenAI年度开发者大会开幕前一天,Anthropic发布Claude Sonnet 5.5。作为Opus 5.5的搭档,它定位为最快、最省钱、最懂日常工作的全能助手。相比Sonnet 5,运行速度快30%,完成相同任务成本最高降低30%,标价仅为Opus 5.5的一半,性能却几乎追平。 在智能体编程测试Terminal-Bench 4.0中,Sonnet 5.5得分70.6%,约为原来的...
2026-09-29
GPT-6一张图纸造出3295个零件
GPT-6 Astra发布后,OpenAI改变了以往靠跑分榜单展示能力的方式,转而让开发者直接“交作业”。开发者Tom Krcha将一张旧蒸汽机车图纸交给Astra,让它在Blender中重建。几分钟后,Blender里出现3295个可编辑独立对象,包括锅炉、连杆、车轮、铆钉,每个都能单独选中和修改。Krcha强调,Astra并非在Blender里点鼠标操作,而是全靠写Python脚本把零件逐个“...
2026-09-29
高通CEO安蒙谈智能体时代与中国速度
美国当地时间9月22日-24日,高通技术公司举办的2026骁龙峰会在夏威夷举行,首次同时发布第六代骁龙8超级至尊版与第六代骁龙8至尊版两款旗舰移动平台。“智能体AI”贯穿三天峰会,高通总裁兼CEO安蒙强调:“我们正从‘APP驱动’迈向意图驱动的‘智能体’时代。” 大会另一重要信号是端侧智能体落地:高通联合阶跃星辰、无量火、江波龙,将300亿参数的MoE大模型完整部署进手机端侧,让智能体以如此大的...
2026-09-29
88%企业用AI,仅6%真赚钱,阿里瓴羊推AI员工扛KPI
2025年,全球88%的受访企业已在至少一个业务职能中常态化使用AI,但能从中获得显著价值、贡献至少5%息税前利润的“AI高绩效企业”仅占6%。大量AI进入公司,真正帮企业赚钱的却不多。员工用AI把200字总结扩成几十页PPT,老板又用AI压回200字,Token消耗不少,工时省了一些,但企业收入、转化和留存没有改变。 2026云栖大会上,阿里云智能集团瓴羊CEO朋新宇指出,AI可以从效率革命起...
2026-09-29
Sharpa发布首款人形机器人D01,三款新品打通具身智能操作闭环
一双会盘核桃、能做冰淇淋的灵巧手,让Sharpa为人熟知。这家禾赛科技创始团队再出发的具身智能公司,最鲜明的标签是高自由度触觉灵巧手。在正在进行的IROS上,Sharpa推出首款全自研通用人形机器人D01、新一代灵巧手W02及外骨骼数据手套AE01,一次性覆盖手、身体和数据入口。 D01定位一体式触觉感知灵巧操作机器人,手臂载荷自重比接近1:1,最大末端执行器速度超10.5m/s,通信频率100...
2026-09-29
华为联合团队夺SAT 2026大赛AI赛道冠军
近期,约束求解与形式化领域国际顶级赛事 SAT Competition 2026 落幕。由华为诺亚方舟实验室、华为云天筹 AI 求解器团队和华中科技大学 John Hopcroft 计算中心组成的联合团队,获得并行 AI 赛道 SAT 组冠军。 SAT 问题被誉为计算复杂性理论中的“珠穆朗玛峰”,从硬件验证、软件测试到密码学分析与 AI 规划,SAT 求解器已成为自动驾驶、EDA 芯片设计等产业...
2026-09-29