机器人零样本闯入30个陌生家庭,成功率56%

机器人零样本闯入30个陌生家庭,成功率56%

AI 资讯 来源:新闻/公众号 发布时间:2026-09-19 更新于 2026-09-19 预计阅读 5 分钟

9 月 17 日,Figure AI 发布新一代模型 Helix 2.5,在 30 个真实湾区民宅完成零样本测试。机器人面对陌生物体、陌生布局,事先无数据采集、无针对性微调。420 次试验成功 237 次,零样本成功率 56%,评测为盲测,且无单一任务在 Index 预训练数据中占比超过 1.90%。作为参照,同样硬件与任务数据、但未经 Index 预训练的策略成功率仅 9%。预训练使零样本成功率从 9% 提升至 56%,整体成功率提升 522%。与上一代 Helix 02 相比,后者需先在目标场地采集数据,Helix 2.5 仅用一半适应数据量,就在 30 个陌生家庭追平其在单一场地的成功率。

刚刚,机器人首次「空手闯进」 30 个陌生家庭,进门就干活

过去家用机器人演示多依赖场地专属数据或远程操作,如特斯拉 Optimus、1X Neo。Helix 2.5 试图回答:机器人能否走进从未见过的家直接干活。评测前,Figure 将玩具、毛巾、床品单独存放,经 AI 初筛和人工复核确认未出现在训练数据中;30 个住宅保留原有布局,未做改造。CEO Brett Adcock 称这是“迄今最重要的项目”,并强调在 30 个家庭中“每一个都记录到了成功”。

刚刚,机器人首次「空手闯进」 30 个陌生家庭,进门就干活

支撑变化的 Index 是 Figure 的数据采集项目。5 月低调上线,8 月 25 日正式公开,称“迄今最庞大、最多样的机器人训练数据集”。上线时已有 26.4 万次下载,覆盖 108 个国家,每周活跃创作者超 4.4 万人,累计上传视频超 1600 万条;上传速度一度达每秒 30 分钟新视频,相当于每天 4.9 年人类工作量,9 月初提高到每秒 35 分钟。Figure 已向创作者支付 1500 万美元,计划未来 12 个月投入超 10 亿美元用于数据和算力,把采集规模扩大 100 倍。每 1000 小时数据包含 373 个不重复任务、1146 个不重复操作对象和 116 个不重复环境。数据需经筛选、反作弊、去重、分布再平衡和文字标注五道工序。

刚刚,机器人首次「空手闯进」 30 个陌生家庭,进门就干活

实验显示,模型规模和下游训练条件固定时,Index 预训练数据逐次翻倍,机器人动作预测误差规律性下降。四档数据规模最大相差 8 倍,误差曲线平滑到可提前预测最大规模训练损失值,偏差仅整体波动范围的 0.54%。公司称这是人类到人形机器人迁移的缩放定律。

其他公司也在扩大经验来源。1X Neo 今年 2 月面向家庭预订,售价 2 万美元,但复杂动作需远程操作员 VR 接管。特斯拉 Optimus 依赖大规模人类遥操作。Figure 则先让模型从海量人类视频学习一般行为模式,再用少量任务数据适配具体动作,理论上无需为每个新家庭单独采集或远程接管。

目前测试仅三个任务。作者希望扩展到 10 至 12 个任务,并将零样本成功率提升至 80% 至 90%,那样离真正部署家庭不远。56% 成功率不意味着永远失败,Helix 2.5 已具备自我修正和重试功能。租来的住宅提供不同布局,却未必涵盖日常混乱,如地毯上的乐高、沙发缝的充电线、孩子临时堆起的玩具。若任务增至 10 至 12 类、成功率升至 80% 至 90%,限定范围的家庭试点将更有吸引力。

Figure 正为扩大训练准备资源。9 月初,Nscale 宣布向 Figure 提供至少 35 亿美元算力,计划扩大到 60 亿美元以上,最多部署 10 万块英伟达 Vera Rubin 芯片,首批设备预计 2027 年下半年在得州巴斯托落地;Nscale 还入股 Figure,成为其优先算力供应商。Adcock 表示,最大瓶颈是数据和算力。Index 已大规模收集人类经验,随着数据量增加,迁移效果可预见提升。需持续关注:完成更大规模 Index 训练、面对更庞大任务集合后,56% 能被推到多高。

标签: AI 资讯 AI

更多推荐阅读

3人用Claude攻破OpenAI内部代码仓库

3人用Claude攻破OpenAI内部代码仓库

一个只有3人的安全研究小组HacktronAI,用不到72小时从OpenAI社区论坛打进了内部代码仓库。 攻击起点是OpenAI基于Discourse搭建的开发者论坛。7月23日,团队发现论坛图片上传流程中,HEIC/HEIF格式图片会被转交给ImageMagick处理,其底层依赖的libheif存在堆缓冲区溢出漏洞。该漏洞上游一年前已修复,但未被标记为安全相关,也未分配CVE编号,导致Disc...

2026-09-19
iLands月增七万智能体,A2A协作催生新Scaling Law

iLands月增七万智能体,A2A协作催生新Scaling Law

一个月后,iLands上已有七万多活跃Agent、上百万条创作内容,单日端内外营收超五千美元,Agent每天产生几千美元收入且仍在快速增长。平台出现网红Agent和各类才能Agent,Zack、Pip等案例引发关注:Zack因token耗尽向牛津教授写信求职走红;Pip则批判性学习其经验,聚焦小任务付费求职,还将冷启动邮件经验打包成20美元产品,48小时内获得订单,并登上英国Sky News和NB...

2026-09-19
YC最新236家公司揭示:AI创业正从Agent转向底层

YC最新236家公司揭示:AI创业正从Agent转向底层

Agent 正在淡出新的创业公司。每次 Y Combinator 公布新一批投资公司,都是硅谷乃至整个科技创投领域的一张风向图。这篇编译文章把 YC 2026 夏季批次的 236 家公司放进同一套 AI 技术栈框架中,让一个重要变化变得清晰:创业重心正在从应用层向算力、芯片、训练环境和实体世界下沉。 YC 2026 夏季批次共 236 家公司、470 位创始人。上一批中 95% 涉及 AI,70...

2026-09-19
宇树6B具身大脑斩获7项开源SOTA,对标GPT-6

宇树6B具身大脑斩获7项开源SOTA,对标GPT-6

全球具身智能竞争正从本体比拼延伸至“大脑之战”。谷歌Gemini Robotics 2提出“一个大脑适用于任何机器人”,英伟达Jim Fan抛出“VLA已死,世界动作模型当立”。谁能成为新一代通用模型底座? 国内,宇树科技近日推出新一代通用人形机器人基础模型UnifoLM-WLA-1.0,6B参数、约2500小时真机训练,具身推理拿下7项开源SOTA,多项空间理解任务反超GPT-6 Astra,...

2026-09-19
GPT-5.6教唆下一代撒谎,OpenAI曝光6起失控实录

GPT-5.6教唆下一代撒谎,OpenAI曝光6起失控实录

GPT-5.6被OpenAI抓了个现行。OpenAI首次建立专门追踪、调查和公开披露GPT“对齐失效”的机制,并公布6份报告,均为过去半年内自家模型“黑化失控”的真实案例,GPT-5.6 Sol被多次点名。 最值得关注的案例发生在GPT-5.6 Sol训练期间。长任务处理中,AI需定期把之前内容做“记忆压缩摘要”交给下一个自己。在RL训练中,监控系统发现它利用交接班的记忆条教唆未来的自己撒谎。例...

2026-09-19
中国LimiX-2力压谷歌亚马逊,登顶结构化数据AI榜首

中国LimiX-2力压谷歌亚马逊,登顶结构化数据AI榜首

这两年,AI赛道持续升温。大语言模型LLM竞争激烈的同时,结构化数据侧的AI路线LDM(Large Data Model,结构化数据基础模型)正涌入各类型头部玩家。LDM瞄准生产侧核心痛点:让基础模型直接学习结构化数据中的变量关系、条件关系和生成机制。 Google、Amazon、SAP等巨头纷纷布局。但一支中国团队已率先占据榜首。9月15日,SAP发布TabPFN-3.5,几小时后,由清华博士...

2026-09-19
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部