机器人光会看不够,NVIDIA研究让AI学会听声辨物

机器人光会看不够,NVIDIA研究让AI学会听声辨物

AI 资讯 来源:新闻/公众号 发布时间:2026-09-14 更新于 2026-09-14 预计阅读 7 分钟

机器人进入真实世界,需要处理的信息远不止视觉。倒水时,声音可帮助判断杯子是否快满;物体碰撞时,不同材质声音不同;人在不同房间说话,空间回声也不一样。但这些多模态感知,以及切苹果、叠杯子等双手灵巧操作,在机器人训练阶段面临极高的数据采集壁垒。

在ECCV 2026“Visual Perception and Reasoning in the Interactable World”Workshop上,NVIDIA Research科学家、UC Berkeley研究者李柏依分享了两项工作。她博士毕业于康奈尔大学,师从Serge Belongie与Kilian Q. Weinberger,后在UC Berkeley与Jitendra Malik、Trevor Darrell开展研究,目前聚焦具身智能中的高效多模态、泛化建模和交互智能系统。

面对难以直接采集的数据,她尝试两条路径:模拟器里没有的声音可以“生成”;昂贵的机器人操作数据可从人类视频获得。

第一条路径是MultiGen。传统物理模拟器能模拟逼真倒水过程,却没有同步声音。团队利用现实视频和音频训练生成模型,为仿真视频补上对应声音。思路概括为:“Don’t just simulate physics – generate perception”。

NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026

第二条路径是DexImit。与其采集昂贵的双手机器人示范,团队利用人类操作视频,恢复手与物体交互,再转化为机器人可学习的双手操作数据。

一个补上仿真世界缺失的感知,一个把人类操作转化为机器人可学习的示范。背后思路一致:机器人训练不仅要把物理世界模拟得更真实,还要把难以直接获得的感知和交互信息,变成机器人可以学习的数据。

以下为演讲分享,AI科技评论根据内容进行不改原意编辑:

Efficient Multimodal Intelligence for Embodied Agents in Interactive Worlds

NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026

机器人为什么需要“听见”世界?

现在多模态已不只是图像和语言,还包括3D几何、声音、嗅觉和触觉等。这些模态可帮助模型泛化和推理,也可用于机器人、医疗等真实场景。今天我主要分享两个与机器人有关的工作。

先从声音开始。假设水管往瓶子里倒水,需要判断何时溢出。没有声音,只看水流很难判断瓶内情况。加入声音呢?日常生活中我们一直利用声音理解周围:烤肉时通过声音判断状态;玻璃碎了、门开了、可乐开了、水烧开了,也能通过声音知道。声音还能提供空间信息,小房间、大房间说话声音不同;也可帮助判断物体材质和状态,如洗碗时不同材质杯子、瓶子、盒子声音不同,摇薯片罐判断里面是否还有东西。

机器人能否也利用声音?我们希望训练机器人策略,同时利用视觉、物理信息和声音,更准确执行任务。但真实世界这类数据很难采集。物理模拟器已能生成逼真视觉效果,如倒水,但问题是没有与画面对应的声音。要训练同时利用视觉、物理信息和声音的策略,就需要包含这些信息且彼此对应的多模态数据,现有模拟器无法提供音频。

NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026

MultiGen:不只模拟物理,还要“生成感知”

我们重新看已有数据。现实世界有大量同时包含视频和声音的数据,如YouTube视频,我们将其收集为In-the-Wild Data。目标是训练Audio Generative Model:给模型一段视频,生成与内容对应且时间对齐的声音。我们选择diffusion model,训练时输入视频,让模型学习生成对应音频。训练完成后,模型对不同视频内容有较好泛化能力。把物理模拟器生成的视频输入模型,生成对应声音。这样模拟器负责视觉信息和机器人物理轨迹,生成模型补上音频,得到Simulated Multimodal Dataset。有了数据,就可训练同时利用视觉和声音的Multimodal Robot Policy,再部署到真实环境。

我们测试了不同容器和液体。把液体倒入不规则容器,机器人需判断何时停止;换成可乐后声音和音高变化,机器人仍能完成倒水。还测试环境变化:倒水过程中关灯,视觉受干扰,机器人仍能继续;加入背景噪声,嘈杂环境中策略仍能识别倒水声音。我们比较两种策略:只用视觉,和同时用视觉与声音。不透明容器中,因无法直接看到内部液体状态,只用视觉误差较大;加入声音后误差明显下降。透明容器中,即使视觉已能提供更多信息,加入声音后性能仍提升。更直接对比实验:两组设置相同,一组只用视觉,一组同时用视觉和声音。倒水过程中关灯,等机器人判断应停止后再开灯。只用视觉时,水已溢出杯子。机器人在感知上非常脆弱,一旦视觉受干扰,整个系统容易失效。声音可发挥重要作用,帮助系统更鲁棒。这也是我们想表达的:“Don’t just simulate physics – generate perception.”

DexImit:机器人数据还能从哪里来?

刚才讲的是生成音频信号。接下来看另一类与真实世界有关的交互信息:人和机器人怎样与物体交互。这项工作关注Bimanual Dexterous Manipulation,即双手灵巧操作。它对通用机器人非常重要,很多真实任务需要两只手和灵巧操作,如抓取、倒水、使用工具及长时序操作。但真实机器人上的双手灵巧操作数据采集既昂贵又耗人力。与此同时,人类操作视频几乎无限,可来自日常演示,也可来自视频生成模型,且本身包含人类操作物体的知识。能否直接从人类视频生成机器人灵巧操作数据?这就是DexImit的出发点,全称Learning Bimanual Dexterous Manipulation from Monocular Human Videos。我们希望从人类视频出发,在仿真中生成模仿这些操作的机器人双手数据。

从一段人类视频,到真实机器人

整个pipeline有四个阶段。第一步恢复人手和物体运动。从单目人类视频开始,进行深度估计、手

标签: AI 资讯 AI

更多推荐阅读

横扫四大榜单,DM0.5凭什么面面俱到?

横扫四大榜单,DM0.5凭什么面面俱到?

一个模型同时占据四个能力子榜单的榜首,这在具身智能行业里不多见。 RoboColiseum 由智元机器人发起,联合高校、科研机构、开源社区及机器人企业共同建设,把评测拆成四个维度:指令跟随、空间理解、扰动适应、通用操作。参评者只要在任何一个维度上有结构性短板,就会在对应子榜上掉下来。而原力灵机的通用具身基础模型 DM0.5 在四个子榜上全部排名第一,且目前是唯一做到这一点的模型。 具身评测行业...

2026-09-15
金融AI公司讯兔科技完成超3亿B轮融资,一年连融三轮

金融AI公司讯兔科技完成超3亿B轮融资,一年连融三轮

近日,中国金融AI领跑者讯兔科技正式完成超3亿元人民币B轮融资,过去一年内已连续完成三轮融资。本轮投资方覆盖险资、券商、公募、产业资本与头部投资机构,包括保险业国家级投资平台中保投资、广发信德,以及启明创投、琥珀资本、嘉程资本、信宸资本、钟鼎资本等新老股东,华兴资本继续担任独家财务顾问。融资后,公司将继续加大模型与产品技术投入,拓展多元资产客群,深化产业上下游协同,并稳步推进海外布局。 中保投资...

2026-09-15
北大团队重新定义端侧AI,元空智能跑进惠普预装

北大团队重新定义端侧AI,元空智能跑进惠普预装

静态互联网数据的增长红利已经见顶,下一轮模型能力的跃迁将越来越依赖与真实环境持续交互的“端侧”。从北大走出的元空智能(元空AI)给出这一判断,并重新定义端侧AI:生产力=元空端侧AI=模型×Agent×设备。端侧AI由此从“把模型搬下来”的单向链路,变成能自己转起来的飞轮。 三年前,元空AI靠国内最早一批AI Excel产品ChatExcel出圈,积累上百万用户。三年后,它从云端应用杀到本地端侧...

2026-09-15
仿真数据降本90%,虚时科技冲刺具身智能最后一公里

仿真数据降本90%,虚时科技冲刺具身智能最后一公里

2026年上半年,具身智能赛道融资超460亿元,人形机器人单价迈入“万元以内”。但行业面临真机数据太贵、太慢的瓶颈。近期测试显示,利用规模为真机数据5倍的仿真数据训练,可将机器人真实操作成功率提升40%,成本仅为真机数据的三分之一。业界共识日益清晰:要走向物理AI的GPT时刻,数据需求将超出大模型两到三个数量级,仿真成为通向拐点的关键路径。 国内初创公司虚时科技在底层技术上取得突破,将单个仿真场...

2026-09-15
半年6亿人追AI短剧,红果热播榜前99占77席

半年6亿人追AI短剧,红果热播榜前99占77席

3人核心团队,10万注册资金,半年连出十二季,保守估计利润600万,乐观2000万——AI短剧《万妖图录传》的爆发,正是行业缩影。年初红果APP才设AI剧独立入口,如今热播榜前99名中AI短剧独占77席,必看榜、热搜榜、收藏榜也全被“血洗”。爆款门槛水涨船高:去年播放量破亿可进年度TOP20,如今首日热度破亿的爆剧接二连三。出海同样凶猛,中国出品的AI短剧已占海外七成以上市场,圈内流传“3000块...

2026-09-15
7名博士生3个月从零训出7B大模型,代码数据全公开

7名博士生3个月从零训出7B大模型,代码数据全公开

北京中关村学院7名博士生用一个暑假从零训练出7B大模型ZGCM-1,并开放各阶段训练数据、配方、模型权重、训练代码、中间checkpoint和日志,供研究者追溯复现。在多项通用评测中,ZGCM-1与Qwen3-8B等同规模模型表现相近,部分数学推理和搜索评测中可与Qwen3-235B-A22B、GLM-5.1等更大模型比较。 七人背景分别为人工智能、网络、化学、生物和网安。他们因兴趣凑到一起,平...

2026-09-15
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部