一颗RGB摄像头,让机器人学会记住空间
机器人正在学习一种曾经只属于人类的能力:记住自己走过的世界。第一次进入陌生房间时,人不会逐帧存储一切,而是记住关键结构:门、桌子、经过的位置以及自己当前所处的位置。这种选择性记忆支撑了人类在复杂环境中的持续行动,也是机器人走向真实世界必须解决的问题。
今年4月,蚂蚁灵波开源的流式3D重建基础模型LingBot-Map,正是在“机器人如何记住空间”这一核心问题上探索出新路线。无需复杂硬件,仅靠一颗普通RGB摄像头,就能在视频采集过程中实时完成相机位姿估计与场景三维结构重建,填补了实时空间感知领域的关键技术空白。在穿越多房间的长序列中,面对环境剧变与大幅视角变换,LingBot-Map仍表现出极强的鲁棒性。

截至目前,LingBot-Map官方GitHub项目已获得16.9K Stars、1.9K Forks,并多次登上GitHub Trending,成为3D视觉领域备受关注的开源项目之一。
如今这项研究迎来新的认可。其论文《Geometric Context Transformer for Streaming 3D Reconstruction》入选ECCV 2026 Oral,将在会议期间进行口头报告。在ECCV开幕式上,机器之心前方编辑还在Award Candidates名单中看到了这项工作。从GitHub社区的高度关注到顶级视觉会议的认可,LingBot-Map完成了从开发者生态到学术界的双重验证。更重要的是,它背后反映出一个变化:机器人空间感知的竞争,正在从看见世界走向记住世界。

在入选ECCV Oral之前,LingBot-Map已在开源社区收获大量关注。有人快速完成复现验证,有人把它搬到不同硬件环境尝试运行,也有开发者探索新的空间数据采集方式。开源后不久,有开发者制作了可在Apple Silicon Mac上本地运行的原生桌面前端和3D点云查看器;也有人基于Pinokio制作一键启动方案,封装环境配置、依赖安装及Demo运行流程,让没有复杂配置经验的用户也能快速体验。
开发者还开始扩展其硬件适用范围。有人针对RTX 4060 8GB显存设备进行适配,通过优化运行策略降低显存压力,让模型运行在更轻量的GPU环境中。在X平台上,有开发者关注到,过去部分高精度三维扫描依赖专业LiDAR设备或复杂离线优化流程,而LingBot-Map通过普通视频流实现实时流式重建,仅需单GPU即可运行,达到约20 FPS,并能处理超过10,000帧的长序列输入。基于此,有人将Ray-Ban Meta Gen-2智能眼镜改造成3D扫描设备,通过手机App采集数据,调用部署在RunPod上的LingBot-Map后端,约30秒内完成所在空间的三维建图。还有用户在普通戴尔台式机上运行LingBot-Map,仅对办公桌进行一次视频采集,约61.5秒后便获得可交互浏览的三维点云模型。

开源之后,团队持续更新评测脚本、推理优化、示例案例及问题修复,提升项目可用性和稳定性。官方还展示了超长视频重建结果:在约25,000帧、持续13分钟的室内行走视频中,LingBot-Map仍能保持连续重建,生成完整的三维空间表示。
那么,LingBot-Map究竟解决了什么问题?答案需回到机器人空间感知中最核心的挑战:如何让机器人在不断增长的视频输入中,既保持对空间的长期记忆,又避免计算和存储成本随时间无限增加。流式重建相比离线重建,要面对一个核心矛盾:保留更多历史信息可提升空间一致性,但历史越来越长也会让计算和存储成本快速增长。现有方法大致采用三种路线:基于causal attention的方案缓存之前所有帧的信息,拥有完整上下文,但显存和计算量随序列增长不断增加;循环网络式结构压缩历史状态,但压缩过度可能导致模型遗忘关键几何信息,长时间运行后出现轨迹漂移;结合传统SLAM的方法通过关键帧选择和优化算法维持稳定性,但依赖人工设计规则,需要额外优化过程,难以兼顾实时性。
因此,真正困难的问题是:机器人面对不断增长的视频流,哪些空间信息必须保留,哪些可以舍弃?LingBot-Map将这个问题称为streaming reconstruction中的context management。它希望让模型像人类空间记忆一样,只保留最重要的几何线索,而不是记录所有观察。
为此,LingBot-Map提出了Geometric Context Attention(GCA,几何上下文注意力)。其核心思想来自传统SLAM:一个稳定的空间系统通常需要三类信息:一个固定参考点用来确定坐标;附近区域的信息用来判断当前位置;长距离历史用来避免累计漂移。因此,GCA将流式状态拆成三个部分。
更多推荐阅读

地瓜机器人具身智能负责人离职,加入工业具身新公司
场景落地成重要考量,具身人才开始流向工业赛道。 AI科技评论独家获悉,地瓜机器人具身智能负责人何泳澔已离职并加入具身赛道新公司,预计近期将对外官宣。 公开资料显示,何泳澔为中科院自动化所模式识别与人工智能博士,长期深耕机器人感知、具身智能策略算法领域,在轨迹数据处理、机器人策略学习方面有多项技术积累与专利成果。任职地瓜机器人期间,何泳澔担任具身智能负责人,主导具身 VLA/VA 模型、机器人视...
2026-09-11
国产万卡算力爆发,科大讯飞让AI反哺算力
最近几个月,国产 AI 算力开始密集跨过新的数量级。7 月,全国产十万卡 AI 超集群落成;9 月初,无锡国产万卡级智算中心一期 2000 张摩尔线程 MTT S5000 GPU 智算卡全部投入运行,集群算力需求基本达到满载;国产卡正进一步向万卡乃至十万卡级训练基础设施迈进。 集群规模越来越大,新问题也随之而来:这些芯片究竟能发挥出多少实际训练能力?大模型训练中,卡数增加会推高系统复杂度。单芯片...
2026-09-11
百度AI营销三件套升级:从做图到管ROI全包了
广告主已不再纠结是否用AI生成素材,而是研究如何借AI提升投放量、降低获客成本。北京一家律师事务所接入百度营销擎舵图片Agent后,AI生成素材在投放中占比达70%,转化成本下降19%。 百度营销正式发布擎舵3.0营销创意智能体,并升级AIMax和AI投放助手。擎舵3.0负责生产和裂变创意,AIMax将素材放入真实流量测试,AI投放助手定位问题,投放结果返回创意端影响下一轮生成,形成闭环。 目...
2026-09-11
黄仁勋宣布AGI已至,评测机构当场拒签
上周四,OpenAI发布GPT-6 Astra,官网称其为“世界上最智能、最对齐的模型”。随后黄仁勋在X上发帖称“AGI已经到来”,但OpenAI官方发布页并未出现“AGI已实现”字样。 OpenAI称Astra在ARC-AGI-3上拿到99.9%,饱和了该基准。但负责出题的ARC Prize基金会当天发文拒签,指出该分数来自OpenAI定制测试环境,换成对所有厂商一视同仁的标准环境,最高分仅6...
2026-09-11
90后发Nature,高中生进ICML:AI正在折叠科研
假如你吃了个鸡蛋觉得不错,何必认识那只下蛋的母鸡?钱钟书这句名言,在今年外滩大会有了AI版本:当你读到一篇好文章,解决了疑问,也学到了东西,它究竟是人写的还是AI写的,还重要吗? 提出这个问题的是北京大学博士生吉嘉铭,上届蚂蚁InTech奖得主。他还预测:学术Conference一定会消失。同一舞台上,三院院士Michael I. Jordan也聊到学术会议,但视角不同。他说,今天的会议和论文越...
2026-09-11
银行AI Agent上岗:4200万小微商家聊天框里办贷款
过去只有大企业才有的专属金融服务,AI Agent正在把它送到小微经营者的聊天框里。一个小微商家想开第二家餐饮店,在聊天框说了句“想把额度提一提”,10分钟后拿到一笔40万、可按开店进度分笔支用的融资方案。速度背后,通常是一个标准化产品,额度不会太大,方案也不贴合具体生意。如今终于有个性化的解决方案了。这是网商银行在2026外滩大会上首次披露的AI银行落地进展:后台AI全面进入风控、人审、营销、产...
2026-09-11