大模型脑中藏三维地图,为何不会用?
多模态模型的空间推理存在一种反直觉现象:它能识别图像内容、回答简单方位问题,却在视角转换、方位判断和前后关系推理时失灵。过去这被归因于“空间能力不足”,但MirroS发布的S-Space研究给出了更精细的解释:模型内部可能已形成相当准确的空间地图,真正的短板在于稳定读取、变换和使用这张地图的能力。

S-Space是模型隐藏状态中的三维空间工作区,物体位置沿水平、垂直、距离三个方向连续编码。研究者能从模型中间层读出物体坐标,也能改写这些坐标,并观察到模型的空间判断随之改变。这意味着空间智能不再只是输出层的行为,而成为可观测、可诊断、可接入外部计算系统的内部结构。

研究将空间推理拆分为感知与操作两层。在简单空间关系任务中,仅从中间层读出坐标并比较差值,即可在CV-Bench、EmbSpatial-Bench等评测中稳定作答,说明模型内部存储的是连续坐标而非离散标签。真正的难点在视角转换。以Qwen3.6-27B为例,直接回答准确率为60.96%,加入思维链后升至83.56%,而从S-Space读出坐标、由外部程序执行固定旋转并用确定性规则作答,准确率达95.21%。思维链并非无效,但模型在推理中虽尝试“转动”内部地图,这种转动不够稳定精确,仍会出错。

S-Space不仅能读,还能改写。修改物体token的坐标后,模型的空间判断随之改变,而颜色等非空间判断基本不受影响,证明该空间是参与判断的内部变量。此外,这张地图是动态工作区,会随提示、视角和上下文变化,甚至能补全画面外的空间,如预判未出现的球的位置或不可见主人的方位。但开放性也带来串线:模型会将“socialist”靠近水平轴左端、“conservative”靠近右端,或将图像右方直接映射为“east”,在参照系重新定义时可能成为错误来源。
关于S-Space的来源,语言预训练是重要基础,但语言信号粗糙且易混入隐喻和参照系歧义。行动监督则提供不同反馈:比较Molmo2-ER与其行动模型MolmoAct2发现,后者S-Space中物体与功能部件的深度关系更贴近真实物理关系,说明行动学习会反向校准内部空间工作区。
S-Space的核心价值在于提供新的系统分工方式:多模态模型负责形成空间表征,外部模块负责可靠计算与行动,中间通过可读写的空间接口连接。这为机器人、AR和自动化Agent提供了排查路径——区分感知错误、坐标错误、旋转错误或参照系混乱,并对应不同修正方案。空间智能的下一步,关键不是让模型更大或回答更长,而是将机制分析变成可用基础设施,把内部地图稳定转化为推理和行动能力。
更多推荐阅读

MiniMax仓促开源H3,狙击Seedance胜算几何
MiniMax H3 的开源,可能比外界看到得更仓促。7月31日,H3与Seedance 2.5同日发布,外界易将其视为一次提前设计的开源狙击,但至少在发布前半个月,MiniMax尚未确定是否开放。据知情人士透露,7月中旬,MiniMax曾通过销售团队询问多家公司H3的API需求,反馈一致:若只卖闭源API,H3难有竞争力。客户所指不仅是效果差距,而是Seedance已构建的牢固闭源体系——其生成...
2026-09-09
办公Agent混战,中国电信TeleAgent实测入场
办公 Agent 下半年开启大乱战模式。这类产品已离开聊天框,进入电脑处理具体工作。日常使用中,用户最关心的是:能否读懂不同格式文件?中途改需求是否记得背景?交付物能否直接打开?数字是否准确?任务消耗多少积分?这些环节正改变办公 Agent 的竞争格局。 APPSO 近期体验了中国电信推出的桌面 Agent——TeleAgent,它基于自研星辰大模型和国产智算底座。运营商下场做个人办公 Agen...
2026-09-09
Agent经验反哺模型,NeoHorse-1让AI不再重复踩坑
Agent完成任务后,学到的经验去了哪里?一个Agent接到项目排期任务,漏读了一封包含最新修改的邮件,沿过时信息规划,生成无效排期,还把文件写错位置。执行链中断后,全是基于错误推理的错误答案。问题在于,下一次怎么办?今天大多数系统中,Agent的经验留在日志里,几乎从不进入模型参数,模型下次遇到相似任务,依旧可能踩同样的坑。 基元律动发布的NeoHorse-1试图改变此事,开源4B与9B两个尺...
2026-09-09
DeepSeek社招大改:删ACM题,资深工程师直呼内行
DeepSeek为150人规模的社会招聘重新设计了面试流程。据负责人崔添翼透露,笔试中ACM类代码题全部删除,改为系统设计题,需实际工程经验才能答好。应届ACM金牌选手可能无从下手,但资深工程师会得心应手。算法设计题不再要求完整可运行代码,只需清晰思路或伪代码。选择题也加入更适合资深工程师的内容,整体面试时间跨度大幅缩短。校招仍沿用原有题目,此次改动仅针对社招资深工程师,社招与校招考核体系彻底分离...
2026-09-09
七万门店实测:盘点机器人能否扛起零售效率大旗
一家正在营业的超市里,一台轮式机器人正沿货架移动,需避开顾客和购物车,核对电子价签与商品价格,调整摄像头查看被遮挡的库存,并用机械臂伸入仅三四十厘米高的货架层,抓取软塌的膨化食品袋并整齐放回。每个动作、识别精度、运行安全和设备成本,都直接影响零售商经营结果。ROI回报,是具身智能进入真实门店绕不开的一步。 汉朔科技与X-Era Lab(拓元智慧)正共同将这些能力带入真实门店。汉朔科技服务全球超5...
2026-09-09
OpenAI 88小时攻克NS方程,弃领百万美元大奖
OpenAI 宣布,其使用一个比 GPT-6 Astra 更强大的未公开下一代模型,联合约 10000 个并发 AI Agent,耗时 88 小时攻克了千禧年难题之一的纳维-斯托克斯方程的存在性与光滑性问题。该问题悬赏 100 万美元,过去 90 年无人解决。OpenAI 同时发布了 166 页的推导论文和 Lean 形式化验证代码,并宣布放弃申领奖金,称此举旨在展示 AGI 正转变为推动前沿科学...
2026-09-09