横扫四大榜单,DM0.5凭什么面面俱到?
一个模型同时占据四个能力子榜单的榜首,这在具身智能行业里不多见。

RoboColiseum 由智元机器人发起,联合高校、科研机构、开源社区及机器人企业共同建设,把评测拆成四个维度:指令跟随、空间理解、扰动适应、通用操作。参评者只要在任何一个维度上有结构性短板,就会在对应子榜上掉下来。而原力灵机的通用具身基础模型 DM0.5 在四个子榜上全部排名第一,且目前是唯一做到这一点的模型。

具身评测行业长期存在几个痛点。一是仿真跑分高、真机落地差。RoboColiseum 通过空间智能技术在仿真环境中高保真重建真实世界,逐项校准物理参数,验证结果显示仿真与真机模型表现一致性达 89.5%,单个任务成功率差异均小于 10%。二是评测基准生命周期短,头部模型很快把分数堆满。RoboColiseum 现有 78 个评测任务、超过 3000 个泛化 case,训练集和评测集完全隔离。三是单点能力强不代表真实场景好用,真实任务几乎没有单科题。RoboColiseum 的四个维度分别对应指令、空间、扰动、操作,构成相对完整的考察链条。

在四大子榜单上,DM0.5 以指令跟随 0.8444、空间理解 0.6146、扰动适应 0.7344、通用操作 0.6370 的成绩全部排名第一。四榜同时第一比单项第一难得多,因为四个维度考的是不同层次能力,彼此并不互相加持,任何短板都会直接体现在排名上。
DM0.5 在每个维度上都有具体技术支撑。指令跟随方面,预训练阶段设计具身思维链,11 项推理任务覆盖任务规划和动作生成,展现出 zero-shot 级别泛化。空间理解方面,预训练数据包含 10 万小时 Egocentric 视频,支持毫米级精度 3D 空间标注生成;原力灵机与天津大学、清华大学合作的 GeoVLA 论文入选 IROS 2026 认知机器人最佳论文奖提名。扰动适应方面,模型核心延迟从 534 毫秒压到 57.49 毫秒,加速 9.29 倍,成功率几乎无损;同时具备原生 60 秒记忆,任务中断后可续接。通用操作方面,物流分拣场景平均 3 秒一件,准确率超 99%;亚毫米积木拼装每 12 秒完成一次,可自主纠错;灵巧手场景配合后训练控制 58 个自由度完成厨房任务。
DM0.5 在 RoboColiseum 上并未针对评测任务做专项优化,只是通过常规监督微调将底座能力迁移到评测任务上,这让成绩更接近对底座模型真实能力的测量。
原力灵机并非第一次取得这样的成绩。上个月 DM0.5 登顶 RoboDojo,记忆维度取得 47.74 分和 47.44% 成功率,第二名仅 13.37 分和 12.11%。在其他评测中,LIBERO 综合成功率 99.0%;RoboTwin 2.0 简单和复杂场景成功率分别为 93.6% 和 93.3%;VLA-Arena 三档难度依次为 89.0%、53.6%、44.1%;R2R 和 RxR 的 Val-Unseen 成功率分别为 59.7% 和 65.5%;真机评测 RoboChallenge Table30 V2 中,面对四种异构机型、30 个复杂任务,以 43.0% 整体成功率、54.42 综合得分位列第一。此外,Physical Intelligence 两次关键输出中都将原力灵机的 MemoryVLA 纳入学术参照系。
更多推荐阅读

金融AI公司讯兔科技完成超3亿B轮融资,一年连融三轮
近日,中国金融AI领跑者讯兔科技正式完成超3亿元人民币B轮融资,过去一年内已连续完成三轮融资。本轮投资方覆盖险资、券商、公募、产业资本与头部投资机构,包括保险业国家级投资平台中保投资、广发信德,以及启明创投、琥珀资本、嘉程资本、信宸资本、钟鼎资本等新老股东,华兴资本继续担任独家财务顾问。融资后,公司将继续加大模型与产品技术投入,拓展多元资产客群,深化产业上下游协同,并稳步推进海外布局。 中保投资...
2026-09-15
北大团队重新定义端侧AI,元空智能跑进惠普预装
静态互联网数据的增长红利已经见顶,下一轮模型能力的跃迁将越来越依赖与真实环境持续交互的“端侧”。从北大走出的元空智能(元空AI)给出这一判断,并重新定义端侧AI:生产力=元空端侧AI=模型×Agent×设备。端侧AI由此从“把模型搬下来”的单向链路,变成能自己转起来的飞轮。 三年前,元空AI靠国内最早一批AI Excel产品ChatExcel出圈,积累上百万用户。三年后,它从云端应用杀到本地端侧...
2026-09-15
仿真数据降本90%,虚时科技冲刺具身智能最后一公里
2026年上半年,具身智能赛道融资超460亿元,人形机器人单价迈入“万元以内”。但行业面临真机数据太贵、太慢的瓶颈。近期测试显示,利用规模为真机数据5倍的仿真数据训练,可将机器人真实操作成功率提升40%,成本仅为真机数据的三分之一。业界共识日益清晰:要走向物理AI的GPT时刻,数据需求将超出大模型两到三个数量级,仿真成为通向拐点的关键路径。 国内初创公司虚时科技在底层技术上取得突破,将单个仿真场...
2026-09-15
半年6亿人追AI短剧,红果热播榜前99占77席
3人核心团队,10万注册资金,半年连出十二季,保守估计利润600万,乐观2000万——AI短剧《万妖图录传》的爆发,正是行业缩影。年初红果APP才设AI剧独立入口,如今热播榜前99名中AI短剧独占77席,必看榜、热搜榜、收藏榜也全被“血洗”。爆款门槛水涨船高:去年播放量破亿可进年度TOP20,如今首日热度破亿的爆剧接二连三。出海同样凶猛,中国出品的AI短剧已占海外七成以上市场,圈内流传“3000块...
2026-09-15
7名博士生3个月从零训出7B大模型,代码数据全公开
北京中关村学院7名博士生用一个暑假从零训练出7B大模型ZGCM-1,并开放各阶段训练数据、配方、模型权重、训练代码、中间checkpoint和日志,供研究者追溯复现。在多项通用评测中,ZGCM-1与Qwen3-8B等同规模模型表现相近,部分数学推理和搜索评测中可与Qwen3-235B-A22B、GLM-5.1等更大模型比较。 七人背景分别为人工智能、网络、化学、生物和网安。他们因兴趣凑到一起,平...
2026-09-15
英伟达等巨头为何限制Claude使用
最强的 AI 模型正遭遇一批最有钱的大客户设限。原因不是模型能力不够,而是模型越强,企业准备交给它处理的数据越敏感。 9 月 14 日,据 The Information 报道,英伟达、Palantir 和 Booz Allen Hamilton 等公司正在限制部分 Anthropic 模型的使用,或要求 AI 公司提供更严格的数据保护承诺。报道涉及 Anthropic 和 OpenAI,具体限...
2026-09-15