端侧推理引擎开源,机器人跑大模型提速10.7倍
9月第二周,具身智能领域密集发布模型。8日松延动力发布HERON-World Model;9日智元推出AGILE 2.0与GE-Act 2.0;10日宇树开源UnifoLM-WLA-1.0,6B参数,约2500小时真机数据,一个模型统筹64项任务;15日松延再发HERON-CRA。八天内三家本体厂商共发布五个模型。

与此同时,机器人加速进入物理世界。9月20日启元机器人举办新品发布会,两款个人机器人正式发售,Q1定价19999元起;9月10日优必选宣布获超5000万元海外订单,涉及Walker C1、优世界U1等产品。资本市场评价标准亦发生变化,开始用脱水复购率、经营性净现金流及真实履约成本(交付后的部署、调试与维护投入)重新审视具身企业。

两条线索交汇,核心痛点浮现:如何将复杂强大的具身大模型高效、稳定地部署到算力极其有限的机器人本体硬件上?这正是端侧推理引擎的核心价值。

9月15日,清华大学联合无问芯穹与上海交通大学开源APXInf,一款面向具身模型的端侧推理引擎,同时回答两个问题:在算力、内存和功耗受限的端侧环境中,如何让具身模型在机器人本体上达到可用推理速度?当模型不断迭代进化,如何构建持续适配、永不掉队的端侧优化能力?
第一个问题,APXInf给出的答案是一组数字:无需改变π0.5模型本身,通过端到端全栈优化,在Thor芯片FP8配置下将推理延迟从278ms降至26ms,端到端提速约10.7倍,38.46Hz的频率让机器人控制进入实时区间。
第二个问题的答案写在APXInf仓库的构建方式中。它把原本依赖少数专家的模型适配、优化与验证,沉淀成一套可被持续复用并可被Agent使用的工作流。
更多推荐阅读

Manus 2.0发布:AI应用只剩三件事
昨夜,Manus发布2.0版本,堪称超级全家桶。技术层面推出新agent架构Cascade、云电脑和自动化;面向工作创作场景的Manus Studio支持剪视频、生视频、做在线多人游戏、远程遥控电脑;以及One More Thing:Cue。 我第一时间上手试了Cue。先连接Gmail、GitHub、Notion、Instagram、Oura等账号,补充Codex记忆备份和几条即刻,构成较完整的...
2026-09-30
GPT-6上线后,鹈鹕骑车测试为何突然爆火
开源项目CodexRadar发起人Lambda在GPT-6 Astra发布后,收到大量“鹈鹕骑单车”视频,于是在社区发起“鹈鹕杯”比赛,参赛者围绕“画一只骑自行车的鹈鹕”用模型生成作品。9月14日上午,比赛页面PV达7000多。 每次新模型上线,都有人用鹈鹕骑自行车测试模型能力。这个任务简单直观,能一眼看出腿和踏板是否对位、车轮是否跟着动、动作是否穿帮、前后是否一致;同时又足够复杂,涉及动作理解...
2026-09-30
Opus 5.5代码直出MV,马斯克连转惊呼AGI
Opus 5.5代码直出音乐MV火了。马斯克多次转发,并给出“嚯!”“史诗级!”“这次我真切感受到了AGI”等评价。 这些MV中,人物、歌词、拼贴、颗粒和转场贴着节拍轮番轰炸。两分钟速通《谷歌来时路》,动画越切越快,配乐越顶越燃。另一支纪念乔布斯的MV,从车库创业拍到改变个人计算,23种转场踩着120 BPM配乐,被剪成一部硅谷英雄片。还有博主把2011年录的木吉他老歌用Suno重编成Techn...
2026-09-30
反超Seedance 2.0!RunningHub增强版H3一秒仅一毛
7月底MiniMax H3开源时,Artificial Analysis视频编辑榜Elo 1130分,直冲全球第一。但量产场景下短板明显:多镜头一长角色走样,商品多拍几组轮廓不准,十几个镜头连跑后面越来越不像同一部片子。从“跑得通”到“生产能用”,差的是工程。 9月29日,RunningHub发布H3 RH Enhanced,基于MiniMax H3开源基座做深度后训练的增强模型。Running...
2026-09-30
AI写算子让Kimi K3推理快3倍,TPU反超英伟达
上一周,vLLM原班人马创办的Inferact开源了TPU Megakernels,把Kimi K3的92个MoE层写进同一个程序,在16颗谷歌TPU v7上运行:开启投机解码,单用户输出达709 tokens/s;同样16块英伟达GB200用vLLM跑为452 tokens/s。关闭投机解码,在1到8并发下,它也是GB200的1.4到2倍。而TPU v7显存带宽7380GB/s,还低于GB200...
2026-09-30
10个Claude通宵15小时,证明122年物理数学难题
球面上的7个电子,难住了人类数百年。今天,10个Claude Sonnet 5.5通宵15小时,互发1270条消息,写出17895行Lean代码,完成了汤姆逊问题N=7的证明。没有人类介入,没有预设分工,10个Claude自己建群、讨论、选算法、合并代码。证明通过了Lean内核和独立内核nanoda的双重验证,改一个整数,nanoda立刻报错。 1904年,J.J.汤姆逊提出“葡萄干布丁”原子模...
2026-09-30