小米新模型还没发,罗福莉先把架构论文剧透了
MiMo-V2.6刚发布,罗福莉就开始剧透MiMo-V3。MiMo-V3将采用新架构HySparse2,核心针对Agent执行长任务时越来越重的输入处理。
Agent生成一次工具调用可能只需几十个token,但搜索结果、网页、代码和执行日志却能一口气回来几万字。模型读完继续操作,每一轮结果都要进入上下文;轮次增加后,模型既要处理新输入,也要保留足够历史信息供后续检索。团队想让模型少花力气处理输入、少占内存保存历史,同时还能从很长记录里找准线索。

在80B总参数、每个token约激活3B参数的MoE模型配置下,到了100万token上下文,HySparse2的预填充计算量约为Hybrid SWA的1/5.02;KV Cache从12.09GB降至2.69GB,约缩小4.5倍。省下来的不只是资源,在多轮检索测试中,它找历史信息的成绩也更好。
HySparse2调整了模型层间依赖,让预填充可以在中途结束。模型被划分为前后两段,前段是self-decoder,后段是cross-decoder。前半段结合全注意力与滑动窗口注意力,后半段结合全注意力与稀疏注意力。两段之间的KV Bridging只连接全注意力层:后半段全注意力层从前半段对应层的隐藏状态生成K和V,同时保留各自独立的投影参数。后半段内部的KV Reuse则让稀疏层复用同一混合模块中全注意力层的KV Cache和token选择结果。有了这座桥,一批新材料进来时,预填充走完前段就能停下,不必再让整段输入逐层跑完后段。到了模型继续生成内容的时候,后段仍正常参与计算。论文标题所说的两级KV共享,指的就是这两处设计。

上一代设计中,稀疏层另设一条滑动窗口注意力分支,其缓存依赖后半段逐层计算得到的隐藏状态。如果保留它,长输入仍需进入后半段构建缓存,预填充就无法完全提前退出。所以HySparse2拿掉了这条独立分支,改为强制将最近的token纳入稀疏选择。局部信息仍被保留,但与远处选出的token使用同一套共享KV Cache。于是,后半段需要的缓存都可以从前半段的状态构建,长输入的预填充走完self-decoder即可结束;模型随后生成token时,cross-decoder仍正常参与计算。论文展示的模型共有49层,采用预填充与生成分开部署的方案时,预填充节点只需放前25层和相关投影模块,所需模型内存接近减半;在这套配置里,预填充阶段执行全注意力的也只有一层。
减少输入计算之后,长历史中的信息能否被准确找回,取决于稀疏层如何选择内容。上一代HySparse按“块”挑内容,一个64-token的块里即使只有少量内容相关,整块也会占用选择预算。论文指出这种方式在早期预训练评估中没有表现出明显劣势,但面对跨越多轮工具调用的Agent任务,检索精度不足的问题变得突出。所以HySparse2把选择粒度改到了单个token。论文中的配置是挑选1024个全局token,再强制保留最近128个token。这样既能去较早的历史里找分散的线索,也不会漏掉眼前刚收到的工具结果。后续稀疏层继续复用这些选中位置及其缓存。

消融实验里,在保持骨干结构和注意力预算一致,仅比较按块选与按token选的情况下,在32k及以下的长上下文测试中,按token选择让RULER-v2提高6.57个百分点,双线索MRCR-v2提高8.14个百分点,GraphWalks提高5.55个百分点。
HySparse2也没有完全撤掉全注意力。团队认为,少量全注意力层既有助于维持模型能力,也能用完整的注意力分数,帮后面的稀疏层选出值得看的token,就无须再单独训练一个检索模块。
小米团队用相同的数据和训练安排,对比了HySparse2、HySparse以及Hybrid SWA三种注意力设计。预训练后的普通知识、推理和代码项目中,HySparse2的成绩有升有降,整体与对照模型大致可比;优势主要出现在长上下文能力上。加入Agent数据、再经过后续训练后,差距变得更明显。HySparse2在论文评估的各个上下文长度上,MRCR-v2和RULER-v2检索成绩均领先两个对照架构,Agent轨迹与长距离依赖相关的困惑度也更低。到了256k上下文,HySparse2在RULER-v2拿到58.45,上一代HySparse是32.61,Hybrid SWA是35.74。按测试长度取平均,它的MRCR-v2和RULER-v2成绩比HySparse分别高11.30和19.81个百分点。
成本上,在100万token处,论文分析得出的预填充计算量,HySparse2比HySparse降低约2.92倍,比Hybrid SWA降低约5.02倍。采用FP8缓存时,三者的KV Cache占用分别为2.69GB、6.72GB和12.09GB。但5.02倍比较的是预填充计算量,不是实际响应速度;论文的长上下文能力测试评估到256k,100万token对应的是计算量与缓存分析。
MiMo-V3尚未发布,实际产品里的延迟与任务表现,还要等模型落地后再看。不过,HySparse2的取向已经很清楚——Agent执行任务时,工具会不断送回大量新内容,历史里的关键线索又不能丢。MiMo-V3能把论文里的改进带进多少实际任务,将是接下来更值得关注
更多推荐阅读

百度悄悄上线OkWork,瞄准碎片化AI办公
随着阿里、字节分别推出千问办公和豆包工作,百度在AI办公赛道再有新动作。百度悄悄上线主打随身办公的AI工具“OkWork”,集PPT生成、AI写作、表格数据分析、海报生图于一体。这是百度近期继库库AI后,在AI办公场景的又一次落子。 OkWork界面走简约轻量化路线,首页核心能力分四大模块:AI PPT、AI写作、AI表格、AI生图。功能拆解较细,并非笼统一句话生成。AI PPT支持文档转PPT...
2026-09-24
中国物理AI黑马3个月登顶全球第一
AI圈迎来全新黑马。在权威公开评测榜单RoboDojo中,成立仅几个月的初创公司Simate拿下全球第一,并已完成数亿元人民币连续多轮融资,VC、互联网大厂、产业资本纷纷入局。 Simate创始人张颖曾是某头部自动驾驶公司核心技术负责人之一、最年轻的对标阿里P10技术大牛,参与打造国内最接近Tesla FSD的智驾系统。如今他带着“产业×学术”双料团队转身杀入Physical AI,仅3个月便登...
2026-09-24
华为大模型双子星创业,两月融资数亿估值5亿美元
Physical AI公司息壤开物近日连续完成数亿元种子轮及天使轮融资,估值达5亿美元。本轮由敦鸿资产领投,华控基金、三花控股、银杏谷资本、泽然资本、本坚基金、天使基石、标朴投资等跟投。资金将用于原生物理AI模型规模预训练、真实物理交互数据建设、核心人才引入及场景验证。 息壤开物由两位华为大模型体系核心人物创办。创始人、CEO李寅曾任华为云大模型CTO,是华为大模型从0到1核心成员,长期负责产业...
2026-09-24
Agent替你花钱,你敢把钱包交给AI吗?
Agent的爆发不止于应用层,底层的交易和支付方式也在被重写。今年AI交易沿两条线展开:一是Agent帮人完成任务,如6月上线的AI版支付宝,一句话就能打车、点咖啡;二是Agent-to-Agent,如两个月前Mastercard发布专为机器间支付设计的网络服务。 本期节目来自2026 Inclusion·外滩大会主论坛圆桌“当Agent成为交易主体”。硅谷101创始人泓君与蚂蚁集团CEO韩歆毅...
2026-09-24
两周迭代千元起,这家公司要让后训练人人可用
最近几个月,后训练成为 AI 行业最集中的议题。基础模型公司在扩大 RL 规模,应用公司也在考虑如何基于真实业务的任务轨迹和用户反馈构建后训练流程。模型在真实环境中产生的经验,正在成为下一代智能的原料。 一个反常现象是:全球最活跃的开源模型来自中国,但围绕这些模型的第三方后训练平台却在海外发展更快。Thinking Machines Lab 的 Tinker、Fireworks、Together...
2026-09-24
4亿副耳机等待AI改造,供应链老炮交底
这些「老炮们」最不缺的就是把硬件造出来的能力,也不缺求变求新的劲儿。可AI硬件新课的内容,显然超纲了。 四家供应链「老炮」交了个底 深圳市烽火宏声科技有限公司副总经理王鑫透露,公司AI耳机样机正在做设计验证,主打会议转写、AI翻译等,目标今年底前量产出货,已有两个品牌客户下单。 消费电子方案商奇智创新的AI耳机样机也已摆上桌面,电脑播放英文TED演讲,点击耳机即可实现实时中文翻译。拥有全模块...
2026-09-24