小米开源大模型登顶全球第一,罗福莉长文揭秘RL立功

小米开源大模型登顶全球第一,罗福莉长文揭秘RL立功

AI 资讯 来源:新闻/公众号 发布时间:2026-09-23 更新于 2026-09-23 预计阅读 5 分钟

9月21日,小米MiMo团队发布并全面开源新一代MiMo V2.6系列,包括Pro、Flash、Ultraspeed三款模型。其中MiMo V2.6 Pro在Artificial Analysis智能指数(AA Intelligence Index v4.3)中得分46,超过Kimi K3和Qwen3.8 Max,位列全球开源模型第一、国产模型第一。该榜单上,Fable 5.1得分53,GPT-6 Astra得分52.8,Opus 5得分50.7,MiMo V2.6 Pro已进入全球顶尖第一梯队。价格维持V2.5不变,智能翻倍,形成新的“智能-成本”帕累托前沿。

罗福莉带小米登顶全球开源榜首!大规模RL立功,斩杀Grok 4.7

小米大模型负责人罗福莉在X发布长文《The Hard Road to Scaling Up RL》,称MiMo V2.6可能是开源世界迄今最大规模单次RL训练,研究创新和工程挑战甚至超过DeepSeek R1。同日SpaceX的Grok 4.7发布,AI博主Chubby先夸Grok 4.7后改口称“比Grok 4.7更强,价格便宜得多,中国回来了”。AA指数上两者同为46分,但MiMo V2.6 Pro单任务成本0.13美元,Grok 4.7为3.74美元,差距近30倍。

罗福莉带小米登顶全球开源榜首!大规模RL立功,斩杀Grok 4.7

三款模型定位明确:Pro为旗舰,全模态、超高性能,覆盖复杂项目、长程任务、网络安全和科研,是开源世界唯一同时做到全模态和旗舰性能的模型,多数Agent Benchmark上比肩Opus 5和GPT-5.6 Sol。Design Arena排名中,Chat综合场景开源第3、总榜第8,超过Claude Opus 5;Website类别开源第2、总榜第4;Web Apps前端开发开源第2、总榜第6,超过Kimi K3、Fable 5、Opus 5和GPT-5.6 Sol。Flash主打效率,全模态、高智能、低成本,全面超越上一代旗舰V2.5 Pro。Ultraspeed保留Pro旗舰性能,不做量化,提供最高10倍推理速度,常态500 TPS,峰值1000 TPS,3倍价格换10倍速度。

罗福莉带小米登顶全球开源榜首!大规模RL立功,斩杀Grok 4.7

实战方面,MiMo V2.6可生成可交互3D开放世界、复杂3D场景建模、多模态输入生成Office文档。小米前沿材料团队用Pro设计捕获PFAS的新型MOF材料,实现端到端科研闭环,模型设计的A50和B50结构吸附性能达参照材料百万到千万倍,人类专家效率提升约10倍,研发周期从一个月压缩到2—3天。北京大学窦锦虎教授评价其研究能力已达训练有素的博士研究人员水平。V2.6单轮交付速度极快,复杂多步任务中同等时间可完成更多迭代。

技术层面,预训练基座和参数未变,智能跃升源于后训练革命。小米定位其为探索RSI路径的关键一步,以可验证复杂任务为基础,规模化扩展RL算力。罗福莉9月17日推文阅读量达三百万,团队将RL训练过程全程直播,不到6天Flash和Pro各跑完30步,累计约75万条轨迹,训练成本分别约85万和262万美元,数据实时公开。Nathan Lambert评价其为“迄今公开的最酷大规模RL资源之一”。训练任务平均通过率分别相对提升25%和12%;样本外长程软件工程基准DeepSWE v1.1上,Flash从48.8涨至65.68,Pro从58.4涨至72.57。核心技术为MixRL混合任务强化学习,罗福莉概括为“You Only RL Once”,一次大规模混合任务RL即可让模型各方向同时涌现能力。后训练沿三个轴扩展,形成“环境×任务×评分器”三轴协同自我改进系统。第一轴Rollout计算:每步使用1568个Prompt,每个Prompt进行16次Rollout,单步训练Token达27亿至37亿,支持1M上下文长度训练。

标签: AI 资讯 AI

更多推荐阅读

千问办公发布企业上下文,让Agent真正读懂公司

千问办公发布企业上下文,让Agent真正读懂公司

在大模型忙于刷 Benchmark 时,不能说话的 Jev 意外成为 AI 圈新顶流,反映出大模型应用价值正从“生成什么”延伸到“能否理解复杂信息并做出可靠判断”。在企业办公场景中,员工一句“帮我整理报价”背后可能牵涉客户历史、库存、折扣、审批权限和部门协作。AI 若只会生成文档而不了解业务背景,很难真正进入工作流。企业需要的是能理解业务上下文、知道与谁协作、清楚权限边界的 AI。 千问办公在杭...

2026-09-23
华为灵衢重构算力架构,破解Agentic AI互联瓶颈

华为灵衢重构算力架构,破解Agentic AI互联瓶颈

当AI从“生成内容”迈向“自主执行任务”,一场计算架构的深层演进正在发生。Gartner研究显示,到2026年底,40%的企业应用将集成任务特定的AI Agent,超过60%的组织计划在未来两年内落地。 需求爆发正将算力基础设施推向极限。华为常务董事、ICT BG CEO杨超斌在华为全联接大会2026期间指出,Agentic AI时代,集群内不同部件之间的互联与通信能力已成为影响计算系统性能的关...

2026-09-23
Jev与Decitron:决策AI路线之争

Jev与Decitron:决策AI路线之争

最近,一个叫Jev的新模型突然火了。它来自TypeSafe AI,这支有OpenAI背景的团队没有继续卷生成和推理,而是换了个方向:让AI直接做判断。口号是:Decisions, not strings(要决策,不要文本)。Jev的走红,也让“Decision”重新成为AI圈热门词。 但这条趋势并非今天才出现。今年6月,中科闻歌发布了通用决策大模型Decitron决策机,尝试将世界模型、多智能体...

2026-09-23
AI创业风向变了:硬件数据赚钱,应用团队开始自训模型

AI创业风向变了:硬件数据赚钱,应用团队开始自训模型

今年,AI 创业的走向比过去更难判断。模型公司不断向应用层下探,To C 产品刚找到的功能可能下一次模型更新就被覆盖;机器人、世界模型等概念迅速升温,越来越多创业公司进入物理世界。当模型本身成为最大变量,什么值得做、什么更容易赚钱、什么样的人更适合创业,都需要重新思考。 YC 在最新播客中拿出过去 12 到 18 个月的批次数据,讨论创业生态变化。几组数字尤其醒目:硬科技公司更多了,从机器人、半...

2026-09-23
AI数据公司Snorkel AI获3.5亿美元融资,估值达35亿美元

AI数据公司Snorkel AI获3.5亿美元融资,估值达35亿美元

Snorkel AI是一家帮助人工智能实验室和企业构建训练数据集及模拟环境的初创公司,近日完成3.5亿美元E轮融资,估值达35亿美元。本轮融资由Insight Partners和S32领投,现有投资者Addition、Lightspeed、Greylock、GV和Wells Fargo也参与其中。这家成立七年的公司估值几乎是17个月前D轮融资时13亿美元估值的三倍,当时融资1亿美元。 Snork...

2026-09-23
豆包日活破2亿后收缩对话团队,规模减半

豆包日活破2亿后收缩对话团队,规模减半

《晚点 LatePost》独家获悉,豆包通用 Session 团队正在减员,规模预计缩减约一半。该团队此前约 50 人,曾是豆包内规模最大的团队,主要负责对话产品的策略、评测等工作。调整后部分人员转岗至豆包商业化、飞书等团队,其余被裁撤。此次调整由豆包负责人赵祺推动。赵祺加入字节十余年,曾负责增长中台、穿山甲,后转岗集团人力资源部门为 AI 业务搭建人才体系,2025 年 9 月转岗至豆包。今年 ...

2026-09-23
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部