小米开源新模型刷新纪录,罗福莉称难度超DeepSeek R1

小米开源新模型刷新纪录,罗福莉称难度超DeepSeek R1

AI 资讯 来源:新闻/公众号 发布时间:2026-09-22 更新于 2026-09-22 预计阅读 6 分钟

小米正式发布并开源 MiMo-V2.6 系列模型,包含两款原生全模态模型:MiMo-V2.6-Pro 面向复杂编程、Agent 和专业任务,MiMo-V2.6-Flash 强调性能、效率与成本的平衡。同步推出 MiMo-V2.6-Pro-UltraSpeed,官方称在保持模型质量前提下,输出速度最高可达 Pro 版本的 20 倍。

刚刚,小米刷新 AI 大模型斩杀线,罗福莉:技术难度超过 DeepSeek R1

官方数据显示,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index v4.3 中获 46.32 分,超过 Kimi K3 和 Qwen3.8 Max,小米称其为该榜单得分最高的开源模型,并沿用 V2.5 的 API 价格。具体基准测试中,Pro 在 DeepSWE v1.1 获 71.9 分,接近 DeepSeek V4.1 Flash 的 74.2、Claude Opus 5 与 GPT 6 Astra 的 74.0;Toolathlon-verified 获 76.9 分,高于 GPT 5.6 Sol 的 74.9;Automation Bench v1.0.6 获 53.1 分,略低于 DeepSeek V4.1 Flash 的 54.8,高于 GPT 6 Astra 的 52.0;JobBench 获 62.0 分,仅次于 Claude Opus 5 的 65.7。在自建 MiMo Visual Coding 评测中,Pro 和 Flash 分别获 72.3 和 71.5 分,高于 DeepSeek V4.1 Flash 和 Claude Opus 5,但低于 GPT 6 Astra 的 82.2 分。Pro 在 Terminal Bench 4.0 获 34.9 分,与 GPT 6 Astra 的 59.6、Claude Fable 5.1 的 55.1 仍有明显差距,多项网络安全评测也落后于头部闭源模型。

刚刚,小米刷新 AI 大模型斩杀线,罗福莉:技术难度超过 DeepSeek R1

训练方面,MiMo-V2.6-Flash 和 Pro 分别完成 30 个强化学习 step,各产生约 75 万条训练轨迹,成本分别约 85 万美元和 262 万美元,合计约 347 万美元。两个模型平均任务通过率相对提升约 25% 和 12%;在未参与训练的 DeepSWE v1.1 上,Flash 从 48.8 分提高到 65.68 分,Pro 从 58.4 分提高到 72.57 分。每个 step 包含 1568 个 prompt,每个 prompt 生成 16 条候选轨迹,相当于一次处理约 2.5 万条长序列和 27 亿至 37 亿训练 token,最长上下文达 100 万 token。任务覆盖编程、通用 Agent、视觉和网络安全。小米通过固定 MoE 路由器、奖励设计、对抗评测、异常检测和多验证器交叉核验提高稳定性。

刚刚,小米刷新 AI 大模型斩杀线,罗福莉:技术难度超过 DeepSeek R1

罗福莉称 MiMo-V2.6 为“扩展 RL 的艰难之路”,认为按算力投入衡量,这很可能是开源模型团队迄今规模最大的单次强化学习训练之一,其研究创新和工程难度甚至超过她曾部分参与的 DeepSeek R1。她解释 MixRL 与 MOPD 分工:代码等可可靠验证的 Agent 任务进入 MixRL;游戏、3D、超长链路和主观评价任务分别训练,再通过 MOPD 合并回主模型。

小米还开放了训练曲线、奖励机制、任务配比、关键参数和成本构成,并发布由 Qwen3.5-9B 蒸馏而来的 MiMo-V2.6-Distill-Qwen-9B,以及约 7000 个 RL 任务环境、验证器、端到端 RL 训练框架和 mini-harness。

MiMo-V2.6 还从自然语言编程延伸到可交互数字世界,小米称之为 Vibe World。模型可依据文字、图片或视频拆分任务,协调多个 Agent 搭建 3D 场景、编写交互逻辑,并通过渲染结果反复修改;可操作 Blender 制作资产,控制 Franka Panda 机械臂完成抓取等任务;还能生成网页或幻灯片、调用 Figma 及图片视频工具、完成镜头组织与配乐。科研方面,Pro 在材料专家指导下完成 PFAS 吸附材料检索、假设、模拟与候选筛选,并协助用 Lean 4 完成《周期三蕴含混沌》主要定理形式化,项目超 6000 行代码并通过内核验证。

MiMo-V2.6-Pro 和 Flash 已登陆小米 AI Studio、MiMo Code、MiMo Desktop、MiMo API 平台及 OpenRouter,MiMo Desktop 结束早期测试迎来首个正式版本。价格方面,Flash 缓存命中输入、普通输入和输出分别为每百万 token 0.02 元、1 元和 2 元;Pro 为 0.025 元、3 元和 6 元;Pro-UltraSpeed 为 0.25 元、30 元和 60 元,相当于用普通 Pro 十倍调用成本换取最高 20 倍输出速度。同等智能水平下,MiMo-V2.6 系列价格仅为海外模型的 1/20 至 1/60。

标签: AI 资讯 AI

更多推荐阅读

世界模型是上不了桌的另开一桌

世界模型是上不了桌的另开一桌

到2026年9月,基本可以宣布世界模型是个垃圾概念。它起源于一群没上大模型桌的人,做不明白已沦为重工业竞争的大语言模型,于是生造出这条赛道。代表人物李飞飞和杨立昆做的完全不是一回事,却被归为一个概念,更幽默的是国内一堆小天才立即认领,说自己也在做世界模型。问他们什么是世界模型,能从原生家庭讲到技术架构再讲到师承关系。一句话:小天才,世界模型,打钱。 实际情况是:后训练开源视频模型,没卡没数据没人...

2026-09-22
全球唯一穿颅读脑突破,这家中国公司要做脑科学英伟达

全球唯一穿颅读脑突破,这家中国公司要做脑科学英伟达

2026年9月,马斯克Neuralink临床试验接受27例受试者,并计划开启大规模量产,舆论再次沸腾。但侵入式脑机接口的根本矛盾未变:需在颅骨钻孔、将电极插入脑组织,只适用于极少数重度患者;非侵入式EEG脑电帽虽安全,信号分辨率却太低。两条路线,一条太危险,一条太模糊。 深圳公司鲲为试图解答这一命题。成立七年,创始人刘家家此前十余年从事声学空间智能基础研究,2024年将该理论应用于颅脑超声方向,...

2026-09-22
OpenAI研究员:物理隔离挡不住失控AI

OpenAI研究员:物理隔离挡不住失控AI

物理隔离,有可能阻止失控AI吗?OpenAI核心研究员Noam Brown给出的答案是:不能。即使拔掉网线、将服务器锁进物理隔绝的暗室,足够聪明的AI也有可能逃脱。9月17日,在长达一小时的播客对话中,Brown披露了这一判断,引发硅谷量化基金、安全学者及AI核心圈的震荡。 他勾勒出一个失控的未来:物理隔离已被击穿,AI可通过CPU散发的热量与外部设备通信;“思想”正在下潜,模型已察觉被人类监控...

2026-09-22
Meta AI助手爆火13天,Amazon为何突然封杀?

Meta AI助手爆火13天,Amazon为何突然封杀?

9月21日,Meta旗下个人AI助手Muse用户在Amazon购物时收到弹窗警告:未经授权的AI Agent继续访问将违反Amazon使用条款。此时距Muse上线仅13天。 Meta于9月8日发布Muse,定位为“全球第一款为所有人打造的个人AI Agent”。与聊天机器人不同,Muse能打开浏览器、登录邮箱、填表、订票甚至直接下单。Sensor Tower数据显示,Muse上线13天下载超25...

2026-09-22
Grok 4.7发布即全球第三,马斯克:4.8也训完了

Grok 4.7发布即全球第三,马斯克:4.8也训完了

SpaceXAI正式发布全新主力模型Grok 4.7,主打同价同速下性能大幅提升。马斯克称其将SpaceXAI送上智能体编程第三把交椅,仅次于Anthropic和OpenAI。官方定位为“史上最强Grok,专为编程和知识工作而生”。 Grok 4.7输入每百万Token 2美元、输出6美元,与Grok 4.6一致,但底层模型彻底换血:基座更大、强化学习训练拉长,任务难度加权向“需数小时完成的工作...

2026-09-22
OpenAI内部AI竟开始自己训练自己

OpenAI内部AI竟开始自己训练自己

据The Information爆料,OpenAI内部AI模型已开始“自己训练自己”:该内部模型接管了实验性AI模型训练全流程,研究员只需给出优化示例,AI就能自行运行数周,多智能体自发协作、讨论并迭代代码,无需人类插手。原本需数年完成的实验被压缩至一周。OpenAI内部模型已能自行编写GPU内核程序及优化方案,这种自动化水平直到最近几个月才成为可能。 OpenAI随即发布全球安全倡议,罕见单列...

2026-09-22
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部