小米直播烧钱训练大模型:1小时3万美元
小米新模型强化学习训练开启现场直播,训练成本实时公开:从Pro模型开始训练算起36小时,两款模型已花费超过108万美元,平均每小时3万美元。页面上训练花费、步数、奖励曲线、显卡故障等信息全部公开可查。这种开放训练过程的做法引发围观。

目前MiMo-V2.6的Flash和Pro两款模型训练仍在初期,但已显现能力提升:Pro的dynsam/avg@n从第1步约0.565提升至0.614,Flash从约0.514提升至0.603;最新DeepSWE v1.1离线评测中,Pro和Flash分别达到62.24和60.77,对比DeepSeek-Flash v1.1为74.2%。Flash从更低起点快速追近,Pro保持小幅领先,但Pro训练完一个Step更慢,最新评分尚未出炉。

自4月开源MiMo-v2.5后,小米沉默近半年。负责人罗福莉解释,这期间只研究一件事:强化学习能扩展到多远。小米给出答案:沿三个维度扩展——训练计算量、环境/执行框架、评分计算量。

计算量方面,MiMo-V2.6系列每个训练Step约处理20亿Token,配置为1568个Prompt×每个Prompt 16条Rollout,一轮可能产生超2.5万条Rollout。Agent任务一条Rollout可能经历几十轮思考、工具调用和环境反馈,最终一个Step的Token数可达数十亿级别。系统采用Fully Async完全异步执行,生成、执行、评分和训练不再严格排队,而是组成持续运转的异步流水线。
环境方面,MiMo-V2.6做Multi-task Agentic RL,代码、通用任务、视觉、Chat等不同类型任务可混合到同一次RL Run中训练,并可运行在不同Harness里。直播页面专门展示Batch Composition,告诉外界每个训练Step中模型正从什么任务和环境获取经验。
评分方面,复杂Agent任务的奖励不易获得。代码任务可运行Test Case形成客观反馈,但更开放的Agent任务仅判断最终成败远远不够。关键问题是Credit Assignment:假设Agent连续执行40步最终成功,若只告诉模型“成功,Reward=1”,模型并不知道哪些动作真正帮助成功、哪些步骤毫无必要、哪次修改扭转任务。MiMo特别提到Agentic In-group Credit Assignment,结合同一Prompt生成16条Rollout的方式,利用同组多条Agent轨迹及结果,获得比最终成败更细致的强化学习信号。
三个Scaling方向构成完整体系:扩展计算量让模型产生更多经验;扩展环境和Harness让模型获得更多样经验;更多评分计算量负责从海量经验中提取更准确的学习信号。能否把模型与环境交互、产生经验、评价经验再到学习经验的整个RL循环,也变成一台可持续扩大规模的机器?围观大佬给出更直接翻译:三件事,背后都是算力。
更多推荐阅读

Claude大统一:聊天Cowork合并,新增文档幻灯片
Anthropic 宣布将 Claude Chat 与主打复杂任务处理的 Cowork 合并为统一版本的 Claude,同时推出 Claude Docs 和 Claude Slides 两项新功能,并将 Claude Design 能力整合进聊天界面。Claude 正从对话窗口变为覆盖写作、办公、设计和复杂任务执行的 AI 工作空间。 过去一年,Anthropic 持续扩展 Claude 能力:...
2026-09-17
飞书豆包合体,Agent最强工作平台来了
今年2月,Anthropic的Claude Cowork插件发布四天后,美国软件股单日蒸发2850亿美元,「SaaSpocalypse」刷屏,市场一度认为Agent将取代协同平台。但仅半年后剧情反转:8月27日,Salesforce靠Agentforce单日暴涨22.6%,ARR突破15亿美元。原因在于,Agent要干活,必须跑在客户数据和业务流程之上。真正的问题不是Agent是否取代平台,而是人...
2026-09-17
AMD发新处理器,蒋涛称大模型进入PC服务器时代
9月10日,AMD在北京举办“携手创新 共赢智能体AI时代”媒体沙龙,发布锐龙AI Max PRO 400系列处理器,将客户端统一内存上限提升至192GB,可本地运行3000亿参数级大模型。CSDN创始人蒋涛发表《大模型的PC服务器时代》演讲。 蒋涛类比二十多年前x86服务器颠覆专有Unix服务器的历史,提出AI正在复刻服务器产业变迁:统一内存AI PC与工作站正开启大模型的PC服务器时代,“开...
2026-09-17
ChatGPT Pro会员Codex额度一天烧光?三个号轮着用也扛不住
最近我的Codex额度已经烧到有点用不起的程度。我做了一个AI热点资讯产品AIHOT,最近的工作基本围绕底层优化:压模型API成本、压抓取成本、用算法替代模型、找过度设计和性能瓶颈。月活突破100万后,流量和请求费用已到扛不住的地步,只能疯狂压缩流量传输,把边缘缓存用到极致。为做热度榜,监控信源加到近2000个,每天大模型API费用几百块。一天一个200美元的Pro会员号几乎成了日抛,3个号轮着用...
2026-09-17
OpenAI前研究员造出不做聊天的AI,速度快200倍
9 月 15 日,前 OpenAI 研究员 Diogo Almeida 公布了过去两年秘密推进的项目——全新 AI 模型 Jev。与 ChatGPT、Claude 等主流 LLM 不同,Jev 不生成自然语言,而是直接输出结构化判断、概率和置信度。这是 Almeida 创办的 AI 初创公司 TypeSafe AI 推出的首款模型。2024 年离开 OpenAI 后,Almeida 与几位联合创始...
2026-09-17
字节分拆AI制药公司拿下20亿融资,刷新国内纪录
AI制药公司Anew Labs已完成首轮独立融资,总额2.9亿美元(约合人民币20亿元),刷新今年国内AI制药单轮融资纪录。投资方包括红杉中国、IDG资本、高瓴创投、五源资本、高榕创投、春华创投等头部机构,以及多家国内医药产业集团作为战略投资方。 Anew Labs是字节跳动分拆出的AI制药主体,今年6月正式完成业务剥离,走向独立运营。其海外主体Anew Therapeutics于2023年在新...
2026-09-17