小米1T大模型推理速度破千:每秒千Token,七秒交付应用

小米日前发布MiMo-V2.5-Pro-UltraSpeed,这是MiMo-V2.5-Pro的高速版本,定位旗舰级大模型。该模型拥有1T总参数、支持1M上下文,单API推理速度达到1000+TPS,刷新了旗舰模型全球最快推理速度,而且不依赖专用硬件,用通用GPU即可实现。这一成绩直接打破了“快、强、通用GPU不可兼得”的不可能三角。
在实测中,速度优势体现得淋漓尽致。接入Claude Code生成一个500多行的HTML番茄钟应用,模型连同思考过程仅用7秒便完成交付;网页端输出平均速度超过1000+TPS,峰值更是飙到3300以上。在Hermes环境中,模型完成了带前后端和数据库的实时聊天室,功能全部正常。多Agent协同审阅电影大纲时,三个子代理并行工作,不到两分钟就交出报告,还能准确定位结构、人物、市场方面的关键问题。这样的吞吐量意味着,过去需要漫长等待的复杂任务,现在几乎可以做到“即问即答”,对于开发者来说,等待时间被压缩到了近乎直觉的范畴。
全链路协同,速度与智商兼得
这种极速体验并非靠砍参数或堆硬件换来的。小米通过模型层、引擎层、系统层的全链路协同设计实现提速,其中模型层采用Hybrid SWA架构,专门解决1M长上下文和参数带宽压力。作为对比,此前业界最快的旗舰模型大约是400B参数跑400TPS,而且是以削减参数为代价。小米在1T总参数的规模下跑出1000+TPS,相当于用更大的模型实现了更快的速度,把“速度”和“智商”同时攥在了手里。
通用GPU部署,降低使用门槛
更关键的是,如此高性能并不属于“特权硬件”。过去,要获得极致推理吞吐,往往需要专用加速卡或大规模集群;而小米的方案在通用GPU上就能跑通,这大幅降低了旗舰模型的高性能部署门槛。对开发者而言,1M上下文让模型可以轻松处理超长代码、完整文档和复杂对话历史,而1000+TPS的吞吐则让AI编程、实时交互、多智能体协作等场景变得格外流畅——七秒交付一个番茄钟应用,正是这种流畅度的直观写照。当推理速度不再拖后腿,开发者可以更大胆地把大模型嵌入到生产工具中,甚至催生出新的应用形态。
旗舰大模型的竞赛,过去更多聚焦在参数规模和上下文长度上。MiMo-V2.5-Pro-UltraSpeed用实测数据证明,推理速度也可以成为旗舰级的核心竞争力。当“快、强、通用GPU”不再是一道单选题,大模型落地到真实业务的路径正在变得更宽。小米此次在速度维度的突破,或将推动行业重新思考模型设计与部署的权衡,让更多实时AI应用加速到来。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05