MiniMax M3 发布:编程、长上下文与多模态一次集齐

今日,MiniMax 正式发布新一代模型 M3。这一代最值得关注的变化,是终于在同一模型中集齐了前沿的 Coding 能力、1M 的上下文窗口和原生多模态。与此同时,配套的 Agent 产品 MiniMax Code 也迎来更新,技术博客同步放出。我们第一时间读完博客并分别上手实测,下面分享对技术博客的要点整理与实测感受。
三大能力,不再取舍
过去,要在编程、长上下文和多模态之间做到样样精通,往往需要在不同模型之间来回切换。M3 则把这些能力整合进同一个模型。1M 的上下文窗口,意味着模型可以一次性处理的文本量远超常规水平——面对一部上百页的技术手册,或是中小型项目的全部源代码,它不需要分批“读完”,而是可以直接在整个上下文里检索与推理。原生多模态则让模型在底层就打通了文本、图像与音频的表示,遇到带截图的报错信息或包含架构图的文档,模型可以直接“看”懂,不需要额外外挂视觉模块。前沿的 Coding 能力,则体现在代码生成、代码补全和 Agent 任务中的稳定表现上。三种能力彼此叠加,正好覆盖了真实开发中“一边看架构图,一边改代码,还要翻长文档”的高难度场景。
技术博客:一份扎实的成绩单
M3 的技术博客给出了相当多的评测数据。读完之后最直接的感受是:这是一份扎实的成绩单,但还不是终点。以 Terminal Bench 为例,这是评估模型在终端操作和 Agent 任务上表现的基准,M3 的表现已经稳定排在 Sonnet 4.6 这一档,部分编程和 Agent 任务上还要更靠前一些。而把 M3 与 Opus 4.7、GPT-5.5 放在一起对比,可以清晰看到还有一段差距。换句话说,M3 已经坐稳第一梯队,但距离金字塔尖的顶级模型,仍然保留着一段可量化的追赶空间。对于国产模型而言,能在同一时间把编程、长上下文和多模态做到这个水平,本身已经值得肯定。
实测与配套产品
我们分别上手了 M3 和 MiniMax Code。在实测中,我们重点观察了长上下文与编程的结合场景。得益于巨大的上下文窗口,当输入内容中混有代码、注释和自然语言描述时,M3 能够保持连贯的整体理解,不需要像以前那样手动分段喂入,这在实际使用中带来的体验提升非常明显。MiniMax Code 作为配套的 Agent 产品,思路是将 M3 的底层能力转化为可操作的开发工作流,让模型从“回答问题”升级为“执行任务”。可以说,MiniMax Code 是 M3 能力在真实项目中的延伸,也是 MiniMax 在 Agent 赛道上的一次具体落子。
展望:全能型模型的竞争刚刚开始
M3 的低调发布,传递出一个明确的信号:大模型的竞争正从单点指标的堆砌转向综合实力的较量。敢于把编程、长上下文和多模态同时装进一个模型,本身就代表了一种技术判断。虽然前方仍有 Opus 4.7 和 GPT-5.5 这样的强敌,但 M3 已经将差距缩小到可以清晰量化的范围。对于开发者来说,这意味着多了一个颇具竞争力的选择;对于行业来说,则证明了全能型路线在国产模型中同样可行。接下来,MiniMax 需要继续打磨 Agent 生态,让 M3 在真实工作流中释放价值。这,或许比任何一份 Benchmark 都更有说服力。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05