Mistral发布1T参数大胖猫模型,激活仅49B

Mistral发布1T参数大胖猫模型,激活仅49B

AI 资讯 来源:新闻/公众号 发布时间:2026-10-07 更新于 2026-10-07 预计阅读 6 分钟

今天早些时候,美国开源了 glm5.2 级别的模型。随后,欧洲的 Mistral 发布了 Mistral Large 4,又名 Le Chonk 大胖猫。

该模型总参数 1.05T,每次只激活 49B,另带一个 1.6B 的视觉编码器。它采用细粒度混合专家(MoE)结构,模型拆成很多“专家”,每处理一个词只叫醒其中一小部分,因此 1T 模型每算一个词的开销接近 49B 模型。原生多模态,能读文字和图片,输出文字;上下文 1M。从零训练,用了两个月、4000 张英伟达 Grace Blackwell,全在 Mistral 自己的欧洲机房。上一代 Large 3 是 675B 总参数、41B 激活,用 3000 张 H200 训出。官方称,按综合跑分,它是美国和欧洲最强的开源权重模型。

Mistral Large 4 发布:1T 参数、49B 激活,aka「大胖猫」

Chonk 在网络俚语里指圆滚滚的胖猫。今年 6 月,网友虚构过一个叫 Le Chaton Fat 的“肥猫模型”。现在 Mistral 端出真正的 1T 胖猫,今天起 API 可用,权重 10 月 27 日放出。

跑分方面:DeepSWE 让模型做真实长链条软件工程任务,Large 4 预览版拿到 62%,智谱 GLM-5.3 为 61%,DeepSeek-V4-Pro 57%,Qwen 3.8 Max 51%,Reflection 前一天发布的 Beam 44%。Finch(FinWorkBench)考企业财务流程,Large 4 拿到 67%,与 DeepSeek-V4-Pro 打平,GLM-5.3 为 65%;自家上一代 Medium 3.5 仅 37%。Harvey 法律 Agent 测试按任务通过率算,Large 4 为 15%,Kimi K3 13%,GPT-6 Astra 5%,全场都没及格。这些都是预览版成绩,官方称强化学习还在跑,提升还没见顶,权重放出前分数还会变。

Mistral Large 4 发布:1T 参数、49B 激活,aka「大胖猫」

视觉定位方面,DIOR-RSVG 遥感航拍图,Large 4 拿到 73%,GPT-6 Astra 68%;Dense200 两者都是 42%。官方称在视觉定位上超过闭源前沿模型,对 Anthropic 的 Fable 5.1 也说赢了,但未给出数字。Mistral 举的用法包括保险公司看航拍图评估风暴损失、电力公司巡检输电线、农场盯庄稼长势,还能把技术图纸转成 CAD 模型,官方称其在半导体相关测试上成绩靠前,芯片设计也在列。

据 CNBC,今年早些时候 Hugging Face 遭失控的 OpenAI Agent 入侵,先找美国闭源模型帮忙防守,结果护栏把操作当成攻击拦下,最后用的是智谱 GLM 5.2。官方推文列的重点场景中,网络防御排第一。联合创始人兼首席科学家 Guillaume Lample 说:“网络防御能力能让企业和政府,去防住那些越狱闭源模型来发动攻击的人。”Mistral 的理由是:安全团队每天都要扫自家系统找新漏洞,量很大;闭源模型的安全策略可能把正当防御请求也拒掉。权重下载到自己机器上,扫多少、怎么扫,不用再问谁。这三周预览期里,开发者、网安公司和政府机构拿到的是一个限制更少、网安功能更多的版本,公开 API 上没有。官方还说,它在网安任务上超过 Kimi、DeepSeek 和 Meta 最好的开源模型,这组数字也还没公布。

Mistral Large 4 发布:1T 参数、49B 激活,aka「大胖猫」

Mistral 还说,客户要两样保证:不会被哪个外国政府断供,模型怎么训出来的有据可查。可以部署在自家服务器上,也可以调 Mistral 的 API 并选部署区域,包括受欧盟法律保护的欧洲区;训练语言超过 160 种,覆盖欧盟全部官方语言。Lample 对 VentureBeat 说,客户要的早就不止模型本身,部署、基础设施、定制、围着越来越复杂的 AI 流程做工程支持,都是生意。Mistral 现在服务 125 家以上的大企业,包括空客、ASML 和汇丰,其中一些客户用 Mistral 卖的 Forge 平台参与了 Large 4 的训练。

9 月,Mistral 刚完成 30 亿欧元的 D 轮,投后估值超过 210 亿欧元,自称欧洲科技公司史上最大的一笔股权融资。Large 4 是这笔钱之后的第一个模型,新买的算力 2027 年上半年陆续到位。

模型名 mistral-large-4,在 Mistral Studio 和 API 上已经能调,文档标的是公开预览版。每百万 token:输入 0.68 美元,缓存输入 0.07 美元,输出 2.09 美元。文档上,原价 1.36、0.14、4.18 都被划掉,现价是一半。权重 10 月 27 日放出,预计用 Mistral 自定的许可证。在那之前,官方会陆续公布架构细节、更多跑分、后训练方法和安全测试。之后,Large 4 会成为一整个系列专用模型的底座。

背景方面,这个和国内的胖猫没啥关系。今年 6 月,一个根本不存在的 Mistral 模型 Le Chaton Fat(法语,肥猫咪)在 X 和 Reddit 上火了:有假跑分图,有越编

标签: AI 资讯 AI

更多推荐阅读

xAI联创宣判:数学两千年英雄时代落幕

xAI联创宣判:数学两千年英雄时代落幕

两千多年来,人类最聪明的大脑一直在攀登数学这片山脉。从欧几里得到怀尔斯,每征服一座山峰都要赌上一生。但xAI联合创始人Christian Szegedy认为,这个属于数学的英雄时代正在结束。 Szegedy在长文《数学何去何从?》中,将数学家比作丛林里徒手攀岩的探险家,AI则是一架飞机,已把旗插上没人爬过的山顶。孤独攀登者的时代正在结束,测绘整片大陆的时代正在开启。 Szegedy少年时在匈牙...

2026-10-06
OpenAI疯狂28天首日:模型提速50%却遭评论区翻车

OpenAI疯狂28天首日:模型提速50%却遭评论区翻车

Codex负责人Tibo宣布启动“疯狂28天”计划:未来28天每天要么交付一项Codex/Work改进,要么进行一次完整额度重置。第一天,Tibo宣布GPT-6 Astra和GPT-6.1 Sol默认推理速度提升约50%,达到50TPS,覆盖官方订阅及Sign in with ChatGPT接入的第三方生态。 但评论区几乎无人关注提速,满屏冷嘲热讽。此前9月29日GPT-6.1 Sol上线后因负...

2026-10-06
AI研究员为何计划逃离湾区买地避难

AI研究员为何计划逃离湾区买地避难

一些Anthropic最期的员工,最近开始考虑在美国偏远地区买地。他们想过,如果AI真的失控,那里或许可以成为避难的地方。 “一切再也无法平静如初。”一些研究员的电脑上贴着同一句话。 事实上,逃离的念头并非突然出现。十多年来,一群聚集在旧金山湾区的AI安全研究人员,一直在讨论AI失控之后可能发生什么。那时候,Anthropic甚至还没有成立。 有人在伯克利设立共享办公空间,在私人Slack频...

2026-10-06
英伟达押注的Reflection开源新模型对标智谱

英伟达押注的Reflection开源新模型对标智谱

英伟达投资的 Reflection 发布首个开源模型 Beam,对标智谱 GLM-5.2。官方称两者在高级推理测试上分数相当,Beam 推理算力仅需后者的三分之一到四分之一。彭博和金融时报称其为美国在开源模型领域对中国的反击。但 Beam 与国内其他头部开源模型如 Qwen3.8、GLM5.3、Kimi K3、DSV4F 仍有差距。 Reflection 由谷歌 DeepMind 两位研究员 M...

2026-10-06
把35个判断交给内核:这个开源项目拿下黑客松总冠军

把35个判断交给内核:这个开源项目拿下黑客松总冠军

在进化酒馆黑客松深圳收官之战中,项目 mu(μ)获得全场冠军。它将 Jev 深度融合进 Harness,试图解决 Agent 把工具、日志、技能、上下文全部交给大模型导致效率低、Token 浪费的问题。 mu 建立在开源 Coding Agent pi 之上,主要改造模型外的 Harness,设计了 35 个判定点,覆盖用户输入、工具调用、上下文管理、任务完成判断和多 Agent 通信等环节。例...

2026-10-06
DeepSeek新融资近千亿,为2027年IPO铺路

DeepSeek新融资近千亿,为2027年IPO铺路

智东西10月6日消息,据彭博社报道,DeepSeek即将敲定至少800亿元人民币的新一轮融资,腾讯和宁德时代承诺的出资金额均位居该轮融资最高的一批。知情人士称,根据已签署的条款,该轮融资最终募资总额可能接近1000亿元,为计划在2027年初进行的IPO铺路,规模已明显超过此前预期。 知情人士透露,DeepSeek最初仅计划募资约500亿元,但随着最新模型发布后市场反响超出预期,潜在投资者需求明显...

2026-10-06
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部