Meta新旗舰模型发布,成本低于DeepSeek
5个月迭代4款模型,下一步还要开源。
9月3日,Meta发布新一代旗舰模型Muse Spark 1.3。在Artificial Analysis的AI分析指数榜上,新模型分数仅次于Claude Fable 5.1、Claude Opus 5。
Meta CEO马克·扎克伯格在社交平台X上称,Muse Spark 1.3的性能超乎想象。Meta超级智能实验室负责人汪滔称,该模型成本低到几乎可以忽略不计,智能体、编程能力及易用性大幅提升。搭配Muse Code,评测表现可与Claude Code + Opus 5、Claude Code + Fable 5媲美。
有开发者使用Muse Spark 1.3制作了《我的世界》游戏,成本仅10美分。

就在Meta新模型发布4小时前,谷歌发布了推理与编程模型Gemini 3.8 Flash及Flash Cyber版本,但随后在Artificial Analysis榜单上被Meta反超。目前Muse Spark 1.3得分62分,仅次于66分的Claude Fable 5.1和63分的Claude Opus 5,Gemini 3.8 Flash为59分。汪滔还在社交平台上对谷歌贴脸开大:“gemini who?”
过去5个月,Meta接连推出四款Muse Spark模型:4月首发,7月更新1.1,8月上线1.2,加上最新1.3,迭代节奏愈发密集。
基准测试显示,Muse Spark 1.3拿下5项第一,在长上下文、编程的绝大部分测试优于GPT-5.6 Sol、Claude Opus 5,仅Terminal-Bench测试与GPT-5.6 Sol打平。相对薄弱的是Agent能力,在联网搜索类Agent、通用知识任务中分数较低。
价格方面,Muse Spark 1.3的API定价与前代一致,每百万token输入(缓存未命中)1.25美元,输入(缓存命中)0.15美元,输出4.25美元。价格略高于Gemini 3.8 Flash,比DeepSeek-V4-Pro高峰期价格便宜。

Muse Spark 1.3已在Muse Code与Meta Model API中逐步推送上线,此前已支持的推理模式现已可用;max-reasoning模式将在完成额外安全测试后很快开放。Meta称已规划好产品路线图,包含更大参数规模模型、开源权重版本发布及更多更新。
开发者实测:速度快、成本低,但生成效果一般。
在X上,不少开发者晒出实测案例,大部分评价是速度快、成本低,但生成效果并不惊艳。一位开发者对比了1.1到1.3对同一建筑进行3D模拟的效果,几何形状、结构及视觉效果均有提升,总成本保持在0.6美元。另一位开发者对比Muse Spark 1.3 Ultra Contributor版本和Claude Fable 5.1 xHigh,使用相同提示词,双方运行约2小时。Muse Spark跑了20轮自我优化循环,每轮启动3个智能体,累计执行60次以上任务,成本不到1美元。有网友质疑这是否说明模型一直没完成任务就停止了。
在开源的3D空间推理基准测试MineBench中,Gemini 3.8 Flash总测试成本1.18美元,平均推理耗时1分51秒,首测Elo评分1888分;Muse Spark 1.3总测试成本6.57美元,平均耗时5分36秒,首测得分1787分,生成质量与顶尖前沿模型仍有差距。

另一位开发者对比了Muse Spark 1.3、Qwen 3.8 Max、GLM 5.3、GPT-5.6 Sol,综合感受是Muse Spark在成本与速度方面可与Qwen 3.8 Max媲美,GLM 5.3综合表现最佳。Qwen 3.8 Max输出质量最好,但耗时约一个半小时,Muse Spark只需约2分钟。
长周期任务不跑偏,编程token量减少25%。
Meta博客提到,Muse Spark 1.3的优势在于支撑长周期任务及编程。它能与用户协同,在单条长对话会话中并行处理多条工作流,面对开放式目标时调用工具,从杂乱信息源中自主构建上下文,主动修正方案漏洞并输出完整成果。
相比之前版本,Muse Spark 1.3能在多步骤任务中更好保留细节要求,不遗漏约束条件,不偏离工作流程。Meta还改进了多任务处理能力,在信息杂乱的单会话上下文中,模型能把新输入匹配到对应任务上。

模型能了解自己能做什么、不能做什么,遇到障碍时知道如何应对。例如提示词要求生成流体仿真报告初稿及CAD模型STEP文件,Muse Spark 1.3会生成对应文件。
编程方面,与1.2相比,Muse Spark 1.3操作步骤更少,表述更简洁,编码风格更清晰。Meta工程师测试显示,工具调用次数减少20%,token使用量减少25%。
此外,研究人员围绕智能体与代码能力完成了安全升级,对抗鲁棒性增强,对提示注入攻击的抵御能力提升;处理复杂任务时,对不可逆操作具备风险判断并审慎执行。
结语:5个月迭代4版,Meta的大模型要起飞了?
5个月迭代4个版本,密集发布节奏或标志Meta AI研发进程明显转变。Muse Spark 1.3没有追求全维度通杀,而是集中资源砸向长上下文、编程等方面,在DeepSWE、OSWorld等真实工程任务基准上实现对前沿模型的反超。
这种取舍或许证明
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05