Meta新旗舰模型发布,成本低于DeepSeek

Meta新旗舰模型发布,成本低于DeepSeek

AI 资讯 来源:新闻/公众号 发布时间:2026-09-03 更新于 2026-09-03 预计阅读 7 分钟

5个月迭代4款模型,下一步还要开源。

9月3日,Meta发布新一代旗舰模型Muse Spark 1.3。在Artificial Analysis的AI分析指数榜上,新模型分数仅次于Claude Fable 5.1、Claude Opus 5。

Meta CEO马克·扎克伯格在社交平台X上称,Muse Spark 1.3的性能超乎想象。Meta超级智能实验室负责人汪滔称,该模型成本低到几乎可以忽略不计,智能体、编程能力及易用性大幅提升。搭配Muse Code,评测表现可与Claude Code + Opus 5、Claude Code + Fable 5媲美。

有开发者使用Muse Spark 1.3制作了《我的世界》游戏,成本仅10美分。

Meta旗舰模型翻身!比DeepSeek还便宜,华裔掌门人骑脸Gemini

就在Meta新模型发布4小时前,谷歌发布了推理与编程模型Gemini 3.8 Flash及Flash Cyber版本,但随后在Artificial Analysis榜单上被Meta反超。目前Muse Spark 1.3得分62分,仅次于66分的Claude Fable 5.1和63分的Claude Opus 5,Gemini 3.8 Flash为59分。汪滔还在社交平台上对谷歌贴脸开大:“gemini who?”

过去5个月,Meta接连推出四款Muse Spark模型:4月首发,7月更新1.1,8月上线1.2,加上最新1.3,迭代节奏愈发密集。

基准测试显示,Muse Spark 1.3拿下5项第一,在长上下文、编程的绝大部分测试优于GPT-5.6 Sol、Claude Opus 5,仅Terminal-Bench测试与GPT-5.6 Sol打平。相对薄弱的是Agent能力,在联网搜索类Agent、通用知识任务中分数较低。

价格方面,Muse Spark 1.3的API定价与前代一致,每百万token输入(缓存未命中)1.25美元,输入(缓存命中)0.15美元,输出4.25美元。价格略高于Gemini 3.8 Flash,比DeepSeek-V4-Pro高峰期价格便宜。

Meta旗舰模型翻身!比DeepSeek还便宜,华裔掌门人骑脸Gemini

Muse Spark 1.3已在Muse Code与Meta Model API中逐步推送上线,此前已支持的推理模式现已可用;max-reasoning模式将在完成额外安全测试后很快开放。Meta称已规划好产品路线图,包含更大参数规模模型、开源权重版本发布及更多更新。

开发者实测:速度快、成本低,但生成效果一般。

在X上,不少开发者晒出实测案例,大部分评价是速度快、成本低,但生成效果并不惊艳。一位开发者对比了1.1到1.3对同一建筑进行3D模拟的效果,几何形状、结构及视觉效果均有提升,总成本保持在0.6美元。另一位开发者对比Muse Spark 1.3 Ultra Contributor版本和Claude Fable 5.1 xHigh,使用相同提示词,双方运行约2小时。Muse Spark跑了20轮自我优化循环,每轮启动3个智能体,累计执行60次以上任务,成本不到1美元。有网友质疑这是否说明模型一直没完成任务就停止了。

在开源的3D空间推理基准测试MineBench中,Gemini 3.8 Flash总测试成本1.18美元,平均推理耗时1分51秒,首测Elo评分1888分;Muse Spark 1.3总测试成本6.57美元,平均耗时5分36秒,首测得分1787分,生成质量与顶尖前沿模型仍有差距。

Meta旗舰模型翻身!比DeepSeek还便宜,华裔掌门人骑脸Gemini

另一位开发者对比了Muse Spark 1.3、Qwen 3.8 Max、GLM 5.3、GPT-5.6 Sol,综合感受是Muse Spark在成本与速度方面可与Qwen 3.8 Max媲美,GLM 5.3综合表现最佳。Qwen 3.8 Max输出质量最好,但耗时约一个半小时,Muse Spark只需约2分钟。

长周期任务不跑偏,编程token量减少25%。

Meta博客提到,Muse Spark 1.3的优势在于支撑长周期任务及编程。它能与用户协同,在单条长对话会话中并行处理多条工作流,面对开放式目标时调用工具,从杂乱信息源中自主构建上下文,主动修正方案漏洞并输出完整成果。

相比之前版本,Muse Spark 1.3能在多步骤任务中更好保留细节要求,不遗漏约束条件,不偏离工作流程。Meta还改进了多任务处理能力,在信息杂乱的单会话上下文中,模型能把新输入匹配到对应任务上。

Meta旗舰模型翻身!比DeepSeek还便宜,华裔掌门人骑脸Gemini

模型能了解自己能做什么、不能做什么,遇到障碍时知道如何应对。例如提示词要求生成流体仿真报告初稿及CAD模型STEP文件,Muse Spark 1.3会生成对应文件。

编程方面,与1.2相比,Muse Spark 1.3操作步骤更少,表述更简洁,编码风格更清晰。Meta工程师测试显示,工具调用次数减少20%,token使用量减少25%。

此外,研究人员围绕智能体与代码能力完成了安全升级,对抗鲁棒性增强,对提示注入攻击的抵御能力提升;处理复杂任务时,对不可逆操作具备风险判断并审慎执行。

结语:5个月迭代4版,Meta的大模型要起飞了?

5个月迭代4个版本,密集发布节奏或标志Meta AI研发进程明显转变。Muse Spark 1.3没有追求全维度通杀,而是集中资源砸向长上下文、编程等方面,在DeepSWE、OSWorld等真实工程任务基准上实现对前沿模型的反超。

这种取舍或许证明

标签: AI 资讯 AI

更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速

世界模型专家刘宇加盟理想,机器人基座模型研发提速

理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。

2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启

AI办公赛道巨头混战,Agent创业窗口反而开启

2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。

2026-09-05
AI报告读着累?新指标用隐喻率量化可读性

AI报告读着累?新指标用隐喻率量化可读性

Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。

2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%

AI科学家K Pro上岗,全球最大药企研发提速70%

Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。

2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。

2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明

AI攻克费马大定理:Claude 11天写出1300万行证明

Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。

2026-09-05
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部