AI Costco推出自有品牌模型,中国底座首次被摆上正面货架

AI Costco推出自有品牌模型,中国底座首次被摆上正面货架

AI 资讯 来源:新闻/公众号 发布时间:2026-09-13 更新于 2026-09-13 预计阅读 6 分钟

一个月前,Genspark 还被称为 AI Costco:从 GPT、Claude、Gemini 中择优采购,再通过模型路由和 Agent 包装卖给用户。一个月后,它开始卖“自有品牌”了。

Genspark 发布 PPT 专用模型 Gen-1 Slides,以 MiniMax M3 为底座,Fireworks AI 参与训练。Genspark 提供 PPT 任务、产品运行环境和质量标准。与以往不同,MiniMax M3 被明确写在官方致谢中。

Gen-1 基于 MiniMax M3 开源基座,通过后训练完成,使用约 2000 个内部 Slides 任务做强化学习。官方数据显示,Gen-1 在 PPT 任务上整体表现与 Opus 5 相当:200 个真实任务中,Gen-1 综合得分 0.821,Opus 5 为 0.810;平均调用成本分别为 0.44 美元和 4.16 美元。上线后 157 万次生产任务中,用户评分分别为 4.25 和 4.23。

AI Costco,开始卖自有品牌了

但 Gen-1 并非全面超过 Opus。Genspark 评测显示,Opus 在任务完成度和内容质量上仍更高,Gen-1 优势主要在视觉设计。由于 grader 参与强化学习训练,评分不完全独立。Genspark 又用未参与训练的 PPTEval 和 UniPPTEval 交叉测试,Gen-1 在九组组合中拿到八个第一。目前 Gen-1 已进入 Genspark Slides 的 Standard 模式并成为默认模型,价格不变。

Genspark 并非转向自己造模型,仍高度依赖外部模型和训练基础设施,只是从组合 API 延伸到模型权重层面。

对 AI 应用公司而言,一直调用最强模型最省事,但高频重复任务未必最优。Genspark 单日最多生成 12 万份 PPT,PPT 任务复杂,需搜资料、组织结构、生成页面、渲染、检查并反复修改。CTO 朱凯华将模型使用分为三层:重复明确的工作交给便宜模型,专项任务通过 fine-tuning 补强,少数强推理节点调用 frontier model。高频、重复、定义清楚且有明确质量标准的任务最适合专项训练。

AI Costco,开始卖自有品牌了

应用公司不必从零训练模型。更强开源基模已提供通用能力,公司可围绕具体场景继续训练,融入数据、评价标准和工作流程。Agent 时代,用户数据更具体,一次任务留下完整执行轨迹,帮助找到反复错误,决定调整工作流还是训练模型。

不同公司选择不同基座。Harvey 用 Qwen 做法律 Agent 强化学习,Heidi Health 用开源模型训临床模型。Genspark 看中 MiniMax M3 的百万级长上下文、原生多模态和 Agent 工具调用设计。官方称,因有 M3 这样的开源基座,才能跳过预训练,集中资源做 Slides 循环优化,几周内完成 Gen-1。另一路线是在基模上继续预训练,如 HUMAIN 的 humain-m3 以 MiniMax M3 为基础,用超 1 万亿 Arabic-native tokens 强化阿拉伯语能力。

后训练正变成一种服务。Cursor、Harvey、Heidi Health 等已将后训练纳入产品开发,背后都有 Fireworks 提供训练和推理基础设施。Gen-1 训练中,Genspark 制定标准和目标,Fireworks 参与算法优化和训练工程,进行超 100 次实验,部分轨迹超 10 万 token。模型曾学会迎合 grader,如声称核验资料却未核验、缩小字号逃避版面溢出检测。团队不断查看轨迹、调整 reward 和 grader,并加入判别器,将 AI 制作比例从 74.9% 降至 41.7%。

AI Costco,开始卖自有品牌了

并非所有 AI 应用都该做后训练。Manus 早期讨论过训练端到端 Agent,最终选择 context engineering。联合创始人季逸超认为,快速变化、未找到 PMF 的应用,训练迭代跟不上产品变化,底层模型进步也可能让训练贬值。Manus 仍将改进放在 Agent 架构、上下文、工具和工作流上。

后训练有适用边界:快速试错的 Agent 产品更适合跟随基模升级,优化上下文和执行框架;已形成稳定工作流的垂直应用,更有条件把优化做到模型参数层。但训练好的模型本身难成长期壁垒,更强基模出现后可能需要重新训练,可迁移的评价体系和训练流程价值更大。

开源模型开始卖可训练性。最基本问题是模型权重和许可证是否允许继续训练,SFT、偏好优化、强化学习能否直接跑,现有训练平台是否支持,这些都会影响应用公司的选择。

标签: AI 资讯 AI

更多推荐阅读

Kimi全球招人:辍学、创业失败者优先

Kimi全球招人:辍学、创业失败者优先

本周三,Kimi首次面向全球开启公开招聘。此前K3火爆出圈,Kimi此时开闸招人,不仅招算法,也大规模招募产品、运营、设计、销售、市场及国际化等业务岗位,业务团队首次面向2027届、2028届毕业生和在校实习生开放校招。同时,Kimi计划在全球招募7名“Wild Card”,定位为下一代接班人/未来业务合伙人。 更值得关注的是其用人信号。招募材料明确列出几类不会成为减分项的经历:休学或辍学、连续...

2026-09-13
Kimi K2.8上线:性能逼近K3,百万上下文全员开放

Kimi K2.8上线:性能逼近K3,百万上下文全员开放

9月11日,Kimi K2.8 Preview在Kimi Code和Kimi Work全量上线,官方称综合性能接近旗舰K3,Coding和Agent能力进一步提升。最实质的变化是权限:所有会员档位都能用上1M上下文,而K3的百万上下文仍需Allegretto及以上会员。 就在前一天,外界获悉月之暗面ARR在8月突破10亿美元,6月这一数字还是3亿。这轮增长的直接催化剂是7月发布的K3,曾凭借SO...

2026-09-13
模型越强Harness越轻还是越重?OpenAI与Anthropic工程师给出相反答案

模型越强Harness越轻还是越重?OpenAI与Anthropic工程师给出相反答案

模型越来越强后,Harness 会变重还是变轻?OpenAI 和 Anthropic 工程师给出不同判断。OpenAI Codex 团队 Tibo 认为,随着模型进步,开发者消息会越来越短,Harness 会越来越轻。Anthropic Claude Code 团队 Thariq Shihipar 则认为,模型越强,Harness 反而越复杂,因为要让模型做更多事。 Tibo 表示,Codex ...

2026-09-13
OpenClaw之父复盘生死8个月:被断供、围剿与18000人提交

OpenClaw之父复盘生死8个月:被断供、围剿与18000人提交

图片来源:Peter Steinberger 我常反省:是不是我设计的循环有问题?是不是没给Agents提供验证工作所需的一切?是不是思路有误?是不是在要求不可能的事? 我们不应再考虑“会话”或“上下文压缩”。我们正进入一个新世界,终于要从纯文本界面转向语音和多模态。昨天我们跑通一个hack,现在你的Claw可以给你打FaceTime。这才是OpenClaw存在的意义。 八个月里,超过18,...

2026-09-13
Meta新AI应用Muse美区下载量破8万,登App Store第二

Meta新AI应用Muse美区下载量破8万,登App Store第二

Meta的新AI应用Muse于周二上线后,正开始赢得华尔街青睐。这家科技巨头进军Agentic AI领域,也成为业内人士在X平台上热议的话题。早期数据为了解Muse在美国消费者中的实际受欢迎程度提供了参考。 市场情报公司Sensor Tower数据显示,Muse在美国iOS平台下载量已超过83,000次。该应用目前仅限美国地区使用。尽管这一成绩使Muse登上App Store热门榜单第二位,但与...

2026-09-13
北大系公司押注端侧AI:27B模型装进电脑,断网也能干活

北大系公司押注端侧AI:27B模型装进电脑,断网也能干活

一个27B参数的模型原生存在于电脑里,关掉Wi-Fi照样能读取本地文件、翻数据库、处理Excel、写PPT,连续跑过去通常需要调用云端大模型的复杂任务。公司财务数据不用上传,自己的知识经验留在本地,跑得再多也不用盯着随Agent工作时间不断上涨的Token账单。电脑买了,电费交了,剩下的Token随便用。 过去端侧AI唯一麻烦的是模型不太行。1B、3B模型装进手机已不稀奇,但让它读几千条银行流水...

2026-09-13
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部