两周迭代千元起,这家公司要让后训练人人可用
最近几个月,后训练成为 AI 行业最集中的议题。基础模型公司在扩大 RL 规模,应用公司也在考虑如何基于真实业务的任务轨迹和用户反馈构建后训练流程。模型在真实环境中产生的经验,正在成为下一代智能的原料。
一个反常现象是:全球最活跃的开源模型来自中国,但围绕这些模型的第三方后训练平台却在海外发展更快。Thinking Machines Lab 的 Tinker、Fireworks、Together AI、Prime Intellect 和 Applied Compute 已从不同位置进入市场,国内类似定位的独立平台很少。现在,Mind Lab 开始做这件事。

今年 7 月,Mind Lab 基于 GLM-5.2 发布 Macaron V1;9 月 23 日又发布基于 GLM-5.3 的 Macaron V1.1,并推出后训练平台 Mint Recursive。该平台面向企业,支持 GLM、Qwen、DeepSeek、Kimi、MiniMax 等开源模型,提供 FDE 专家共同训练、平台自动化训练、企业自主训练三种合作方式。
Macaron V1.1 是一款 752B 参数模型,由 GLM-5.3 的 744B 基础权重和四组各约 2B 的 LoRA 组成,分别负责 Chat、Agent、Coding 和生成式 UI。测试显示,V1.1 在全部 7 项评测上得分超过原始 GLM-5.3,并在 DeepSWE v1.1、SWE-Marathon、AutomationBench 上超越或追平 Opus 5。在长程 Coding 任务中,V1.1 所需步骤和 Token 更少,核心做法是将 SWE 轨迹标准化为复现、定位、编辑、验证、恢复五个阶段。在复杂办公场景中,V1.1 重点加强工具调用安全,要求模型知道何时不该动手。完成这一轮模型更新只用了两周。

Mint Recursive 把一次模型更新拆成评测、数据准备、训练、复测和部署几个环节。企业第一步是建立自己的 Benchmark,让基座模型先跑一轮,保存任务执行轨迹,看到模型在哪一步出错,再决定哪些问题值得通过后训练解决。企业可整理已有数据或根据失败轨迹构造新样本,选择 SFT、DPO 或强化学习等方法,决定采用 LoRA 还是全参数更新。训练完成的新版本可直接部署,也可回到最初 Benchmark 检验。这套流程的关键是一体化且可持续,有“同一把尺子”。
过去企业使用大模型,核心考量是选择哪家 API。但基础模型持续开源、能力排名不断变化后,选中某一款模型越来越难形成长期壁垒。所有企业都能更换模型,但最关键的是每家公司对自身业务的理解。这种差距在 Agent 场景中更明显。通用模型会调用工具,却未必理解一家公司的业务规则、成本要求和授权边界。

Mint Recursive 从四个层次服务这种需求:低门槛、高性价比、可持续迭代和高自由度。低门槛首先来自 Benchmark,早期客户集中在金融、AI for Science 和医疗行业,它们 AI 化程度较高,已积累明确的业务规则、评测方法和任务数据。高性价比方面,全参数训练对多数企业仍过重,LoRA 只更新少量新增参数,可用较小投入验证效果。官网报价显示,专项模型训练服务最低 1000 美元起。在 Mint Recursive 上,不同 LoRA 可共享同一个常驻基座,训练和部署按实际使用量计费。可迭代方面,每个 LoRA 都可单独训练、评测、上线和撤回,生产环境中的新问题可进入下一轮训练。自由度方面,企业可自己调整方案,设定目标、预算和约束,平台支持全参数训练及 SFT、DPO、强化学习等方法,也可通过 Python SDK 自定义损失函数、强化学习环境和训练循环,迁移原有 verl、TRL、OpenRLHF 或 PyTorch 训练代码。
支撑这些操作的是 Mind Lab 从 2025 年在 Kimi K2 等万亿参数模型上做后训练时积累的 Infra 能力。团队解决了把超大模型拆到大量 GPU 上训练、让生成数据和接受训练走过一致计算路径、通过异步训练和 LoRA 热更新让训练推理与版本切换同时进行等问题,相关能力已接入 Megatron-Bridge、VERL 和 AReaL 等主流生态。
一个做个人 Agent 的应用团队,孵化出一家实验室,训练了自己的模型,现在又把训练模型的系统拿出来服务企业。做个人 Agent Macaron 首先要理解一个具体的人:记住偏好,熟悉习惯,让过去的相处对下一次服务有用。团队从这里关注到个人记忆,Mind Lab 又把问题往前推了一步——这些经验能不能进入参数,改变模型处理任务的方式?围绕这个问题,他们做研究、训练 LoRA 模型,也积累起支撑这些工作的 Infra。
更多推荐阅读

百度悄悄上线OkWork,瞄准碎片化AI办公
随着阿里、字节分别推出千问办公和豆包工作,百度在AI办公赛道再有新动作。百度悄悄上线主打随身办公的AI工具“OkWork”,集PPT生成、AI写作、表格数据分析、海报生图于一体。这是百度近期继库库AI后,在AI办公场景的又一次落子。 OkWork界面走简约轻量化路线,首页核心能力分四大模块:AI PPT、AI写作、AI表格、AI生图。功能拆解较细,并非笼统一句话生成。AI PPT支持文档转PPT...
2026-09-24
中国物理AI黑马3个月登顶全球第一
AI圈迎来全新黑马。在权威公开评测榜单RoboDojo中,成立仅几个月的初创公司Simate拿下全球第一,并已完成数亿元人民币连续多轮融资,VC、互联网大厂、产业资本纷纷入局。 Simate创始人张颖曾是某头部自动驾驶公司核心技术负责人之一、最年轻的对标阿里P10技术大牛,参与打造国内最接近Tesla FSD的智驾系统。如今他带着“产业×学术”双料团队转身杀入Physical AI,仅3个月便登...
2026-09-24
华为大模型双子星创业,两月融资数亿估值5亿美元
Physical AI公司息壤开物近日连续完成数亿元种子轮及天使轮融资,估值达5亿美元。本轮由敦鸿资产领投,华控基金、三花控股、银杏谷资本、泽然资本、本坚基金、天使基石、标朴投资等跟投。资金将用于原生物理AI模型规模预训练、真实物理交互数据建设、核心人才引入及场景验证。 息壤开物由两位华为大模型体系核心人物创办。创始人、CEO李寅曾任华为云大模型CTO,是华为大模型从0到1核心成员,长期负责产业...
2026-09-24
Agent替你花钱,你敢把钱包交给AI吗?
Agent的爆发不止于应用层,底层的交易和支付方式也在被重写。今年AI交易沿两条线展开:一是Agent帮人完成任务,如6月上线的AI版支付宝,一句话就能打车、点咖啡;二是Agent-to-Agent,如两个月前Mastercard发布专为机器间支付设计的网络服务。 本期节目来自2026 Inclusion·外滩大会主论坛圆桌“当Agent成为交易主体”。硅谷101创始人泓君与蚂蚁集团CEO韩歆毅...
2026-09-24
4亿副耳机等待AI改造,供应链老炮交底
这些「老炮们」最不缺的就是把硬件造出来的能力,也不缺求变求新的劲儿。可AI硬件新课的内容,显然超纲了。 四家供应链「老炮」交了个底 深圳市烽火宏声科技有限公司副总经理王鑫透露,公司AI耳机样机正在做设计验证,主打会议转写、AI翻译等,目标今年底前量产出货,已有两个品牌客户下单。 消费电子方案商奇智创新的AI耳机样机也已摆上桌面,电脑播放英文TED演讲,点击耳机即可实现实时中文翻译。拥有全模块...
2026-09-24
Claude网页因汉字限速,中文用户集体中招
Anthropic发布工程复盘,将内部研究版Claude放入Slack频道连续工作两周,使claude.ai网页版和桌面端整体速度提升3倍。期间发现一个意外瓶颈:Claude自身使用破折号的习惯会拖慢网页。 排查显示,代码回复输出后做语法高亮时,页面会卡死近1秒。原因是V8引擎字符串分单字节和双字节两种格式,单字节仅支持Latin-1字符集,速度快;一旦混入一个单字节装不下的字符,整段文本都按双...
2026-09-24