匿名模型Space Bunny终现身,MiniMax M3.1实测

匿名模型Space Bunny终现身,MiniMax M3.1实测

AI 资讯 来源:新闻/公众号 发布时间:2026-09-30 更新于 2026-09-30 预计阅读 5 分钟

上周,OpenRouter 上线了一个匿名模型 Space Bunny Alpha,1M 上下文,支持图片、视频输入,思考强度五档可调,免费。几天内蝉联 OpenCode 榜首。社区指纹测试显示其 24 项特征全部对上 MiniMax 家族。9月27日,MiniMax Code 正式上线 M3.1-Flash-Preview,配置相同,定位 Flash 级别,主打 Coding。官方未公布跑分,目前仅能在 MiniMax Code 和 Token Plan 中使用。

Flash模型又添一员大将:实测MiniMax M3.1

作者在 MiniMax Code 中开启多个任务实测,全部拉到 max 档。

Flash模型又添一员大将:实测MiniMax M3.1

Coding 任务:接手一个线上 AI 试衣间项目,要求从 4000 多张混杂图片的 NAS 相册中筛出至少 100 件不同衣服,去重、建档、上架。M3.1 先将照片压成缩略图,每 200 张拼成联系表,派出 30 个子 Agent 分头识别,主 Agent 汇总去重。最终首页从 4 件扩充到 155 件,分类为上衣 51、套装 45、裙装 36、裤装 23,共 8 页,每件配中文名和品类角标。模型还补充了批量导入脚本、后台接口、搜索、分类、分页功能,系统运行无明显 bug。

Flash模型又添一员大将:实测MiniMax M3.1

多模态任务:分析斯坦福 Mobile ALOHA 机器人做虾的 77 秒视频,按动作变化拆解,标注底座、左臂、右臂动作及物体状态,看不清的写“无法确认”。M3.1 输出 Excel 时间码表,逐行记录各部位动作,并单列关键事件页。翻虾一步标注“无法确认”,放锅回灶标注“没发生”。随后要求基于时间码表制作单文件离线回放台,左侧视频、右侧事件时间轴,拖动同步,四阶段用不同颜色标出,无法确认阶段显示灰色。M3.1 完成,翻面阶段灰色带问号,事件卡附“无法确认”说明。

数据可视化任务:对比北京 2015 年 11 月与 2020 年 11 月卫星夜光栅格,制作离线单页“城市在夜里亮起来了吗?”,将夜光抬成 3D 地形,支持年份拖动、左右对比、擦除和变化图三种模式,叠加北京城市骨架。M3.1 完成,竖线扫过显示光斑扩展,小地图标出裁剪范围。

金融任务:用本地 A 股数据做“市场天气台”,检查数据新鲜度与字段完整性,从市场宽度、波动、回撤、板块轮动到个股,每个数字说明算法,数据过期不写“今日行情”,不给买卖建议。M3.1 完成,顶部标注数据截止 2026 年 9 月 28 日、标的 4603 只。四张卡片显示市场宽度:中位数收益 −1.71%,805 涨、3687 跌、100 平。行业地图 103 个圆点,点选高亮,注明右上角不等于值得买。点入行业可看不同时段涨幅,再点入个股可看 K 线。

速度与成本对比:同样 prompt 交给 DeepSeek V4.1 Flash 和 GLM-5.3-Flash。DeepSeek 最快,四项中三个第一;GLM 最慢,北京夜光跑了一个半小时未交付页面。成品质量差距小:做虾视频三家都拆出时间码表,翻虾判断上 M3.1 和 DeepSeek 标无法确认,GLM 给出翻面判断;北京夜光 M3.1 和 DeepSeek 变亮比例均为 27.6%;回放台三家交互相近,M3.1 更简洁;A 股观测台三家都先查数据再出页面。成本:DeepSeek 约 10 元,GLM 约 21 元,M3.1 用 Max 档 Token Plan 月费 119 元,一下午用掉周额度 10%,折合不到 3 元。GLM 走官方 API 按量计费,换 Coding Plan 包月会更划算。M3.1 目前仅走 MiniMax Code 和 Token Plan,未公布 API 单价,上一代 M3 API 价格为每百万输入 0.3 美元、输出 1.2 美元。速度结论:DeepSeek 最快,M3.1 次之,GLM 最慢。M3.1 在 A 股观测台最快,其余三项次于 DeepSeek。整体看,M3.1 智力未必顶尖,但作为 Flash 档干活模型,DeepSeek V4.1 Flash 多了一个对手。

标签: AI 资讯 AI

更多推荐阅读

AI编程“计划模式”刚成标配,就有人宣布它已死

AI编程“计划模式”刚成标配,就有人宣布它已死

这两天,Hacker News 上一篇《Plan mode is dead》引发关注。作者 Ayman Nadeem 是 YC 孵化的 AI 编程公司 Nuanced 创始人兼 CEO。她曾坚信规划是 AI 编程最重要的环节,并围绕这一判断打造桌面编程应用,但几个月后改变了看法。文章触及 AI 编程工具中一条正在松动的产品假设:写代码前,人要先整理出完整计划再交给 Agent。 Nadeem 认...

2026-09-30
齐俊元再创业:Today AI上线,要做更懂你的个人AI助理

齐俊元再创业:Today AI上线,要做更懂你的个人AI助理

9 月 28 日,Manus 发布 2.0 版本,并推出独立的个人 Agent 应用 Cue。每个 Agent 拥有自己的邮箱、电话、钱包和电脑,可以替你接电话、发消息,并在设定预算内付款。 海外 Personal Agent 赛道已相当热闹。Meta 的 Muse 上线 10 天在美国获得 73 万次下载,登上 App Store 免费榜第一。GrokBot 借助 X 的分发能力入场,Town...

2026-09-30
Meta新AI应用Muse爆红,小扎口碑逆袭背后逻辑

Meta新AI应用Muse爆红,小扎口碑逆袭背后逻辑

Personal Agent正在成为下一个风口。 过去三周,Meta发布的个人AI助手Muse成为科技圈最大变量。该应用9月8日上线,仅10天就登顶美国App Store免费应用总榜,第12天全球安装量达280万。9月21日,Meta单日股价上涨11.43%,市值增加近2000亿美元,此后股价稳定在700美元以上。 Muse为每个用户配备独立云端虚拟机,用户通过手机即可浏览网页、操作应用、发邮...

2026-09-30
腾讯秘密开发Personal Agent产品Handy Bot

腾讯秘密开发Personal Agent产品Handy Bot

腾讯正在秘密开发Personal Agent产品“Handy Bot”,并计划推出独立App。目前已在微信端低调上线服务号,简介为“Your Personal AI Agent”。产品仍处内部测试阶段,信息以官方口径为准。 当前行业正热议Personal Agent叙事,Meta刚推向市场的Muse将消费级智能体热度推至新高。传统Chatbot属会话驱动,一问一答,会话结束任务终止;Person...

2026-09-30
视频超分不再“变样”!RH Upscale 13组横评综合第一

视频超分不再“变样”!RH Upscale 13组横评综合第一

视频超分长期面临两难:传统方法能拉高分辨率,却难以找回丢失的细节;生成式方法能补细节,却可能导致人物变样、构图偏移,在视频中还会出现闪烁和拖影。画面要更清楚,原内容又不能被改掉。 海马云旗下 RunningHub 发布自研生成式视频超分模型 RH Upscale,目标为“放大而不改内容”,在提升分辨率、恢复纹理的同时,尽量保持人物、构图、色调及运动过程的一致性。在 13 组横向评测中,RH Up...

2026-09-30
320B中国开源黑马杀出,模型自己抓Bug揪出幽灵空格

320B中国开源黑马杀出,模型自己抓Bug揪出幽灵空格

就在昨天凌晨,一个320B的开源大模型IQuest-Q1发布,权重和blog一并公开。九月赛道竞争激烈,GPT-6 Astra、Fable 5.1、Gemini 3.8 Flash及国产Qwen3.8、GLM-5.3等接连发布。IQuest-Q1由至知创新研究院(IQuest Research)推出,在写代码库、挖安全漏洞和长程复杂任务等硬核评测中与头部模型同台竞技。 研发团队一次强化学习训练中...

2026-09-30
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部