AI造AI时代来了?代季峰团队开源新模型

AI造AI时代来了?代季峰团队开源新模型

AI 资讯 来源:新闻/公众号 发布时间:2026-09-29 更新于 2026-09-29 预计阅读 5 分钟

Naive AI 正在探索让当前 AI 模型承担下一代模型研发的路径,使每一代模型都能比上一代承担更多研发工作。

用AI造的!刚刚,代季峰团队首个模型开源

10 天前,Anthropic 公布内部数据:AI 研发工作中已有 26% 由 Claude「主导」完成,研究员只需给出高层指令,Claude 即可端到端完成大部分任务,人类负责监督;今年 2 月这一比例还不到 1%。更早几天,OpenAI 宣布去年定下的「自动化研究实习生」目标已达成:每投入 1 个人类工作日,就有约 3.1 个智能体工作日同时运转。9 月 21 日,OpenAI 提议由美国牵头制定前沿 AI 全球技术标准,并将递归式自我改进(RSI)列为重点议题。国内,智谱 9 月 17 日披露,由 GLM-5.3 驱动的 Infra Agent 在十万卡国产集群上从零搭起了 GLM-5.3-Flash 的推理服务。短短半个多月,「让 AI 研发 AI」已从理论话题变成头部实验室争相公开的量化指标。

用AI造的!刚刚,代季峰团队首个模型开源

今年 2 月,当 Anthropic 的 AI「主导」比例还接近零时,代季峰的创业团队 Naive AI 成立。该公司摒弃传统以人类为中心的研发体系,把写代码、跑实验、监控流程、分析结果交给 AI,人类研究员只负责提出目标、设定约束与评价标准、最终决策。

用AI造的!刚刚,代季峰团队首个模型开源

路线选择上,Naive AI 专注开源模型后训练与 Agent 研发,不做从零预训练,而是以开源模型为起点做架构改造、增量预训练和后训练。其首款模型 Naive-N0.5-Flash 总参数量 309B,激活参数量 15.5B,原生支持百万 token 上下文,面向编程与 AI 研发,具有双重身份:由 AI 参与研发,也被专门训练来承担 AI 研发工作。技术报告显示,AI 已参与注意力架构探索及训练、推理和部署系统优化;研究员设定目标、约束与评价标准,AI 实现候选方案、运行实验并据结果调整,架构选择等关键决策仍由研究员把关。

两个配套案例:在推理运行时 NaiveRT 优化中,研究员与 AI 用六天推进 151 轮实验,将一轮完整投机解码耗时从 12.3 毫秒降至 3.4 毫秒;另一项任务中,Naive-N0.5-Flash 接下世界模型研究工作,经累计 400 小时、15 轮主要实验,得到 AutoWM,跻身 WorldArena 第一梯队。此外,清华博士生 Shiqian Su 分享使用 Naive-N0.5-Flash 训练 Jev 模型的示例,所得多模态类 Jev 模型在俄罗斯方块与贪吃蛇上均优于 Jev 及开源 Laya,环境与数据准备、模型和训练方法选择、测试构建及后续训练、评估、纠错和迭代均由 Agent 自行推进。

核心评测结果:PaperBench 得 63.2 分,高于 Claude Opus 4.7、GPT-5.5 和 MiniMax M3;MLE-bench-30 得 73.7%;PostTrainBench 得 37.5 分。在 Sol-ExecBench、NanoChat AutoResearch 和 NanoGPT SpeedRun 三项任务上,对比 Recursive Superintelligence,后者曾将 NanoGPT Speedrun 从 79.7 秒压到 77.5 秒,而 Naive-N0.5-Flash 将成绩提到 73.8 秒。编程方面,NL2Repo 得 71.9,高于 DeepSeek-V4.1-Flash;ALE-CLI 得 32.4 分,接近 GPT-6 Astra 与 Opus 5.5。原生 1M 上下文为保留任务历史提供空间。模型权重与推理代码采用 MIT 许可,将提供 API,输入、输出与缓存读取价格分别为每百万 token 0.6、2.6 和 0.07 元人民币。

研发 N0.5 时,团队以开放权重的 MiMo-V2.5 base 为起点,将全局注意力替换为 DeepSeek 稀疏注意力(DSA),DSA 先通过轻量索引器对历史位置打分,选出 2048 个位置交给主干网络计算注意力;SWA 处理 128 token 局部窗口,网络以五层 SWA 搭配一层 DSA 为主,构成混合稀疏注意力架构。团队还采用四个 KV 分组的 GQA,并设计具有 16 个 query 头的轻量索引器。

标签: AI 资讯 AI

更多推荐阅读

Sonnet 5.5六天反超Opus,中杯追平旗舰

Sonnet 5.5六天反超Opus,中杯追平旗舰

说好的未来几周,Anthropic只等了6天。上周Opus 5.5发布时官方剧透Sonnet 5.5和Haiku 5.5都在后面,如今Sonnet 5.5先到了,Claude家的“中杯”已经撵着刚发布的旗舰追了。 上周Opus 5.5发布时,Terminal-Bench 4.0的66.4%还是挺能打的成绩。Sonnet 5.5一来直接干到70.6%,上一代Sonnet 5只有10.3%。在覆盖4...

2026-09-29
AI员工接管企业SaaS,Ema融资7700万估值翻4倍

AI员工接管企业SaaS,Ema融资7700万估值翻4倍

AI 初创公司 Ema 正试图让 AI 智能体团队接管企业内部的人力资源、IT 和财务等业务流程。随着 AI 开始承担过去由企业软件和 IT 服务完成的工作,Ema 宣布完成新一轮 7700 万美元融资。本轮 B 轮融资由印度班加罗尔风投机构 Creaegis 领投,现有投资者 Accel、Section 32 和 Prosus 继续加码。融资完成后,Ema 累计融资额达 1.4 亿美元,估值较 ...

2026-09-29
可灵4.0内测:30秒一镜到底,支持10关键帧与HDR

可灵4.0内测:30秒一镜到底,支持10关键帧与HDR

可灵AI宣布最新旗舰视频生成模型Kling 4.0开启内测,将于10月正式上线,同时推出生成速度更快、性价比更高的Kling 4.0 Flash。两款模型API价格暂未公布,Flash已于昨日面向可灵最高档会员(每月916元起)开放体验。 这是Kling系列时隔8个月的大版本更新,上次为今年1月31日的Kling 3.0。Kling 4.0升级集中在视听质感、创意控制和叙事能力三方面。 Kli...

2026-09-29
1小时微调专属Jev模型,单卡实测准确率78%

1小时微调专属Jev模型,单卡实测准确率78%

开源版 Jev 教程发布后,不少读者反馈模型在演示用例上表现顺畅,但接入实际业务时意图判不准、分类标签对不上。原因在于开源复刻版本提供的是在公开通用数据上训练的权重,学习到的是特定业务场景与候选描述,而不同团队的 Agent 处理状态、路由类别和判断口径各不相同,直接套用通用权重准确率必然下降。 根本解决办法是基于自己的数据训练。本篇教程带大家在本地从零走通完整训练流水线,涵盖下载底座与数据、预...

2026-09-29
百万月活AI热点网站AIHOT正式开源

百万月活AI热点网站AIHOT正式开源

今天,我决定将月活百万的AI热点资讯网站AIHOT正式开源,网址为https://aihot.news/。它最初只是公司内部用于监控热点、寻找选题的飞书机器人,后来发展为拥有百万月活、近10万Skill用户,以及众多基于其API二次开发的项目。从年前借助AI开发第一版至今,已过去七八个月。很多人问我为何不商业化、一直免费,其实我只是单纯喜欢做产品,大家的鼓励和正反馈是我深夜坚持的最大动力。 开源...

2026-09-29
腾讯秘密内测AI游戏搭子“鹅次元”

腾讯秘密内测AI游戏搭子“鹅次元”

腾讯正在秘密内测AI游戏陪伴产品“鹅次元”,主打数字人AI搭子,提供语音对话、画面实时识别、游戏陪伴等能力。产品内置多位人设各异的男女虚拟角色,玩家选定后可闲聊互动或激活游戏陪伴模式,适配多款主流网游。全部功能限时免费,界面已露出星币兑换能量的付费框架。 实测中,进入产品后首先看到AI角色选择界面,可切换男女分类,女性角色有谷雨、沈露白、夏夏三位可选。选定“夏夏”后进入主交互界面,中间是数字人形...

2026-09-29
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部