AI开始造AI:递归自我改进正走进现实
今年3月,Andrej Karpathy在GitHub开源了名为autoresearch的小项目,README以“来自未来”的追忆口吻描述AI研究已完全交给智能体群,代码库迭代至第10205代。这当然是个玩笑,但在2026年正被写进各家实验室的内部报表。6月Anthropic发布长文《When AI Builds Itself》;9月6日OpenAI宣布“自动化研究实习生”到岗;9月17日Anthropic披露Claude已“主导”公司26%的研发工作;同一天智谱公开国内大模型首个跑进生产环境的“AI改进自身系统”实践。这些消息共同指向沉睡了六十年的词:递归自我改进(RSI)。

1965年,英国数学家I. J. Good在论文中判断:第一台超智能机器将是人类需要做出的“最后一项发明”。此后几十年,这个设想主要活在哲学论文和科幻小说里。2026年情况变了。4月,ICLR在里约热内卢举办专门讨论RSI的Workshop,组织方称这“可能是全球第一个”只聚焦RSI的学术研讨会。5月,Richard Socher的新公司Recursive Superintelligence结束隐身,带着6.5亿美元融资亮相,联合创始人包括前Meta FAIR研究总监田渊栋、Tim Rocktäschel、Alexey Dosovitskiy和Jeff Clune。7月底,翁荔离开Thinking Machines Lab,两天后OpenAI确认她回归并负责RSI方向研究。Elon Musk在3月称xAI的Grok“每一代模型都由上一代构建”,完全自动化可能在今年底实现,“最晚不超过2027年”。不过“RSI”含义宽泛,康奈尔大学助理教授John Thickstun表示,用上一代模型写代码帮忙构建下一代模型“我们已经做了好几年了”,真正的问题是“到了第几层”。

Anthropic在6月长文中给出内部数据:截至2026年5月,合并进代码库的代码中超过80%由Claude编写,而2025年2月Claude Code发布前只有个位数。2026年第二季度,工程师人均每天合并代码量是2024年的8倍。在优化训练小模型代码的测试中,2025年5月Claude Opus 4做到约3倍加速,2026年4月Claude Mythos Preview做到约52倍,而熟练人类研究员需4到8小时才能做到4倍。9月17日,Anthropic推出原型版“R&D自动化指数”,结论是截至8月,Claude在26%的研发工作中处于“主导”级别,今年3月还只有约1%;超过90%的研发工作有Claude“协作”参与,完全自主、无人在环的比例仍是零。

2025年10月,Sam Altman定下两个时间点:2026年9月实现“实习生级”AI研究助理,2028年3月实现“真正的AI研究员”。9月6日,OpenAI宣布第一个目标达成。其研究部门目前每投入1个人类工作日,对应约3.1个“智能体工作日”,这一比例是今年6月后越过的。8月中旬,研究员每天推理消耗中位数超过600美元,重度用户超过7000美元。OpenAI在2月发布GPT-5.3-Codex时曾写道,早期版本“在创造自身的过程中发挥了关键作用”。但OpenAI也表示,成功完成的4到8小时任务中,超过一半仍需至少一次人类干预。
国内厂商走更“工程”的路线。3月18日,MiniMax发布M2.7时称其为“首个深度参与自身进化的模型”,在“分析失败轨迹、规划改动、修改脚手架代码、运行评测、对比结果、决定保留或回退”的循环中跑了超过100轮,内部评测集效果提升30%,在强化学习研发工作流中能胜任30%到50%的环节。9月17日,智谱创始人兼首席科学家唐杰披露,由GLM-5.3驱动的Infra Agent在超过10万张国产芯片组成的集群上,从零搭建了GLM-5.3-Flash的生产级推理服务,不到两周把端到端吞吐提升到初始基线的3倍,硬件利用效率与单Token成本已达主流英伟达GPU水平。这两个案例改进的都是模型的“外壳”——脚手架和推理基础设施,而非模型权重本身,这恰恰是今天RSI最现实的落点。
更多推荐阅读

谷歌Gemini 4全家桶泄露,内部版本代码能力对标Opus 5.5
据Business Insider报道,Gemini 4系列至少已出现三个内部代号:Argon、Barium、Carbon。Argon是谷歌已正式公布的Gemini 4旗舰模型;Barium是此前参与内部测试的版本系列,其中Barium-B最终被选为公开版Argon;Carbon是新近进入内部编程测试的版本,获得员工积极评价。 谷歌近期正密集测试Gemini 4新版本。Carbon已进入谷歌内部...
2026-10-10
OpenAI公开175页四维挂谷猜想证明稿
10月6日,OpenAI在GitHub公开首批722篇数学手稿,其中一篇175页,目标直指四维挂谷猜想;另一篇97页,瞄准比王虹与Zahl集合定理更强的三维极大函数版本。 挂谷问题源于1917年挂谷宗一提出的经典问题:一根单位长度、无粗细的针在平面内掉头180度,最少扫过多大面积?Besicovitch证明面积可任意小;若只要求每个方向都含一条单位线段,集合面积甚至可为零。挂谷猜想据此断言:n维...
2026-10-10
Claude补齐人类50年未竟的紫外全天图
NASA卫星绕行十年未覆盖的银河区域,被Claude在几天内补齐。Anthropic公布首张完整紫外全天图,约三分之一天区(包括大半条银河盘面)由Claude推算完成,此前从未有紫外望远镜观测过。 紫外光被大气臭氧层吸收,只能靠太空望远镜观测。过去50年,GALEX卫星(2003-2013)拍摄约3.8万张,覆盖三分之二天空,但故意避开银河盘面亮星密集区以免烧坏探测器,2009年后远紫外也停拍。...
2026-10-10
全球首次!人形机器人灵巧手自主叠衣,边走边做家务
一台人形机器人从冰箱取出玉米,丝滑U型转身走向空气炸锅,放下食材后快速下蹲拖动收纳筐,把散落一地的玩偶逐个收纳,再起身前往卧室整理被子。全程没有停顿,没有“站定再动手”,没有场景切换后的任务重启。这是西湖机器人最新发布的通用大脑WR1跑出的真实场景演示。 让机器人做家务,难在真实家务从来不是单点动作,而是一条环环相扣的任务链。当前人形机器人的普遍困境在于:移动、姿态与手部操作分开规划,“能走的走...
2026-10-10
机器人够不到玩偶竟自己搬凳子站上去
玩偶放得太高,机器人伸手够不到。镜头里,它搬来踏台,站上去,把玩偶取了下来。看起来只是“垫高一点”,但搬动踏台、踏上高处、伸手取物,每一步都在改变身体的支撑条件。 成立半年的源策未来,此前在技术博客中提出“全身智能”(WBI)技术路线,如今首次系统性公开实机成果。登高取物只是开场,接下来还有低位拾瓶、清理餐桌、操作洗碗机,以及宇树 G1 和加速进化 T2 上的任务验证。这一次,“全身智能”有了具...
2026-10-10
马斯克获美国最高科学奖章,黄仁勋苏姿丰同台领奖
特朗普将美国国家科学奖章颁给马斯克,同台获奖的还有黄仁勋、苏姿丰、布林、纳德拉和戴尔。白宫提前在X上预热,点名马斯克并配发他与特朗普在Cybertruck前的合影。峰会上,特朗普称马斯克为“当代托马斯·爱迪生”,回顾其创办SpaceX、猎鹰1号入轨、星舰与星链等成就,并提到北卡洪水中星链救人的经历,还称赞特斯拉和Neuralink。黄仁勋因推动GPU通用计算和CUDA,被称为超级智能的“脊梁”;苏...
2026-10-10