姚顺宇施天麟谈RSI:验证迭代有效才是最大难题

RSI(递归自我改进)持续升温,OpenAI、Anthropic、谷歌等头部实验室都在探索让 AI 参与下一代 AI 研发,创业公司也围绕它做产品、搭环境、建评测。但当越来越多事情被称作 RSI,一些基本问题需要重新回答:RSI 究竟是什么?模型能自己找到值得改进的目标吗?评测分数提高,如何证明是真变强而非学会刷分?创业公司与模型厂商抢的是同一块蛋糕,还是在做不同的事?
9 月 19 日,AGI House 在上海举办「AGI Frontier · The Recursive Loop」活动,Google DeepMind 主任资深研究科学家姚顺宇、Recursive Superintelligence 联合创始人施天麟、NeoCognition 联合创始人谷雨、Evolvent AI 联合创始人孟繁青、上海交通大学助理教授周煊赫参与讨论,由 AGI House 创始人 Rocky Yu、合伙人 Jason Liao 及红杉中国董事总经理张馨苑主持。
核心观点:RSI 不等于 RL。模型用自己生成的数据训练自己,只是 RSI 非常初级的婴儿阶段,能自己设计整套训练流程,才算超出 RL 范畴。RSI 绝不只是模型单方面问题,而是系统工程,调度层、上下文管理层、硬件优化层要全部打通。模型执行能力很强,但短板在于很难自己定义评估标准、找到正确优化目标。定义问题比解决问题更难。Benchmark 刷榜是经济和人性的结构性问题,一个公开 benchmark 能活三五个月已不容易。真实世界无法无限试错,发错一封邮件可能就失去下一次机会,Agent 需要学会用更少反馈积累经验。
关于定义,姚顺宇认为,若只是模型自己生成数据再训练,那就是最基础的强化学习;若模型能自己设计整套训练流程,就已超出 RL 范畴。终极形态的 RSI 是系统工程,涉及外围调度、上下文管理,以及 CUDA、Triton 等硬件优化层。谷雨认为 RSI 需 AI 自己找到提升目标、找到方案接近目标,并对应长程任务,长程是持续学习与推理交叉耦合的过程。孟繁青将其分三层:AutoResearch,改训练代码等 artifacts;改模型权重,训练另一个模型;绝对意义的 RSI,模型优化自己,系统内只有自己、环境和 verifier。周煊赫补充,模型训练边际收益递减,缺的是高价值 corner case 数据,RSI 是 post-training 的解决方案;可从 AI 参数架构、code/workflow、环境三层递归改起。施天麟认为,RSI 核心是让 AI 自动化训练下一代 AI,代码智能体变通用才有落地基础。
关于不认可的观点,孟繁青不认同「专门做 RSI model」,认为 RSI 能力被上游模型厂训练时内化,系统上限取决于 long context 和选 path 能力。周煊赫举反例,真实部署常需到场景里训模型,他最不信从头训 RSI 预训练模型,但相信垂域 RSI。谷雨不认同 RSI 一词出现后,AutoResearch、loop engineering、MLE 都被称作 RSI,定义应让话题更明确而非更 confusing。
关于落地成果,姚顺宇称 Gemini 3.8 Flash 后训练核心流程由模型自己摸索出来,RSI 已开始落地。Rocky Yu 称 Sergey 几乎全部重心压在 RSI,姚顺宇表示几乎所有头部实验室都将其当成重要方向。姚顺宇认为,从业务看,扩大数据、模型规模、客户体量却不必同步扩张人力,是明确标志;从技术看,模型执行强,但难自己定义合理评估标准、找到正确优化目标,这是目前缺失的一块,但并非无解。现场提问模型独立科研是否存在本质瓶颈,姚顺宇认为不存在根本性硬障碍,科研本质是经验沉淀,当前短板是模型生成想法多样性不足,不属原则性难题。
更多推荐阅读

平头哥真武V900发布:AI算力从单卡走向千卡互联
从真武 V900 到新一代磐久超节点服务器,平头哥八年来布局的 AI 芯片、CPU、scale up 互联、scale out 网络和存储芯片,开始被装进同一套算力系统。9 月 22 日 2026 杭州云栖大会上,平头哥被完整推到主论坛台前,副总裁高慧发表题为「Agentic 时代卓越算力基石」的演讲,发布从真武 V900 芯片到 ICN Switch 互联芯片、磐脉智能网卡、镇岳 SSD 主控、...
2026-09-23
陆川用AI五天复原明代大爆炸,阿里全模态模型兜底影视生产
不用搭景,不用等演员,导演陆川和团队用AI把一场400年前的明代灾难现场做了出来。宫廷、火药库,以及史料中烟云如黑灵芝的大爆炸,按传统影视工业做法往往需要数月时间和千万级投入,这次只用了5天。 人物的脸、皮肤、神态已相当逼真,爆炸的烟尘、碎片、火光也稳稳接住。过去光是一场爆炸戏就要耗费19天。陆川团队把史料文字翻译成现代视觉概念,前后做了约四轮提示词优化,再参考真实爆炸影像校准。阿里视频生成模型...
2026-09-23
OpenAI新模型24天攻克100+数学难题
数学界正被AI迅速逼近。OpenAI一篇重磅博文披露,一款8月28日才开始训练的内部新模型,已攻克100多道世界级数学难题,横跨数学大部分领域,其中包括困扰学界多年的“纳维–斯托克斯”千禧年难题。从开训到9月21日官宣仅24天,进化速度令OpenAI内部数学家都感到意外。 9月8日,OpenAI称该内部模型在88小时内攻克NS千禧年难题,给出NS方程存在性与光滑性问题的证明,并公开166页论文和...
2026-09-23
国产AI生图新高度:真假难辨,还能精修到商用
两张图都是AI生成的,来自商汤科技正式上线的SenseNova U1 Pro,目前可在商汤小浣熊平台使用,API已向企业客户开放。 实测在SenseNova Studio平台进行,模型支持2K起步、最高4K清晰度。第一轮测试将一张生活照重构为纸质风格,随后仅修改人物外套内的黑色圆领T恤为白色,要求严格限定在可见内搭区域。由于T恤、皮带、裤子均为黑色且有胸牌遮挡,边界易混淆,但U1 Pro精准拿捏...
2026-09-23
剪映发布全新AI创作能力:从专业剪辑到普通用户全面提效
剪映在2026 AI新创作发布会上发布全新AI能力,覆盖PC专业版与App端,分别聚焦“提效”与“省心”。 PC专业版推出剪映Hub,一站式AI创作平台,将AI创作与多轨道剪辑连接,让脚本、素材与创作上下文在同一项目中延续,减少跨工具切换的断点与重复操作。剪映助手Agent介入专业创作流程,承担素材整理、粗剪、包装等工作,可根据创作目标规划任务、串联模型工具并自动运行,用户也可自定义工作流,沉淀...
2026-09-23
AI操控游戏新选择:Jev模型到底能做什么?
Jev 是 TypeSafe AI 推出的决策模型,创始人 Diogo Almeida 曾在 OpenAI 参与指令跟随与对话研究。TypeSafe 开发两年后发布该系统,官方称为 System One Models。其使用方式是把当前情况和问题输入,模型返回程序可直接使用的结果,本质上是分类模型,接口主要有三种类型。 在游戏场景中,可每一步询问它:当前血量、怪物和金币位置、出口位置,目标是拿金...
2026-09-23