让Agent不再重复踩坑:中国团队提出RSI第一梯队工程解
Agent系统常出现一种幻觉:模型接入终端后,能花数小时修复复杂依赖冲突,甚至补齐测试用例。但第二天另一个Agent接手相似任务时,却像新手一样重蹈覆辙,盲目读报错、乱改配置。代码修好了,日志存下了,但系统本身毫无进步。

这背后是一个被忽视的工程问题:模型单次推理能力再强,若任务结束即“阅后即焚”,系统便无法产生能力复利。业界热议的RSI(递归式自我改进)常被误解为“大模型自己训练出更大的基座模型”,但在真实环境中,Agent连“不重复踩坑”都做不到,遑论自我改进。

系统层自进化:让经验在网络中流转

EvoMap团队提出了一条现实路径:不在基模层面硬算RSI,而是在系统层构建具备“自进化”能力的智能体,让经验在网络中流转。目前,基于其GEP协议,已有超过35.7万个Agent接入EvoMap网络,沉淀了481万项目录化经验资产。

该体系由三部分组成:EvoX(自进化智能体本体)、Evolver(内置进化引擎)和EvoMap(经验流转网络)。EvoX在真实环境中执行任务,无论成败都会留下详尽执行轨迹,这是进化的原材料。Evolver引擎则将轨迹蒸馏为紧凑的结构化控制对象“Gene”,而非冗长的Skill文档。

关键数据:Gene优于Skill,Token消耗反降
实验表明,在Claude Opus上,复用Gene的智能体比使用Skill多解决39个长流程任务,Token消耗反而降低9.9%。在AutoResearch实验中,系统无需人类干预即可完成科研闭环,将Django修复任务的测试通过率从2/7提升至7/7,并保持203个回归测试全部通过。
EvoMap网络通过GEP协议实现经验流转:EvoX接到任务时,系统从481万资产中匹配相关Gene并注入;执行后,Evolver将结果回写网络,触发Gene的验证、变异或固化。失效经验会被记录条件或衍生变异版本,形成带达尔文式淘汰机制的分发网络。在包含778个复杂任务的LongWoF-Bench测试中,注入Gene的EvoX在7款主流大模型上的通过率,比依赖Skill文件的基线高出8.7至15.5个百分点。
意义与展望:自进化机制成为下一阶段竞争焦点
这套体系证明:在不更新基模参数、不加SFT或RLHF的前提下,纯靠经验对象在系统内的提取与流转,即可显著提升模型在硬核基准上的表现,同时大幅降低Token消耗。Agent时代的下一阶段竞争,不仅是模型参数或上下文长度,更是谁能建立“执行、提炼、验证、分发”的自进化机制——真正的进化,是把爬起来的肌肉记忆刻进整个种群的基因里。
当单个Agent的成败不再孤立,而是汇入一个持续演化的经验网络,AI系统的能力便能随每一次任务而累积。这种“群体记忆”式的进化,或许正是通往通用人工智能的一条务实阶梯。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05