Agent经验反哺模型,NeoHorse-1让AI不再重复踩坑
Agent完成任务后,学到的经验去了哪里?一个Agent接到项目排期任务,漏读了一封包含最新修改的邮件,沿过时信息规划,生成无效排期,还把文件写错位置。执行链中断后,全是基于错误推理的错误答案。问题在于,下一次怎么办?今天大多数系统中,Agent的经验留在日志里,几乎从不进入模型参数,模型下次遇到相似任务,依旧可能踩同样的坑。

基元律动发布的NeoHorse-1试图改变此事,开源4B与9B两个尺寸模型。思路是让一个负责给模型“派活”的路由系统,顺便记录所有模型走过的路,再把这些路教给一个小模型,让它自己就能走完一群模型走过的路。这被称为迈向RSI(递归自我改进)的第一次闭环验证。模型由无问芯穹提供底层基础设施,清华、北大团队参与算法研究。

RSI愿景是让AI把自己的产出作为经验喂回研发流程,参与设计更强的下一代自己。Anthropic和OpenAI近期均公开了RSI早期进展,但完整RSI时代尚未到来。当前Agent领域有两条演进路线:一是在推理时更新外部系统(如写入Memory、Skill),二是让Harness框架直接参与模型训练。NeoHorse-1尝试用最简单方式实现训练正循环,使用Qwen3.5 4B和9B模型,将自我改进闭环拆成四个可逐环检查的零件并全部开源。

NeoHorse基于Harness训练AI模型分四步:第一步保留Agent的“推理-行动-反馈”链条,保存完整交互轨迹并切成训练单元,主语料库含十万到百万条脱敏轨迹。第二步判断轨迹可用性,用确定性规则检查结构,再从目标达成、指令遵循等六维度语义评估。第三步用Router预测的能力需求进行课程学习,按C0到C3分层作为难度信号,分三阶段推进训练。第四步采用路由引导的On-Policy Distillation,学生先做题,教师沿学生实际位置提供监督。最后评估形成“能力短板地图”,下一轮数据向短板倾斜,构成RSI闭环。
评测显示,4B模型平均分从58.94提高到64.87,9B从65.60提高到69.04。NeoHorse-1-4B综合结果接近Qwen3.5-9B基座。提升主要集中在流程清晰、反馈可验证的任务上,但长时间状态保持等任务仍吃力。行为层面,票务日报任务中NeoHorse主动补取证据,19张工单匹配率达100%;五子棋网页任务中按顺序落子正常。后训练补上执行链条关键一环,但未抹平能力边界。
更多推荐阅读

MiniMax仓促开源H3,狙击Seedance胜算几何
MiniMax H3 的开源,可能比外界看到得更仓促。7月31日,H3与Seedance 2.5同日发布,外界易将其视为一次提前设计的开源狙击,但至少在发布前半个月,MiniMax尚未确定是否开放。据知情人士透露,7月中旬,MiniMax曾通过销售团队询问多家公司H3的API需求,反馈一致:若只卖闭源API,H3难有竞争力。客户所指不仅是效果差距,而是Seedance已构建的牢固闭源体系——其生成...
2026-09-09
办公Agent混战,中国电信TeleAgent实测入场
办公 Agent 下半年开启大乱战模式。这类产品已离开聊天框,进入电脑处理具体工作。日常使用中,用户最关心的是:能否读懂不同格式文件?中途改需求是否记得背景?交付物能否直接打开?数字是否准确?任务消耗多少积分?这些环节正改变办公 Agent 的竞争格局。 APPSO 近期体验了中国电信推出的桌面 Agent——TeleAgent,它基于自研星辰大模型和国产智算底座。运营商下场做个人办公 Agen...
2026-09-09
DeepSeek社招大改:删ACM题,资深工程师直呼内行
DeepSeek为150人规模的社会招聘重新设计了面试流程。据负责人崔添翼透露,笔试中ACM类代码题全部删除,改为系统设计题,需实际工程经验才能答好。应届ACM金牌选手可能无从下手,但资深工程师会得心应手。算法设计题不再要求完整可运行代码,只需清晰思路或伪代码。选择题也加入更适合资深工程师的内容,整体面试时间跨度大幅缩短。校招仍沿用原有题目,此次改动仅针对社招资深工程师,社招与校招考核体系彻底分离...
2026-09-09
七万门店实测:盘点机器人能否扛起零售效率大旗
一家正在营业的超市里,一台轮式机器人正沿货架移动,需避开顾客和购物车,核对电子价签与商品价格,调整摄像头查看被遮挡的库存,并用机械臂伸入仅三四十厘米高的货架层,抓取软塌的膨化食品袋并整齐放回。每个动作、识别精度、运行安全和设备成本,都直接影响零售商经营结果。ROI回报,是具身智能进入真实门店绕不开的一步。 汉朔科技与X-Era Lab(拓元智慧)正共同将这些能力带入真实门店。汉朔科技服务全球超5...
2026-09-09
OpenAI 88小时攻克NS方程,弃领百万美元大奖
OpenAI 宣布,其使用一个比 GPT-6 Astra 更强大的未公开下一代模型,联合约 10000 个并发 AI Agent,耗时 88 小时攻克了千禧年难题之一的纳维-斯托克斯方程的存在性与光滑性问题。该问题悬赏 100 万美元,过去 90 年无人解决。OpenAI 同时发布了 166 页的推导论文和 Lean 形式化验证代码,并宣布放弃申领奖金,称此举旨在展示 AGI 正转变为推动前沿科学...
2026-09-09
大模型脑中藏三维地图,为何不会用?
多模态模型的空间推理存在一种反直觉现象:它能识别图像内容、回答简单方位问题,却在视角转换、方位判断和前后关系推理时失灵。过去这被归因于“空间能力不足”,但MirroS发布的S-Space研究给出了更精细的解释:模型内部可能已形成相当准确的空间地图,真正的短板在于稳定读取、变换和使用这张地图的能力。 S-Space是模型隐藏状态中的三维空间工作区,物体位置沿水平、垂直、距离三个方向连续编码。研究者...
2026-09-09