编码模型新招:自己出题自己练,两个月反超闭源旗舰

编码模型新招:自己出题自己练,两个月反超闭源旗舰

AI 资讯 来源:新闻/公众号 发布时间:2026-08-30 更新于 2026-08-30 预计阅读 4 分钟

训练一个能干活的模型,最贵的不是显卡,而是训练题。尤其是编码和智能体任务,光有题目和答案远远不够,还需要配套可运行的环境、判分测试,并防止模型抄袭旧提交。题目难度也需适中,过易或过难都无益于学习,且数量必须充足。过去这些工作高度依赖人工,慢、贵且供不应求。

今年8月,Ornith发布397B MoE、35B MoE和9B Dense三档权重,训练流程中新增了一个关键环节:模型自己生成训练任务、搭建解题脚手架、运行解题轨迹,并将这三段统一投入强化学习。在Terminal-Bench 2.1上,Ornith-1.5的397B版本得分86.1,较两个月前的1.0版本(77.5)提升8.6个百分点,甚至超过了其自测的Claude Opus 4.8(85.0)。

从“怎么解”到“该练什么”

6月的Ornith-1.0已经实现了将agent脚手架变为可学习对象,模型可以自行调整工具、任务拆解和重试策略。而1.5版本进一步将题目生成纳入闭环:系统根据代码库、高层任务说明和模型历史解题记录,生成比已会题目更难一档的新题,并为每题生成或改进专属脚手架,最终跑出解题轨迹,奖励反向传回全部三段,用GRPO优化。出题质量也被纳入评分,防止模型偷懒出送分题。

为了防止废题,任务奖励被拆分为有效性、前沿难度、新颖性三个相乘的信号。有效性是硬门槛,不合格直接判零;前沿难度通过采样轨迹计算经验成功率,目标值约0.2,即好题应让模型十次做成两次,难度随模型能力自动爬升;新颖性权重最低,仅负责去冗余。

自测成绩与官方榜单的差异

需要特别注意的是,86.1这个分数是Ornith团队自测结果(配置为4小时超时、32核CPU、48GB内存),而Terminal-Bench 2.1官方验证榜单(截至2026年8月19日共17项)中并没有Ornith-1.5。官方榜上Opus 4.8经核验为78.9%,榜首为Claude Code加Fable 5的83.8%。同一模型在不同测试条件下分数差异显著,自测与官方验证不可直接对比。此外,MIT许可仅指权重,GitHub仓库并未包含完整训练实现、任务集或可复现评测脚本。

小模型同样亮眼

除了旗舰版,35B-A3B MoE(激活约3B参数)在Terminal-Bench 2.1得分67.8,优于Gemma 4-31B(42.1)和Muse Glimmer-30B(51.7);SWE-bench Verified为79.0对52.0。9B Dense自测Terminal-Bench 46.2、SWE-bench Verified 70.6、GPQA Diamond 86.4,但在工具调用类任务(如MCP-Atlas、Toolathlon-Verified)上不及Gemma 4-31B。

Ornith-1.5较1.0在Terminal-Bench提升约11.1%,核心变化是从学习“怎么解”转向学习“该练什么”,将数据生产纳入强化学习闭环。开放模型追赶闭源旗舰的方式,在堆参数和抄配方之外,新增了“自己造题”的路径。模型上限除算力外,还取决于题库质量。这一思路或许预示着,未来的模型竞争将不仅是算力和架构的比拼,更是“自我进化”能力的较量。

标签: AI 资讯 AI

更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速

世界模型专家刘宇加盟理想,机器人基座模型研发提速

理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。

2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启

AI办公赛道巨头混战,Agent创业窗口反而开启

2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。

2026-09-05
AI报告读着累?新指标用隐喻率量化可读性

AI报告读着累?新指标用隐喻率量化可读性

Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。

2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%

AI科学家K Pro上岗,全球最大药企研发提速70%

Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。

2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。

2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明

AI攻克费马大定理:Claude 11天写出1300万行证明

Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。

2026-09-05
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部