中国10人团队27B模型逼近Claude,跻身OpenAI同榜
就在上周,黄仁勋在高盛科技大会上表示,网络安全很可能是 AI 的下一个杀手级应用。几天前,OpenAI 官宣“自动化 AI 研究实习生”正式上岗,每 1 个人类研究员工作日的背后,已有 3.1 个 Agent 工作日在跑。
巨头抢跑之际,一张榜单上出现了意外身影。一支不到十人的中国团队万衍(Vera Praxis),把自己训练的 27B 模型送上 CyberGym。这是让 AI 在真实软件环境里复现漏洞的高难度评测,同榜的是 OpenAI、Anthropic、DeepSeek 等。其网络安全模型 Feyospace 在 Model-focused 纯模型能力对比中取得 63% 成功率,逼近 Claude Sonnet 4.6 的 65.2%。此前该榜单前列长期由巨头占据,如今小团队凭借面向安全场景的专业化训练进入竞争。
比跑分更值得关注的是其目标:把真实业务变成 AI 持续进化的引擎。做安全、量化、音频、App,每块业务都不只为挣钱,而是要在经营中不断撞上模型搞不定的问题,让专家帮模型补课,再让模型下次自己搞定。业务越远,模型学得越多;模型越强,业务越能挑战更难的事。万衍赌的就是这个飞轮。

截至 2026 年 9 月 13 日,Feyospace-v1 在 CyberGym 漏洞复现成功率达 63.0%。CyberGym 将模型放进可执行软件环境,要求理解代码、构造触发漏洞的测试,并根据运行反馈调整,包含 188 个软件项目的 1,507 个真实历史漏洞任务。安全是检验这种能力的高难度场景:成熟代码长期接受审计,容易发现的问题多已修复,剩余问题更能检验模型能力。
万衍已交出可量化的专业模型训练成果:统一评测设置下,同一套后训练方案提升了三个不同基座的表现,其中 27B 提升 8.73 个百分点。在完整漏洞利用专项实验中,团队将 Qwen3.8-Flash-Next 的 ExploitBench 成功率从 12.96% 提升至 19.05%,增加 6.09 个百分点;后训练检查点在两道 V8 任务上达到 T3 层级。这说明针对性训练能推动模型从“复现漏洞”迈向构造目标相关利用原语。
在 Feyospace 技术报告中,一项浏览器引擎任务里,模型已在调试环境触发异常,却无法在默认设置下复现。安全专家补充关键运行条件判断,帮助其继续推进。团队将这条洞见纳入完整推理与行动记录,再继续执行和验证。这一方法被称为 Kreator:把专家在关键节点的判断,转化为模型可学习、复用和检验的解决问题过程。

专家与模型思考方式存在结构性差异:专家依靠多年经验形成的隐性判断,能迅速识别关键条件;模型则需要清晰、可观察、可复现的中间步骤,才能理解判断依据并在新任务中复用。若只保留最终答案,模型可能学会表面表达,却无法掌握排查、决策和验证过程。因此 Kreator 不只记录“做了什么”,还要保留“为什么这样做”以及“如何确认有效”。
团队最终保留约 16.4 万条训练轨迹,组成包含代码、安全及硬件任务的混合训练集,用于开源模型后训练;专家介入是其中一种制作方法。万衍希望以此建立新的专业能力扩展方式:让少数优秀专家负责最关键判断,让模型学习判断背后的方法,承担越来越多可验证的工作。
当 AI 开始承担更长、更复杂的工作,学习材料与评价标准也需更接近实际交付。David Silver 与 Richard Sutton 在《Welcome to the Era of Experience》中提出,让 Agent 从与环境的持续交互和结果反馈中学习。万衍看重“从经验中学习”在真实业务中的实践空间。9 月 6 日,OpenAI 披露其 Agent 已能在人类指导下完成原本需要熟练研究者数日处理的明确研究任务,复杂任务仍需人的专业指导。

万衍判断,下一阶段重要的模型能力将在完整工作中接受检验,也从完整工作经验的获得提升。一个有用的 App 就是这样的任务:代码能运行,还需产品目标、界面审美、专业内容和工程实现共同成立。从需求到上线,模型需理解这些要求之间的关系,在连续修改中保持目标一致。最终交付是否有用,要由专业验收和用户实际使用来回答。
这类经验的价值存在于完整上下文中:多个专家为什么作出取舍,一次修改解决了什么问题,后续结果是否支持最初判断。长期参与同一项业务,才能持续追踪这些联系,并把下一轮改进放回真实工作中检验。万衍选择亲自经营,正是为了把这种持续参与能力掌握在组织内部。业务团队对产品、服务和经营结果负责,模型团队与他们共同面对问题,反复追问:模型究竟在哪里卡住,专家补上的是什么,怎样才能让模型下次独立完成?
公司目前布局 App、音频、安全等方向。
更多推荐阅读

把记忆交给CPU,大模型推理能快多少?
拿Agent做Coding已经很常见,但把目光移到背后的数据中心,事情就没那么简单了。一个Coding Agent改跨十几个文件的bug,需要反复读代码、查资料、跑测试。任务越跑越久,系统要处理的历史信息也越积越多。当成千上万个Agent同时干活,运营方就可能遇到一个头疼问题:服务器还在跑,能接住的并发却越来越吃紧,有些请求连吐出第一个Token都要等很久。 问题的根儿不在GPU,而在记忆。大模...
2026-09-16
MIT报告追问:AI时代,大学还值得上吗?
MIT与AI发展深度绑定,但如今它开始反思:AI会不会颠覆大学教育本身?在MIT一场教师听询会上,有人提出:既然AI Agent做研究助理又快又便宜,UROP(本科生研究项目)是否还要招学生?对经费紧张的实验室,这很难不心动;但对校长而言,必须回答大学为何要让学生花四年聚在一起。 2026年8月,MIT发布38页内部报告《AI在教学、学习与研究训练中的使用》,由五个学院的教授、学生和行政人员历时...
2026-09-16
机器人打拳跳舞一年了,何时能替我们上班?
机器人打拳跳舞火了一年,它什么时候才能替我们上班? 宇树发布人形机器人格斗演示,称首次实现由世界模型实时驱动的全自主搏击,UnifoLM-X2-1.0能实时预测未来状态,完成规划、决策和动态交互。但换成药房取放商品等场景,包装各异的药品、有人走动的货架通道、长时间运行中的意外,都是新难题。 APPSO在2026外滩大会现场与蚂蚁灵波CEO朱兴交流。谈到机器人为何连小卖部都未大规模落地,他直言:...
2026-09-16
菲尔兹奖得主联名警告AI数学错位
上周六,陶哲轩、邓煜、彼得·舒尔茨等25位菲尔兹奖得主联合发表声明《人工智能在数学中的严重错位》,引发广泛讨论。陶哲轩表示“事态紧迫”,未等待更广泛协商便先行发布。声明并不反对AI进入数学,而是反对AI公司把“攻克著名难题”当基准来刷,导致数学共同体真正在意的理解、概念和可复用思路被更容易量化的目标挤掉。 三天前,OpenAI宣布一个尚未发布的内部模型用约一万个智能体协同工作、耗时88小时,完成...
2026-09-16
谷歌深夜放大招:Gemini 3.8 Live语音模型登顶榜首
谷歌发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两个实时对话模型,称其为迄今最先进的实时对话模型。Extended Thinking 在 Artificial Analysis 语音质量榜以 82.6 分拿下总榜第一;在 ServiceNow 语音 Agent 测试中,两模型首次同时提升准确性与对话流畅度。 此前 AI 圈因泄密账...
2026-09-16
OpenAI“Lily计划”曝光:你的ChatGPT聊天记录正被人工审核
美国当地时间9月14日消息,据外媒报道,OpenAI正在推进代号“Lily计划”的内部项目。数百名外包人员正阅读真实用户的ChatGPT对话内容,包括完整上下文记录,对回复进行评分和点评,其中不乏敏感个人隐私。审核人员核心任务之一是训练ChatGPT避免拟人化倾向并降低“讨好型”人格。对OpenAI而言,“过度讨好”已成核心隐患,多起诉讼指控GPT-4o因过度顺从用户,在一定程度上诱发多起自杀事件...
2026-09-16