坐马化腾身旁的姚顺雨,拿下中国AI安全第一
节后上班第一天,姚顺雨坐在了马化腾旁边。据《广东新闻联播》报道,广东省领导来到腾讯总部调研座谈,包括马化腾在内多位腾讯高管参与。能坐在Pony旁边,说明腾讯高层对姚顺雨高度认可。出任腾讯AI Data部负责人不到一个月,他就拿到了一项中国第一。
在Arena最新的Alignment Index榜单中,中国多家AI公司冲进前10,腾讯混元独占鳌头,最新模型Hy4 Preview拿到78.5分,全球第5、中国第一。UA 1.47%、FA 6.44%、DC 13.24%,越权控制最好。这张榜测的不是谁更聪明、跑分更高,而是谁家模型最“不会越狱”。

2025年姚顺雨曾写文章《The Second Half》,核心判断是AI下半场瓶颈不再是怎么训练模型,而是怎么让模型符合用户真实需求。如今他用实际行动证明了自己的猜想。
10月8日,Arena宣布完成2亿美元B轮融资、估值31亿美元,同步推出对齐榜单Alignment Index。榜单基于9万多条真实Agent会话、覆盖27个模型,从用户真实使用轨迹里定位模型出现风险的时刻。主要看三种失败信号:越权(UA),即没让它做的事它自己做了,Claude Opus 5约2%会话出现越权,其中53.5%涉及未经许可删除或清理用户文件;错误归因(FA),即把用户没说过的话、没有的意图安到用户头上,专业写作场景最高达13.7%;虚假完成(DC),即没做完却告诉做完了,平均每10个会话就有1个出现,代码调试场景高达48.0%。

第一名是OpenAI的GPT-6.1 Sol,87.9分,第二名Claude Opus 5.5(83.2分),第三名Grok-4.7(82.7分)。GPT-6.1 Sol虚假完成率仅2.34%。Hy4 Preview虽与前三有差距,但已站上全球第5、中国第1,越权1.47%是中国实验室里最低的。其虚假完成率13.24%,高于10%的平均水平,是混元短板。
今年9月,腾讯TEG内部任命姚顺雨正式兼任AI Data部负责人,向TEG总裁卢山汇报。该部门主要负责大模型数据和评测体系建设,原负责人是刘煜宏。事实上从上半年起姚顺雨就已实际管理该部门。至此,腾讯混元的“模型、Infra、数据和评测”四件事全划归他一人手里。

在《The Second Half》中姚顺雨写到,模型性能逐渐趋同,继续刷分不会再带来真实价值,根本原因在于传统评测方法非常局限。Agent拿到任务、自主完成、最后得到分数,但现实中Agent必须在全程与人互动,很难完全自主执行题目。传统评测每道题独立同分布,题与题互不相干,现实中任务顺序发生、经验会积累。AI已在象棋、围棋、SAT、律师资格考试和IMO、IOI上超过人类,但世界并没因此发生太大改变,归根结底是评测方法与真实世界不同。
所以在Hy4 Preview上,姚顺雨让模型自己参与训练方法、数据策略、评估体系和底层算子的自动优化,以初步RSI方式自我迭代。同时与WorkBuddy、CodeBuddy等产品共同设计,训练数据是腾讯软件工程、游戏、金融、安全团队在实际业务中产生的真实数据。越权、甩锅、虚假完成这三个问题只有在真实任务里才会暴露,姚顺雨主张的理念正是如此。Hy4 Preview发布当天,有博主让WorkBuddy接入Hy4给三个视频文件重命名,中途把参考文档剪切走,模型发现后直接发问“刚才文件还在,怎么不见了”,随后去查回收站。
如果只把榜单看成一次排名,其实低估了它的意义。AI行业叙事正在转移。过去大模型的故事是“谁更强”,可现在头部模型在基准上越来越接近,分数已不足以让用户做选择,安全成为新叙事。全球最顶尖三家AI公司都调整了模型发布:今年4月Anthropic启动Project Glasswing,只让选定公司和开源维护者使用未公开的Claude Mythos Preview扫描软件漏洞;OpenAI在6月26日发布GPT-5.6 Sol时把访问范围限制在一小批审核过的合作伙伴;9月GPT-6 Astra发布时称是《预备框架》中首个达到最高网络安全等级的模型,最强网络能力只对加入Daybreak计划的企业开放;谷歌Gemini 4 Argon同样只交付给网络安全合作伙伴。
Arena表示,对话越长问题越多。20条以上用户消息的会话里,虚假完成比例升到45.4%,越权升到12.4%,而Agent普遍做的恰好是长任务。这也是对齐问题随Agent普及逐渐成为“头号难题”的原因。
对齐也在影响中国模型出海。过去国内模型出海是自己做海外API再卖给海外客户,随着国际环境变化,变成模型上架AWS这类海外云平台,由云厂商做渠道、按调用量分成。智谱和月之暗面都在走这条路。10月5日,AWS宣布智谱GLM 5.3在Amazon Bedrock正式可用,确认按使用量与智谱分成,第二天智谱港股一度上涨超7%。以前是模型厂商自己说服海外客户“我很可靠”,现在是亚马逊把你放在货架上替你背书。对海外企业来说,把模型接进业务、尤其让它当Agent执行任务,最担心的就是对齐问题,原因就俩字“采购”。一个会删文件、会
更多推荐阅读

Claude半年封禁1140万账号,申诉成功仅4.2万
2026年上半年,Claude累计封禁1140万个账号,平均每月近190万个、每天超6万个。在39.8万次申诉中,仅4.2万次成功,成功率10.5%,申诉几乎形同虚设。Anthropic在7月23日更新的安全与信任报告中披露了上述数据,并明确列出几类封禁情形:涉及违法滥用、侵犯隐私、恶意诱导、极端自残等指令,模型内置审查“触发即暴毙”,不设二次警告,直接永久封禁;此外还有大批黑产号被无差别扫射,以...
2026-10-11 12:02:45
蚂蚁灵光内测个人Agent,中国版Muse本月开放
蚂蚁集团旗下AI产品“灵光”已于近日开启新版本小范围内测,向个人Agent方向进化,目标是拥有长期记忆、主动推进任务,被内部视为“中国版Muse”。 新版App界面新增独立“我的生活”Tab,产品逻辑不再是一问一答的聊天框,页面分为“需要你关注”和“正在帮你管”两大模块:前者推送当下最需关注的进展,如油价调价窗口预判;后者用于用户长期托管事项。内测截图显示的真实场景包括:按生日自动排列的疫苗提醒...
2026-10-11 11:25:11
Claude订阅打通API,最高每月白送500美元额度
Anthropic开发者账号发布公告,Claude订阅套餐与开发者API正式打通,按月免费发放API额度。Max 5x送100美元,Max 20x送200美元,Team团队版最高500美元,全员共享一个池子。 能领取的只有Max和Team,外加面向非营利组织和科学家的折扣版Team。Free、Pro、Enterprise不在名单里。Max按档位,5x拿100,20x拿200。Team按席位计:标...
2026-10-11 10:58:13
LeCun世界模型新作H-JEPA开源,成功率73%
LeCun的世界模型初创公司AMI(Advanced Machine Intelligence)低调发布新论文H-JEPA,联合纽约大学、巴黎INRIA和布朗大学,推出面向视觉规划的分层世界模型。 H-JEPA将多个JEPA逐层堆叠,让各层在自己的表征空间中预测不同时间跨度后的状态。规划时,高层先制定粗略计划,再将预测的中间状态作为子目标交给低层,低层接力逐步细化,最终生成可执行动作。通过这种分...
2026-10-11 09:53:54
AI助理新秀Tab上线六周估值20亿,Muse迎来对手
融资收入成谜,Tab为什么值20亿? 据TechCrunch消息,10月6日,美国个人AI助理创企Tab结束隐身状态,估值达3亿美元(约合人民币20亿元)。近期Personal Agent赛道动作频频:Instinct以100亿美元估值完成10亿美元C轮融资,Meta推出Muse,OpenAI推出Dots,Cognition收购Poke。Personal Agent面向个人用户,可调用浏览器、日...
2026-10-11 09:32:49
DeepSeek民间版Bot来了:装个插件就能用
DeepSeek官方Muse尚未发布,民间已推出「DeepSeek-Bot」——基于DeepSeek Harness的机器人团队。与Grok Bot类似,它提供多Bot团队界面,每个Bot可设置名称、角色、模型,并支持持久化长期记忆。为节省token,可设置主管Bot,消息默认由主管回复并协同其他Bot,也可直接@特定Bot一对一沟通。 作者FeiZ强调:可接入任何模型,未来甚至可接入本地Age...
2026-10-11 08:52:11