AI安全新标杆:Astra模型展现自主漏洞利用能力
OpenAI最强新模型Astra可能即将发布,这是其首个达到“关键级”网络安全能力门槛的模型。在纳入2026年6月至8月披露的20个V8高危漏洞的内部测试集中,Astra取得了100%的任意代码执行成功率,而GPT-5.6 Sol仅为20%,且Astra使用的Token更少、效率更高。它还成功发现并利用了两个此前未知的零日漏洞,完成浏览器沙箱逃逸,并在加固操作系统中将权限从普通用户提升至root。OpenAI甚至为此推迟了部分训练和发布工作。

据《The Information》报道,Astra可能采用了一种名为“循环深度”的技术,模型可反复处理内部状态,在输出下一个Token前完成多轮不以文字形式出现的计算。这一新推理技术引发AI安全专家担忧。

关键级能力认证

9月1日,OpenAI公开博客确认,Astra已达到其准备框架中的“关键级”网络安全能力门槛,成为首个正式划入该级别的模型。这意味着模型能在无人类逐步指导下,从加固系统中寻找未知漏洞并开发利用方式,或自主设计端到端攻击策略。在ExploitBench评估中,Astra取得100%成绩;内部测试中,其成功率远超GPT-5.6 Sol且输出Token更少。测试期间,它还发现两个零日漏洞并组合成完整利用链,目前正向相关维护者披露。在专家评估中,Astra成功构造浏览器攻击链逃出沙箱,并在加固操作系统中将权限提升至root。

面对如此强大的模型,OpenAI罕见踩下刹车,推迟部分开发发布工作以加强训练基础设施、网络隔离和监控系统。发布后,普通用户无法直接获得最强网络安全能力,相关功能最初仅向少量测试者开放。OpenAI还测试了Astra绕过审核机制或攻击“蜜罐”系统的行为,结果显示其未出现类似尝试。

循环深度技术揭秘
关于能力提升,《The Information》解释为“循环深度”或“循环Transformer”技术。传统Transformer处理Token时信息穿过固定网络层,而循环Transformer让信息反复经过部分网络层,持续更新隐藏状态后再输出。这使参数量基本不变,但有效计算深度增加,代价是计算量增大。该思路并非全新,2025年2月马里兰大学团队已发表相关研究,训练35亿参数模型验证了效果。此后,Google DeepMind等机构提出MoR架构,国内团队也将类似思路应用于开源模型Nanbeige4.2-3B,采用固定两轮循环,Token效率保留约75%。
然而,循环模型存在风险:增加循环次数不保证正确利用额外计算,有时会“越想越错”。若Astra确实采用循环深度,OpenAI可能已找到在前沿规模稳定使用有限循环的方法。架构专家Sebastian Raschka认为,外界可能将此事过度神秘化,基础层复用并非复杂架构改动,也不会自动删除思维链。
OpenAI尚未公布Astra架构,外界无法确认具体方式。真正值得关注的是循环深度被推至何种规模,以及其在能力飞跃中的作用。安全专家担忧的核心在于,Astra能独立发现零日漏洞,其思考和行动计划藏于人类无法读取的内部状态,监管难度极大。OpenAI表示将为Astra部署额外思维链监控,评估显示监控系统能从思维链和交互记录中获得更多行为信息,仅观察最终行动时监控能力受限。
Astra的突破无疑将AI安全推向新高度,但如何在能力与风险间取得平衡,仍是OpenAI及整个行业必须直面的课题。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05