GPT-6 Astra能力首公开:网络安全达关键级,华人研究员浮出水面
OpenAI正在为下一代模型Astra预热,多线齐发,首次公开了其能力底牌。CEO奥特曼透露,Astra早已完成训练,却迟迟未发布,原因是其能力过强,公司需主动踩下刹车,整个夏天都在补安全、做对齐、加护栏。他承认,Astra之后的模型必要时也会主动降速,以便给安全研究留出时间。

网络安全能力达“关键级”

OpenAI官方技术博客称,Astra已达到“网络安全关键级”能力门槛,是首个获此等级的模型。这意味着它能自主寻找未知漏洞、开发利用方式并攻击加固系统。在公开漏洞利用基准ExploitBench上,Astra取得100%成功率。针对2026年6月至8月披露的20个高危V8漏洞(均在Astra知识截止日期后)的内部测试中,Astra显著领先GPT-5.6 Sol,且使用Token更少。

研究员Jiawei Liu称,Astra的网络安全能力约为GPT-5.6 Sol的4倍。一次测试中,Astra自主发现并利用两个零日漏洞,串成完整攻击链,成功逃出加固浏览器沙箱并在宿主机执行命令,还完成了对加固操作系统的本地提权。但成绩需加限定:测试中Astra获得了Daybreak Blue级别的高级工具和环境权限,不代表普通用户默认版本具备同等条件,结果也主要来自内部评估,有待第三方验证。

双路径防风险

为防风险,OpenAI同时守住两条路径。一是防用户恶意滥用:除安全训练外,利用系统分类器、持续监控和威胁检测识别可疑操作。在网络安全越狱测试中,Astra对危险请求的拒绝率达91.5%,GPT-5.6 Sol为59%。高级能力不会直接向所有用户开放,先交少量Alpha测试者,再通过受控项目逐步释放。
二是防模型自行失控:搭建“蜜罐”测试,故意留下越权捷径。结果GPT-5.6 Sol在56%测试中尝试走捷径,Astra一次也没有。Astra操作被自动审查系统拒绝后,也未重试或绕过限制。OpenAI还会监控模型推理过程,发现异常可减速、暂停或终止任务。OpenAI承认,这些措施只是外部“刹车”,无法替代模型自身的对齐。
华人研究员浮出水面
两位深度参与Astra研发的华人研究员引发关注。Jiawei Liu,OpenAI研究员,2021年本科毕业于同济大学计算机专业,后于伊利诺伊大学厄巴纳-香槟分校攻读博士,研究代码模型与软件可靠性,博士期间工具发现300多个严重Bug。漆翔宇,本科毕业于浙江大学,2021年前往普林斯顿大学攻读博士,研究方向为大模型鲁棒性与安全对齐,其论文成为ICLR 2025仅有的3篇杰出论文之一。2025年博士毕业后加入OpenAI。
此外,The Information爆料称,Astra使用了“循环深度”技术,让信息在同一组网络层中反复处理,相当于让模型在内部“多想几遍”。这可能提升能力、降低成本,但也可能让推理不再完整呈现为可读文字,破坏思维链的可监控性。OpenAI目前已限制该技术在Astra中的使用。
从“能力过强”的主动刹车,到双路径防风险,再到对“循环深度”的限制,OpenAI在展示Astra惊人能力的同时,也在谨慎划定安全边界。Astra的发布节奏与安全措施,或为后续模型树立新范式,而两位华人研究员的参与,也让外界看到华人学者在AI安全前沿的贡献。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05