OpenAI官宣AGI时代:GPT-6 Astra多项测试满分
OpenAI今日正式发布下一代旗舰模型GPT-6 Astra,总裁Greg Brockman在发布会上宣布,OpenAI已实现AGI,世界正式步入AGI时代。这一宣言将人工智能的讨论从“接近人类”推向“全面超越”的新阶段。

多项测试刷新纪录,AGI宣言底气何在

GPT-6 Astra被定义为“世界上最智能、对齐程度最高”的模型,其基准测试成绩令人瞩目:FrontierMath Tier 4得分97.6%,ARC-AGI-3达99.9%,ExploitBench漏洞利用更是拿下100%满分。在编程领域,Astra被称为迄今最适合软件工程的模型,Terminal-Bench 4.0得分57.7%,DeepSWE v1.1达74.1%。这些数字背后,是OpenAI迄今最大训练算力的支撑——超10万块GPU,以及训练监督中首次由先前AI模型发挥重要作用的创新。

从计算机使用到科研突破,能力全面开花

Astra的“计算机使用”能力实现代际飞跃,可完成用户在电脑上能做的任何事。演示中,它能在KiCad中完成PCB布局,填写美国报税表,制作Power BI报表。在Agents' Last Exam中得分59.3%,OSWorld 2.0中得分72.6%,单项任务耗时较上代缩短约47%。其新增的跨上下文窗口笔记与检索机制,为长时间运行的智能体提供外部记忆,可保存关键信息并支持历史搜索。

在知识型工作方面,Astra可执行多步骤工作流并直接生成文档、表格和演示文稿。AutomationBench得分41.4%,BenchCAD几何重合度达95.9%。它还能延续企业既有PPT的版式与语气,补全整套演示文稿,并更懂得何时该询问用户或自主决策。
科研领域,Astra解决了十个“菲尔兹奖级别”数学难题,并改进了两个关于“素数间隙”的结果:将相邻素数间距上限从240推进到186,改进了一个80多年未变的界中项。其推理能力开始与计算机使用合流,可直接操作专业科学软件。
安全评级史上最高,但最强能力暂缓开放
安全方面,GPT-6 Astra被OpenAI判定达到网络安全“Critical”阈值,这是其史上首个获此评级的模型。然而,因内部测试发现两个未知day0漏洞,最强网络安全能力暂不完全开放,目前先向少量机构开放Daybreak Access。
价格方面,GPT-6 Astra输入每百万Token 10美元,输出每百万Token 50美元,暂未全面开放,未来几天将陆续向ChatGPT Plus、Pro及API用户提供。
从基准测试到实际应用,GPT-6 Astra展现出AGI级的多面能力,但安全考量与技术开放之间的平衡,仍是其走向普及的关键一步。AGI时代已来,而人类与AI的协作边界,才刚刚开始重新定义。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05