AI首破人类未解数学难题:GPT-6 Astra独中五元
近日,一项针对AI数学能力的严苛测试结果引发关注:刚出道的GPT-6 Astra在Epoch AI和曼彻斯特大学联合发布的FrontierMath Erdős(FME)基准测试中,成功解出5道Erdős数学难题,成为唯一得分非零的模型。该测试包含68道人类未解难题,共有5个顶级AI模型参与,但GPT-6 Astra的标准测试得分率仅为3%,其余四个模型——GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1和Claude Fable 5——均交白卷。在放宽预算的追加测试中,GPT-6 Astra共解开5道题,展现了其在数学推理上的独特优势。
回应陶哲轩批评:FME基准的诞生

FME基准的推出,直接回应了数学家陶哲轩的批评。在2026年国际数学家大会上,陶哲轩指出,近期AI数学成果大多“不是在受控的科学条件下取得的”,存在成功率未知、算力不公开、人类引导不透明、数据可能污染及缺乏系统比较等问题。FME的设计逻辑正是针对这些痛点:首先,使用人类未解问题从根源上消除数据污染风险;其次,要求AI用Lean证明助手提交形式化证明,由内核裁决,确保验证的可靠性;最后,所有模型在相同条件下作答,每道题预算300美元、时限72小时、仅尝试一次,保证公平性。
此前的主流基准(如HorizonMath和FM:OP)依赖“生成-验证”模式,覆盖范围有限且验证不完全可靠。FME采用形式化格式,拓展了覆盖范围,并在验证环节使用两个隔离的无网络Docker容器——AI提交的代码由Comparator容器通过Lean内核重新编译验证,有效防范多种作弊手段。

68道难题:从652个开放问题中精选
这68道题由论文作者Thomas F. Bloom从erdosproblems.com网站的652个开放问题中精心挑选,标准是选最困难、最有数学意义的题目,解决任何一道都值得在顶级期刊发表。题目相互独立,包含许多Erdős高赏金问题。技术实现上,50条陈述取自Formal Conjectures库,其余由作者补充并审核。AI配备Lean 4工具链、SageMath、Python库及47.6万篇arXiv论文源码,为解题提供了充足的“弹药”。

五道破题:从反例到完整证明
GPT-6 Astra解开的五道题各具代表性:第1号问题源于Erdős 1931年提出的关于解离集密度的猜想,AI构造反例否定猜想;第74号问题反驳了1982年的猜想,证明色数至多为3;第126号问题证明了1934年的问题,给出|S(A)| ≫ n^{1/2}的强结果;第548号问题即Erdős-Sós猜想(1962年提出),AI给出完整证明;第571号问题关于Turán数增长阶,AI给出对任意有理数α的完整证明。
值得注意的是,获得这5个解的总尝试花费超过22万美元,而标准测试本身花费约2万美元。按3%成功率计算,解出一道题的期望成本约1万美元,凸显了AI数学研究的“烧钱”属性。论文也指出局限:形式化成本可能低估AI能力,且FME只衡量解题能力,而提出正确问题往往更难。
尽管成本高昂,GPT-6 Astra的突破仍标志着AI在数学推理上迈出了坚实一步——它首次在人类未解难题上证明了自己,而不仅仅是复现已知结果。未来,随着形式化验证技术的成熟和算力成本的下降,AI或将成为数学家探索未知领域的得力助手,但正如论文所言,解题之外,提出问题才是更高的智慧。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05