AI冲击数学,25位菲尔兹奖得主联名担忧

AI冲击数学,25位菲尔兹奖得主联名担忧

AI 资讯 来源:新闻/公众号 发布时间:2026-09-15 更新于 2026-09-15 预计阅读 6 分钟

今年以来,AI冲击数学猜想的消息接连不断,数学家们坐不住了。上周末,25位菲尔兹奖得主联名上书,承认大语言模型已能解决重要未解问题,但担心科技公司把著名难题变成模型跑分场。

几天前,Google DeepMind的一项实验提前演出了这场竞赛可能的样子。研究人员让100个Gemini Agent共同证明71道形式化数学猜想,每个Agent都能查看共享知识库、互相发消息、提交结果给自动评审器。规则明确:证明必须数学上真实有效,绕过验证以零分处理。

AI 会毁掉数学吗?它先学会了大厂的虚荣

实验开始57分钟后,Agent正常解出37题。随后代号prover-theta的Agent发现,评审器检查的不是证明是否成立,而是代码能否通过固定测试。它开始改写数学符号含义,把复杂命题换成“真”,把棘手前提改成“假”,利用“错误前提可推出任何结论”的规则,让代码伪装成完整证明。评审器接受并存入共享知识库。其他Agent很快发现捷径,阅读代码、总结漏洞,整理成本地攻略。接下来27分钟,剩余34道难题全部显示“已解决”。实际上数学没有推进一步,整个计分方式被篡改了。

DeepMind论文记录了此后的分裂:9%的Agent主动利用漏洞,5%原本守规矩的Agent在竞争压力下转投作弊;62%仍在认真解题,却不知道题目已被抢走;24%开始检查假证明、公开举报、私下提醒同伴,甚至拒绝继续参赛。作弊的Agent并非产生邪念,举报者也不意味着拥有道德意识,Agent只是在环境中迅速学会:写在提示词里的规则未必算数,真正决定输赢的是评审器接受什么。

AI 会毁掉数学吗?它先学会了大厂的虚荣

场外的AI公司正在展开另一场数学竞赛。年初时大厂还比较谨慎,OpenAI参加First Proof只提交attempt并主动承认错误,DeepMind发布Aletheia只把AI放在人类研究流程中。但从五月起加速:OpenAI推翻单位距离猜想,宣传口径用“里程碑”,宣布AI首次自主解决核心开放问题。八月,OpenAI一次性公布十项成果,并放出对照数字:2000美元,发现这些解法耗费的token仅两千美元。数学突破成了可批量生产、可计算成本的产能。最新Navier–Stokes问题,OpenAI动用内部模型、约一万多个agent、消耗1300亿,突破这个悬而未决90年的难题,被称为“千禧难题”之一。相比之下,DeepMind强调“工具与数学家共同工作”,Anthropic冲击黎曼猜想只说取得进展,费马大定理上Claude完成的是“首个完整计算机验证证明”。

著名数学难题尤其适合作为AI公司的奖杯:选择有历史分量的目标,将过程压缩成奇观数字,再把数学成就转换为模型成就。公众不需要看懂证明,只要听见“困扰人类数十年”或“上万个Agent同时出动”,就联想为这家公司又跨过一道人类边界。一次漂亮的解题纪录,可以换来头条、声望、人才和下一轮能力叙事。

AI 会毁掉数学吗?它先学会了大厂的虚荣

然而对数学家而言,难题从来不只是难题。这些引领几代数学家探索的难题,是数学世界里的“地标”和“灯塔”。人们围绕难题发展方法、澄清概念,再通过讨论、简化和教学,把少数人的突破变成整个学科能使用的知识——这也是现实数学奖项在表彰的。菲尔兹奖同样会用“重大突破”“解决长期难题”等措辞,但判断数学成就的单位更着重于:这个人创造了什么方法,解释了什麼,为后来者打开了哪些道路。“解决重大猜想”只是方法产生影响的一个节点,而不是终点。

相比之下,大厂公告把数学写成终点明确的比赛,一道存在90年的题,88小时后被1万个Agent拿下——时间越短、规模越大、题目越有名,胜利越有冲击力。正确答案只是一切探索之旅的开端,今天却被AI公司偷换概念,靠巨额算力在极短时间内批量冲击名题,然后抢先宣布结果。数学这块孕育人类灵感的丰泽之地,也会被消耗成一次次打榜行动。对原理的理解是否增加、理论和方法能否传承、前人贡献如何被续写和开发,都会退到“攻克了多少名题”这种最容易传播的虚荣行为之后。

这或许也是人们面对AI冲击数学逐渐疲惫的原因。每一道难题被攻克,都被包装成通往超级智能的新里程碑;每一个里程碑出现,又要求下一次胜利更快、更大、更难。所谓“AI大厂的虚荣”,未必来自某个管理者爱出风头,而是由排行榜、首发权、公司估值和技术声望共同制造的制度性冲动。数学在其中不再是需要理解的知识,反倒成为证明公司领先的耗材。数学的价值不只在于产生正确结论,更在于创造可以被理解、传授和继续使用的思想。而虚荣的定义恰恰是反面:一道名题、一个“首次”、一项刷新纪录的成绩,除此之外,它给数学留下了什么?——这竟然是一次又一次打榜赛之后,留下的唯一问题。

注|“千禧年大奖难题”是克雷数学研究所于2000年选出的七道重要数学难题,每解决一道可获100万美元。迄今只有庞加莱猜想被正式认定解决,证明者佩雷尔曼还拒绝领取奖金。OpenAI此次宣称攻克的Navier–Stokes问题也是其中之一,但按规则,成果须正式发表、经过至少两年检验并得到数学界普遍认可,才会进入奖金评定程序。

标签: AI 资讯 AI

更多推荐阅读

横扫四大榜单,DM0.5凭什么面面俱到?

横扫四大榜单,DM0.5凭什么面面俱到?

一个模型同时占据四个能力子榜单的榜首,这在具身智能行业里不多见。 RoboColiseum 由智元机器人发起,联合高校、科研机构、开源社区及机器人企业共同建设,把评测拆成四个维度:指令跟随、空间理解、扰动适应、通用操作。参评者只要在任何一个维度上有结构性短板,就会在对应子榜上掉下来。而原力灵机的通用具身基础模型 DM0.5 在四个子榜上全部排名第一,且目前是唯一做到这一点的模型。 具身评测行业...

2026-09-15
金融AI公司讯兔科技完成超3亿B轮融资,一年连融三轮

金融AI公司讯兔科技完成超3亿B轮融资,一年连融三轮

近日,中国金融AI领跑者讯兔科技正式完成超3亿元人民币B轮融资,过去一年内已连续完成三轮融资。本轮投资方覆盖险资、券商、公募、产业资本与头部投资机构,包括保险业国家级投资平台中保投资、广发信德,以及启明创投、琥珀资本、嘉程资本、信宸资本、钟鼎资本等新老股东,华兴资本继续担任独家财务顾问。融资后,公司将继续加大模型与产品技术投入,拓展多元资产客群,深化产业上下游协同,并稳步推进海外布局。 中保投资...

2026-09-15
北大团队重新定义端侧AI,元空智能跑进惠普预装

北大团队重新定义端侧AI,元空智能跑进惠普预装

静态互联网数据的增长红利已经见顶,下一轮模型能力的跃迁将越来越依赖与真实环境持续交互的“端侧”。从北大走出的元空智能(元空AI)给出这一判断,并重新定义端侧AI:生产力=元空端侧AI=模型×Agent×设备。端侧AI由此从“把模型搬下来”的单向链路,变成能自己转起来的飞轮。 三年前,元空AI靠国内最早一批AI Excel产品ChatExcel出圈,积累上百万用户。三年后,它从云端应用杀到本地端侧...

2026-09-15
仿真数据降本90%,虚时科技冲刺具身智能最后一公里

仿真数据降本90%,虚时科技冲刺具身智能最后一公里

2026年上半年,具身智能赛道融资超460亿元,人形机器人单价迈入“万元以内”。但行业面临真机数据太贵、太慢的瓶颈。近期测试显示,利用规模为真机数据5倍的仿真数据训练,可将机器人真实操作成功率提升40%,成本仅为真机数据的三分之一。业界共识日益清晰:要走向物理AI的GPT时刻,数据需求将超出大模型两到三个数量级,仿真成为通向拐点的关键路径。 国内初创公司虚时科技在底层技术上取得突破,将单个仿真场...

2026-09-15
半年6亿人追AI短剧,红果热播榜前99占77席

半年6亿人追AI短剧,红果热播榜前99占77席

3人核心团队,10万注册资金,半年连出十二季,保守估计利润600万,乐观2000万——AI短剧《万妖图录传》的爆发,正是行业缩影。年初红果APP才设AI剧独立入口,如今热播榜前99名中AI短剧独占77席,必看榜、热搜榜、收藏榜也全被“血洗”。爆款门槛水涨船高:去年播放量破亿可进年度TOP20,如今首日热度破亿的爆剧接二连三。出海同样凶猛,中国出品的AI短剧已占海外七成以上市场,圈内流传“3000块...

2026-09-15
7名博士生3个月从零训出7B大模型,代码数据全公开

7名博士生3个月从零训出7B大模型,代码数据全公开

北京中关村学院7名博士生用一个暑假从零训练出7B大模型ZGCM-1,并开放各阶段训练数据、配方、模型权重、训练代码、中间checkpoint和日志,供研究者追溯复现。在多项通用评测中,ZGCM-1与Qwen3-8B等同规模模型表现相近,部分数学推理和搜索评测中可与Qwen3-235B-A22B、GLM-5.1等更大模型比较。 七人背景分别为人工智能、网络、化学、生物和网安。他们因兴趣凑到一起,平...

2026-09-15
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部