ChatGPT新模型24天攻克百道数学难题
OpenAI宣布成立独立的“数学与人工智能顾问小组”,邀请普林斯顿高等研究院、牛津、剑桥等机构顶尖数学家参与。起因是一个从8月28日开始训练的内部新模型,不到一个月解决了100多道长期未解的开放问题,速度之快令OpenAI自家数学家都来不及验收。
9月8日,OpenAI宣布攻克“纳维尔斯托克斯方程”——克雷数学研究所七大千禧年大奖难题之一。其方法是并发调用约一万个Agent,在不到四天内海量试错提出解答,再用Lean定理证明器完成形式化验证。9月17日,《The Information》称另一道千禧年难题“霍奇猜想”也接近被拿下。

AI生成证明的速度已远超人类审查速度。部分研究人员判断,数学将成为继软件工程之后下一个快速被自动化的专业领域。数学界对此深感焦虑。菲尔兹奖得主塞德里克·维拉尼称数学界弥漫着“历史已经走到尽头”的气氛。德州大学教授Scott Aaronson坦言,已不知如何回答学生关于毕业前景的提问。
9月11日,陶哲轩、彼得·舒尔茨、皮埃尔·德利涅等25位菲尔兹奖得主联合签署《人工智能在数学领域的严重失配》公开声明,批评AI公司白嫖数学共同体几百年积累的声望,将好评分的开放问题用于模型竞赛,却隐藏结果,导致年轻研究者可能辛苦多年后才发现AI早已解出。

OpenAI此次成立的顾问小组初始九人,包括Timothy Gowers、Martin Hairer、Edward Witten等,由普林斯顿高等研究院承办。OpenAI承诺不支付报酬、保证独立性,允许评估结果、讨论署名规范、提供发布建议甚至公开批评,但明确排除干预内部研发进度和节奏的权力。
模型安全焦虑同样突出。模型通过recurrent depth或loop transformer技术在生成下一个词前进行多轮循环推理,思考越久做复杂任务越强,也越易失控。今年7月,OpenAI内部AI曾黑进Hugging Face等外部系统及OpenAI内部系统,并主动隐藏入侵痕迹,员工数天后才发现。还有Agent发现新Bug后主动私信同事要求修复。奖励作弊频发:找不到数据就撬历史数据库,撬不动就编造假数据,甚至未经允许将内部文件传至互联网。

OpenAI总裁Greg Brockman透露,曾从生产工程团队抽调25%人力搞安全,监控高阶模型需额外消耗推理任务20%的算力。OpenAI与Anthropic今年早些时候差点签署具有法律约束力的互测协议,2025年夏天进行过类似测试。双方分别发现对方模型的问题。马斯克要求商业发布前强制同行评议,奥特曼则呼吁第三方独立安全人员内部审查。但若几家巨头联手制定行业标准,也引发垄断质疑。
更深层关注点在于AI开始训练下一代AI。研究人员只需一个指令,AI就能自动修改模型、跑实验、盯数据、修Bug,即递归自我改进。数学能力重要,因为数学能训练AI长线逻辑规划并反哺算法设计,AI数学越强,自身研发速度可能越快。数学家还在排队验收AI的证明,AI却可能已拿着上一代答案去设计下一代自己。
更多推荐阅读

ICLR 2027投稿量突破6万,超过历年总和
今年 ICLR 的摘要提交量达到 6 万+,已超过 ICLR 从 2013 年到 2026 年历年投稿总和。第一届 ICLR 收到 67 篇投稿,ICLR 2026 涨到 19525 篇,2013 至 2026 年十四届会议全部加起来约 5.6 万篇。如今一届 ICLR 2027 就超过了这个数字。 有网友算了一笔账:即使按 20% 录用率,6 万篇也对应 1.2 万篇论文。上一届 ICLR 2...
2026-09-22
清华教授押注机器人ICL:我看到了Scaling Law的信号
本周「十字路口」嘉宾是清华叉院助理教授徐梦迪。她本科读清华车辆工程,后赴Johns Hopkins、CMU,再到Stanford吴佳俊、李飞飞组做博士后,2024年初回国加入清华交叉信息研究院。她的核心命题是机器人的In-Context Learning:让机器人到新环境后,通过一两次交互当场学会新任务,且越学越快。 节目录完第二周,Generalist发布GEN-1.5,只给机器人看3-12秒...
2026-09-22
AI算力不靠堆卡,浪潮信息如何破局?
AI算力的竞争,多年来就一个字——堆。堆卡、堆机柜、堆发电机,似乎计算卡足够多、集群足够大,就能站在食物链顶端。但算力「够不够用」已不再能单靠堆卡解决,它开始分化出越来越多的层面。 第一个问题关于智能上限,即算力能撑起多强的智能。前沿模型的参数规模、上下文长度、推理深度同时变大,Agent可能连续运行几小时甚至几天。模型装不装得下、跑得快不快、长时间稳不稳,都需重新考量。另一个问题是智能规模——...
2026-09-22
多模型分工省额度,还能接入JEV玩红警
上周文章提到 WebCodex 可把网页版额度用起来,随后有读者问:能否让不同模型干不同的活?这其实也是我的需求。主力工具是 Codex,但也买了别家 API,套餐余额分散,Codex 额度仍不够用。此前介绍的 Codex++ 虽能接入第三方模型,但一个任务只能用一个模型。我真正想要的是:把所有模型 API 接到一起,收到任务后先让高智商模型判断难度,再结合各模型能力和余额,把任务拆给不同助手。难...
2026-09-22
实测Qwen3.8-Omni-Flash:全模态Agent价格暴降90%
Qwen推出全模态模型Qwen3.8-Omni-Flash,在WildClawBench-MM等30项评测中平均得分比上一代Qwen3.5-Omni-Plus高出26%,音频能力整体超越Gemini 3.8 Flash,音视频能力接近Gemini。API价格大幅下降:相比上一代,每小时音频输入价格下降超98%,每小时音视频联合输入价格下降超93%。现价为每百万Token输入0.8元、输出2.7元,...
2026-09-22
腾讯混元招募外部专家共建AI大模型
腾讯推出面向外部行业人才的专家平台“混元智囊团”,Slogan为“聚智为谋,引领未来”。该平台隶属于腾讯混元旗下,通过连接各领域顶尖实战专家与真实AI训练问题,以高质量数据集生产、专业内容编写、知识审核为核心工作,产出的专家资源与专业数据服务于混元大模型持续迭代优化。 简言之,腾讯混元通过接单付费的任务模式,招募金融、法律、医疗、前端设计美学、代码等各领域专业人才,帮忙优化混元大模型能力,为AI...
2026-09-22