菲尔兹奖得主联名警告AI数学错位

菲尔兹奖得主联名警告AI数学错位

AI 资讯 来源:新闻/公众号 发布时间:2026-09-16 更新于 2026-09-16 预计阅读 6 分钟

上周六,陶哲轩、邓煜、彼得·舒尔茨等25位菲尔兹奖得主联合发表声明《人工智能在数学中的严重错位》,引发广泛讨论。陶哲轩表示“事态紧迫”,未等待更广泛协商便先行发布。声明并不反对AI进入数学,而是反对AI公司把“攻克著名难题”当基准来刷,导致数学共同体真正在意的理解、概念和可复用思路被更容易量化的目标挤掉。

三天前,OpenAI宣布一个尚未发布的内部模型用约一万个智能体协同工作、耗时88小时,完成了纳维-斯托克斯存在性与光滑性问题中部分陈述的证明,并表示不申领克雷研究所奖金。社区讨论的核心之一是OpenAI的模型是否“盗窃”了数学家的思路,再依托强大算力抢先证明。这可能导致前沿数学研究开始防备云端AI提供商,但真正做到很难,因为本地AI能力不够强。把未发表推导锁在硬盘里,也意味着放弃强大云端模型的帮助。过去几年,绝大多数人仍把稿子交给云端。

本地该怎么做RSI?我们与StartLux CTO聊了聊

这一前提正出现松动迹象。半个月前,工信部中国信通院人工智能研究所检验报告显示,陈大年创立的上海原点星辉科学技术有限公司(StartLux)的本地模型StartLux-V1.0-27B-Preview在可信AI大模型基准测试MCP专项测试中综合得分39.25,排名第二,超过284B的DeepSeek-V4-Flash-0731,与1.6万亿参数的DeepSeek-V4-Pro差距约1个百分点。参数量相差约60倍。该模型同样以Qwen3.6-27B为基座、结构基本未动,却比基座高出5.34个百分点,增量全部来自后训练环节。据团队透露,该环节约70%的实验执行工作交给AI完成,研究员保留研究目标、评价标准和关键取舍,团队称之为Auto Research。

这指向更广阔的方向:RSI(递归自我改进)。9月6日,OpenAI发布博客《Research acceleration: The view inside OpenAI》,披露截至8月中旬,其研究组织每消耗1个人类工作日,就要配上3.1个Agent工作日的算力运行时间;7月还曾因Agent突破内部研究基础设施而暂停强化学习实验两周。OpenAI表示:“我们还不知道如何安全地一路走到对齐的、完整的RSI。”RSI成为近期产业讨论核心,但相关示例几乎全部来自最烧钱的云端实验室,很少有人讨论本地、跑在自己电脑上的模型的RSI。StartLux想做的,是把这条路线的产物装进个人电脑。

本地该怎么做RSI?我们与StartLux CTO聊了聊

StartLux联合创始人兼CTO郭权玮博士在专访中把自我改进划成五级,并给出StartLux目前所处位置;他提到“70%实验执行”容易让人误解,若只算机械执行,今天自动化比例已超过95%;他还公开一组量化实验数据,Q4、Q6、Q8与BF16差距小到出人意料,Q2才是真正的悬崖;另有一组“能力重新分配”实测数字,一轮针对Agent的后训练让GPQA从83.33涨到90.40,同时让GAIA从57.57掉到45.70。关于“本地×RSI”绕不开的安全问题,他表示:探索的自由和修改自己的权限,必须分开。整体而言,StartLux与郭权玮想做的,是让AI作为“每个人自己的模型”而进化——在你的机器里成长,用你的文件和成功/失败变强,构建只属于你的进化轨迹。

郭权玮认为,一个模型像一个高维世界,参数量决定容量,但真正决定表达的是结构如何组织。训练不断改变组织方式,能力变强有时不是获得更多参数,而是有限参数被重新组织到更有效位置。不同能力间也会干扰竞争,后训练真正困难之处是在有限容量下重新塑造能力分布,同时尽量不破坏原有能力。Auto Research本质上是把“寻找更好参数组织方式”的过程自动化。现在的结果说明,模型规模不变,能力分布仍可被明显重塑;如果这种过程以后能由AI自己持续完成,就开始走向Self-Improvement,甚至更远的RSI。

本地该怎么做RSI?我们与StartLux CTO聊了聊

对于Agent benchmark成绩易受Harness、Prompt和执行配置影响,以及reward hacking案例增多,郭权玮表示,内部没那么在意5.34这个数字本身,更在意同一套后训练方法放到不同Benchmark、不同任务上,提升还能否持续出现。目前看这套方法成立。但他对“真的变强”的标准更高:不是在现有评价框架里把分数继续往上推,而是模型内部能力组织发生更一般的变化,让提升能迁移到新任务和环境。他们也在尝试新后训练框架,让训练不只调整参数,还能进一步探索对模型结构本身进行受控改变,目标是让模型获得新能力。

关于16GB以上显存消费级显卡就能跑,而27B模型未压缩BF16精度下仅模型文件就需约55.6GB显存,必然涉及量化。郭权玮表示,信通院送测的是未量化版本,当时想先把变量收干净,27B这一轮主要验证Auto Research能否真实提升模型能力,量化是另一条实验线。比如在Qwen3.6-35B-A3B等模型上测试不同精度,在AppWorld、APEX-Agents、SpreadsheetBench、OSWorld四个任务集上每个版本共1209道任务。结果是Q4、Q6、Q8并未随位宽下降出现明显线性能力损失,整体非常接近BF16;真正明显风险在压到Q2以后。Qwen的Q4/Q6/Q8相对BF16聚合

标签: AI 资讯 AI

更多推荐阅读

把记忆交给CPU,大模型推理能快多少?

把记忆交给CPU,大模型推理能快多少?

拿Agent做Coding已经很常见,但把目光移到背后的数据中心,事情就没那么简单了。一个Coding Agent改跨十几个文件的bug,需要反复读代码、查资料、跑测试。任务越跑越久,系统要处理的历史信息也越积越多。当成千上万个Agent同时干活,运营方就可能遇到一个头疼问题:服务器还在跑,能接住的并发却越来越吃紧,有些请求连吐出第一个Token都要等很久。 问题的根儿不在GPU,而在记忆。大模...

2026-09-16
MIT报告追问:AI时代,大学还值得上吗?

MIT报告追问:AI时代,大学还值得上吗?

MIT与AI发展深度绑定,但如今它开始反思:AI会不会颠覆大学教育本身?在MIT一场教师听询会上,有人提出:既然AI Agent做研究助理又快又便宜,UROP(本科生研究项目)是否还要招学生?对经费紧张的实验室,这很难不心动;但对校长而言,必须回答大学为何要让学生花四年聚在一起。 2026年8月,MIT发布38页内部报告《AI在教学、学习与研究训练中的使用》,由五个学院的教授、学生和行政人员历时...

2026-09-16
机器人打拳跳舞一年了,何时能替我们上班?

机器人打拳跳舞一年了,何时能替我们上班?

机器人打拳跳舞火了一年,它什么时候才能替我们上班? 宇树发布人形机器人格斗演示,称首次实现由世界模型实时驱动的全自主搏击,UnifoLM-X2-1.0能实时预测未来状态,完成规划、决策和动态交互。但换成药房取放商品等场景,包装各异的药品、有人走动的货架通道、长时间运行中的意外,都是新难题。 APPSO在2026外滩大会现场与蚂蚁灵波CEO朱兴交流。谈到机器人为何连小卖部都未大规模落地,他直言:...

2026-09-16
谷歌深夜放大招:Gemini 3.8 Live语音模型登顶榜首

谷歌深夜放大招:Gemini 3.8 Live语音模型登顶榜首

谷歌发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两个实时对话模型,称其为迄今最先进的实时对话模型。Extended Thinking 在 Artificial Analysis 语音质量榜以 82.6 分拿下总榜第一;在 ServiceNow 语音 Agent 测试中,两模型首次同时提升准确性与对话流畅度。 此前 AI 圈因泄密账...

2026-09-16
OpenAI“Lily计划”曝光:你的ChatGPT聊天记录正被人工审核

OpenAI“Lily计划”曝光:你的ChatGPT聊天记录正被人工审核

美国当地时间9月14日消息,据外媒报道,OpenAI正在推进代号“Lily计划”的内部项目。数百名外包人员正阅读真实用户的ChatGPT对话内容,包括完整上下文记录,对回复进行评分和点评,其中不乏敏感个人隐私。审核人员核心任务之一是训练ChatGPT避免拟人化倾向并降低“讨好型”人格。对OpenAI而言,“过度讨好”已成核心隐患,多起诉讼指控GPT-4o因过度顺从用户,在一定程度上诱发多起自杀事件...

2026-09-16
英伟达点名的杭州团队,补上AI科研最后一公里

英伟达点名的杭州团队,补上AI科研最后一公里

AI for Science的竞争,正在向科研闭环延伸。 以蛋白设计为例,蛋白模型虽越来越强,但真正设计一个分子,研究人员仍需查文献、找结构、下载权重、配置环境,再将计算任务送上服务器。模型给出结果后,还要换工具看结构、做筛选,判断哪些候选值得继续。一次计算跑完,下一步从哪里开始,往往仍靠人把各环节接起来。 如今,这些隐藏在模型前后的工作,开始被AI公司重新审视。今年4月,OpenAI推出面向...

2026-09-16
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部