AlphaGo作者:十年了,LLM还没学到第37手的精华

AlphaGo作者:十年了,LLM还没学到第37手的精华

AI 资讯 来源:新闻/公众号 发布时间:2026-10-05 更新于 2026-10-05 预计阅读 5 分钟

2016年3月,首尔四季酒店,人机大战第二局,AlphaGo落下第37手,现场解说一度怀疑程序出错。最终AlphaGo以4:1击败李世石。李世石赛后说,那一手让他改变想法,认为AlphaGo有创造力。

十年后,AlphaGo核心作者之一Thore Graepel却指出,那一手所依赖的能力,今天的AI恰恰没有。他离开Google DeepMind去创业,目标是给机器装上真正的推理能力。他在MIT Technology Review发文,标题直接:“别被骗了——LLMs不会推理”。图灵奖得主Yann LeCun对此表示赞赏,强调真正的推理必须涉及搜索,LLM不具备这一能力。

AlphaGo核心作者:十年了,LLM还没学到那场棋局「神之一手」的精华

Graepel认为,第37手不是“灵光一闪”,而是推理的产物。AlphaGo由策略网络和搜索机制组成:前者提供直觉,后者显式构建博弈树,逐一推演未来。第37手在策略网络眼里概率仅约万分之一,是搜索机制发现它通向更好终局。这相当于卡尼曼所说的系统1与系统2在机器上的合体:神经网络提供直觉,搜索负责检验。缺一不可。

对比1997年深蓝,靠人类硬编码规则,每秒评估2亿个位置,向前看六到八步。围棋复杂度完全不同,一颗子价值取决于几十回合后的消长,穷举需几十亿年。AlphaGo不是靠算力碾压赢的。

AlphaGo核心作者:十年了,LLM还没学到那场棋局「神之一手」的精华

今天的LLM本质是预测下一个token,就是系统1在运转:快速、联想式,但没有“想一想再回答”。思维链让模型先生成中间步骤,提升实打实,尤其在数学和代码上。但Graepel指出,这些中间步骤仍是同一个预测token的过程,只是多迭代了一会儿,并未引入真正独立的推理机制。直觉被拉长,但没有变成审慎。

他列出三个短板:第一,模型没有明确、可持续更新、可供检查的认知状态;第二,没有做到“知道什么”和“如何运用知识”的分离;第三,思维链看起来像深思熟虑,但研究显示模型经常事后编造,答案是走一条路得出的,报告却是另一条路。

AlphaGo核心作者:十年了,LLM还没学到那场棋局「神之一手」的精华

在高风险领域,结论和如何得出结论同样重要。出错时需要定位错在哪一环。只会事后编故事的系统无法被信任和追责。这正是Graepel离开DeepMind的原因。他认为需要全新机器推理路径,灵感来自AlphaGo:维护认知状态,明确哪些已确认、存疑、排除、开放;推理就是改变认知状态的动作,包括推导结论、拆解问题,以及决定下一步问什么、算什么、做什么实验。

开放世界比下棋难得多。但LLM等神经模型提供了零件:可以提议解决路径,通过API和代码与工具交互,评估论断是否被证据支持。系统里必须有独立“裁判”,按“这一步消解了多少不确定性”评估推理动作,只有证据支持才更新信念。Graepel称之为“打了兴奋剂的科学方法”,目标是产出经得起审视的知识。

文章最后他说:靠把系统1做得更大,到不了可信任的机器智能。规模能磨利直觉,但磨不出审慎。第37手之所以重要,是因为机器守住局面、称量未来,然后选中了连自己直觉都大概率否决的棋。人类社会需要更多这样的“神之一手”,在药物发现、新材料、气候、医疗诊断等领域。这样的洞见只会来自真正会推理的系统:结论出自可审计的证据、推断与信念修正链条,而不是事后编出的令人信服的故事。

文章发表后在X上引发争议。多伦多大学教授David Duvenaud质疑:Graepel给LLM定的三条罪状,放在人类身上同样成立。Graepel回应:单靠自己也推理不好,给纸笔就好得多,再遵循科学方法才算出色推理者。诀窍是把过程结构化。Duvenaud追问:那给LLM配上类似工具,就能实现真正推理了?这该不会正是你打算做的事吧?还有网友指出,纸笔是工作记忆外挂,并未无中生有改变推理能力,但写下来的文字和数字恰好是可检查的认知状态证据。也有人问:人类推理等于现有模型加外挂系统,那你是要构建内部推理能力比两者都强的模型?Graepel尚未回复。另一种声音则认为这场讨论多余。

标签: AI 资讯 AI

更多推荐阅读

Muse爆火背后:个人Agent如何获得持久记忆

Muse爆火背后:个人Agent如何获得持久记忆

Meta个人智能体Muse的爆火让95后沈俊潇有些兴奋。三年前他曾在Meta Reality部门,负责为Meta Ray-Ban背后的AI助手提供智能服务。当时还没有Muse项目,但Meta做消费级个人助手的想法早有迹可循。Muse上线5天下载量突破73万,第10天登顶美国App Store免费应用总榜第一,上涨速度超过早期ChatGPT。 沈俊潇博士毕业于剑桥大学,是Memories.ai创始...

2026-10-05
何恺明团队让AI摘掉眼罩,Claude满分打穿AGI考试

何恺明团队让AI摘掉眼罩,Claude满分打穿AGI考试

何恺明团队新论文VISTA在X上引发关注。论文显示,过去半年顶尖大模型在ARC-AGI-3测试中表现不佳,原因是官方只给模型一张64×64的数字表,相当于让人闭眼听坐标玩游戏。VISTA团队将数字表换回图片,GPT-5.6 Sol分数从13.33跳至47.32;同时看图更省算力,文本版一局烧7190万Token,图片版仅3070万,分数更高。 VISTA核心是给模型配一本无损视觉记忆“相册”,每...

2026-10-05
DeepSeek弹性计算团队扩招资深工程师

DeepSeek弹性计算团队扩招资深工程师

DeepSeek弹性计算团队再次大规模招聘,尤其需要资深工程师。三周前刚招过一轮,此次未发岗位JD,而是发布技术分享《DeepSeek弹性计算(DSec):面向大规模Agent训练的沙盒基础设施》。 DSec是支撑DeepSeek-V4全部训练、评测和数据预处理流程的沙盒基础设施。从V3.2到V4.1,Agent训练、评测和数据预处理产生的全部沙盒负载均已运行在DSec上。目前一套DSec扩展分...

2026-10-05
2026年了,AI旅游攻略为何仍不靠谱

2026年了,AI旅游攻略为何仍不靠谱

国庆前的9月,Personal Agent成为热点。扎克伯格将Muse定位为“personal superintelligence”,称其拥有云端和浏览器,可跨应用完成任务、记住偏好,并在用户退出App后继续工作。OpenAI的Dots也强调主动接管邮件、账单、购物和旅行规划。然而,无论是通用AI助手还是Personal Agent,做旅游攻略都差些意思——看似会做,却不会以人的思路去做。 作者...

2026-10-05
Hinton等20余位AI大牛联合警告:智能爆炸时代将至

Hinton等20余位AI大牛联合警告:智能爆炸时代将至

由剑桥大学人工智能科学与政策项目发布、二十多名研究者共同撰写的报告,作者包括 OpenAI 首席科学家 Jakub Pachocki、Anthropic 联合创始人 Jack Clark、微软首席科学官 Eric Horvitz,以及 Geoffrey Hinton、Yoshua Bengio 和 Dawn Song 等人。报告并未宣布“智能爆炸”已经发生,而是试图回答:当越来越多 AI 研发工作...

2026-10-05
AI破译433年前教皇密信,50万金币改写法国王室历史

AI破译433年前教皇密信,50万金币改写法国王室历史

GPT-6 Astra与Claude Opus 5.5几乎同时破译了两封1593年天主教联盟的绝密信件,这是433年来无人能解的密码。信件揭示:法兰西国王亨利四世改宗天主教、登上王座的背后,是一笔高达50万埃居(约合当时法国王室数月财政收入)的政治献金。信中牵出教皇、西班牙王室、法国天主教联盟及罗马权力核心的内部背叛。 两封信写于1593年7月22日,作者是天主教联盟领袖马耶讷公爵的秘书蒂博·德...

2026-10-05
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部