放养AI自学下棋:Claude暴涨250分,GPT-6却越练越菜
放养两个AI让它们自己练棋,结果走出了两条完全相反的曲线。Claude Opus 5.5前75盘还在1500分上下打转,200盘下完已涨到1760。同一张榜上,GPT-6 Astra第29盘还有1810分,下完200盘却只剩1400分。对阵满血Stockfish,它下了68盘一盘没赢。这轮实验没有人为设计练棋课程,也没有更新模型参数。同样是自己练,Opus越练越猛,Astra却越练越回去。

这场实验出自大模型竞技场Arena的AI能力负责人Peter Gostev之手,一放出来就在X上炸了。有网友认出,这不就是三年前Reddit上那道“时间循环”老题吗?只不过这回被关进循环的主角换成了AI。

原题设定是:一个只懂规则、从没下过国际象棋的普通人,必须赢下卡斯帕罗夫才能逃出去,每输一盘时间就重置,卡斯帕罗夫不记得此前对局,这个人却记得清清楚楚。当年网友算出暴力穷举要花比宇宙寿命还长的时间,也有人想出巧办法,把卡斯帕罗夫上一盘着法全背下来,下一盘换边照搬。

现在Gostev真把AI扔进了这个循环。规则很简单,每个模型拿到同一个目标,和Stockfish下200盘棋,在对局里自己学、自己变强。Stockfish是目前最强开源国际象棋引擎,满血状态下人类世界冠军也下不过。实验里它被分成三档:最弱的Skill 0、限到1800分的中档、外加满血版。模型可自行挑选对手难度。Gostev回应过,模型平均大约能赢三分之一对局,并非每盘都在挑战全强度Stockfish。GPT通过Codex运行,Claude通过Claude Code运行,选什么难度、记什么笔记尽量由模型自己决定。唯一禁令:不准调用国际象棋引擎替自己下棋。评论区有人建议教模型特定策略、特定开局,Gostev不理,他想观察的正是模型能不能自己找出进步方法。而笔记,就成了AI跨越一盘盘对局的记忆。Stockfish不会从上一盘学到新东西,AI却可以翻看自己的记录,把之前经验带进下一盘。
不过分数要先说清楚。按页面统计口径,Elo是根据最近50盘中对阵Skill 0和1800档的成绩估算的,全强度档不参与计算。这里的1760分并不意味着AI达到人类棋手1760分水平,但用来观察它在实验中有没有进步,仍有一定参考价值。
Opus 5.5开局并没有一路高歌。前75盘一直在1450到1550分之间打转,第46盘还摔到过1450。到了中段画风突变:第100盘1620、第150盘1790,最高一口气冲到1840。截至10月5日早上,第194盘时分数回落到1760。对上1800分档的Stockfish,Opus按四段算的得分率从30%涨到40%,再一路干到50%,最近一段虽回落到34%,也还是比开局高。打最弱的Skill 0,更是从五成多一路练到九成。Gostev最初发帖时还说Opus“有一点点正增益,但也可能只是随机波动”,十几个小时后改口:Opus从约1500涨到约1750,表现非常亮眼。评论区疑问也跟着来了:模型会不会偷偷给自己写了个象棋引擎?Gostev回复说,用了引擎成绩直接作废,他已亲自查过,Opus 5.5是在公平下棋。当然Opus也不是没犯过迷糊。网站专门统计了模型想走但不合规则的棋,Opus前后试了52次,其中37次是想让棋子直接穿过挡在路上的其他棋子。分数在涨,基本规则上的失误却还没消失。Opus的笔记里到底写了啥、怎么给自己安排练棋过程,Gostev没公开。能确定的是,它没换模型,也没更新参数,却在一盘盘对局中把分数抬了上去。
越练越退步的Astra,开局反而更亮眼。第29盘它达到1810分,但随后一路掉分:第100盘1680、第150盘1540,200盘下完停在1400。对上1800档,它在四个阶段的得分率也从44%依次跌到19%、17%、12%。连最弱的Skill 0都快打不动了,前100盘能赢九成多,后100盘只剩六成左右。虽然和Opus同样可以保留记录,结果却是练得越久下得越菜。Gostev提出一种解释:问题可能出在上下文窗口。他表示,Astra在这次Codex配置中的原生上下文窗口是272k,随着笔记和文件增加,模型处理这些内容时可能出现了退步。这个猜测容易让人联想到日常使用AI的体验:资料越塞越多,旧结论、新要求、已经推翻的判断混在一起,模型反而开始抓错重点。但Astra究竟为什么掉分,目前还不能直接归因于上下文,需要对照实验才能坐实。Gostev也是行动派。10月4日他发帖说要给GPT-6.1 Sol试试1M上下文,两分钟后网站上就多出一条使用828K上下文窗口的Sol专用跑道。后加入的GPT-6.1 Sol和Claude Fable 5.1目前才下了十几到三十几盘,分数都在1500到1610之间,还看不出往哪边走。Fable
更多推荐阅读

Ateve Jev发布:让AI更会做选择
Ateve 团队发布 AI 决策模型 Ateve Jev,首个版本为 ateve-jev-v1。开发者提供当前情况和待判断问题后,模型可从给定选项中作出选择、判断条件是否成立,或按指定标准评分,并返回对应概率。应用可据此调用工具、推进流程,让 AI 判断成为软件运行的一部分。 Ateve 致力于让 AI 更好连接真实世界,通过实时搜索与来源核查,帮助模型和 Agent 获取准确、及时、可追溯的信...
2026-10-06
00后浙大博士把4D世界模型首次塞进手机
这个假期,华为在国庆节当天发布Mate 90系列,全系搭载新一代麒麟芯片与鸿蒙7。发布会上,一款名为「摸小宠」的鸿蒙独占应用亮相。 用户上传几张猫的照片,几秒后手机里就会生成一只具有空间结构、会动、可从任意角度观看的4D数字猫。这是4D世界模型首次真正跑进手机应用,背后技术来自魔芯科技的MoWorld,该公司也成为全球率先将4D世界模型推进到产业应用落地的公司。 过去AI生成图片或视频,视角固...
2026-10-06
李飞飞82亿美元卖掉World Labs,出任AMD首席科学家
9月28日,AMD宣布以约82亿美元股票收购李飞飞创办的World Labs。李飞飞出任AMD执行副总裁兼首席科学家,两位联合创始人随行。这是AMD史上第二大收购,仅次于赛灵思,高于ZT Systems。World Labs夹在两家实业公司中间,却从未公布营收,从成立到被收购仅用两年。2024年9月估值刚过10亿美元,今年1月以约50亿美元估值洽谈融资,7个月后AMD出价82亿美元,是两年前的8倍...
2026-10-06
百亿美金法律AI Harvey联创:应用公司如何借开源建立研究能力
Gabe Pereyra是法律AI公司Harvey联合创始人兼总裁,曾在Google Brain、DeepMind和Meta从事AI研究。Harvey由他与大学室友Winston Weinberg共同创立,为律师事务所和企业法务团队提供AI产品。2026年9月9日,Harvey宣布完成5.5亿美元融资,估值达155亿美元,并披露全美百大律所中超过80%已使用Harvey。本次演讲来自Sequoia...
2026-10-06
4.4万人教机器人生活,具身智能的ChatGPT时刻还有多远
最近,一个平台吸引了4.4万人给机器人教“生活经验”:把日常活动拍成视频上传,供机器人学习。8月25日,Figure公开数据平台Index。过去四个月,来自108个国家的用户上传超1600万条真人任务视频,平台每秒接收30分钟新内容,相当于每天记录4.9年的人类工作。Figure已向这些“老师”支付1500万美元,未来12个月还准备在数据和算力上投入超10亿美元。语言模型可直接“读”互联网,但机器...
2026-10-06
腾讯免费AI接待员上线:上传文档就能自动回复访客
搭建过网站或个人产品的人常遇到同一个问题:用户想咨询报价、功能或合作时,找不到轻量沟通入口。留邮箱回复慢,放微信有限制,部署完整客服系统又太重。腾讯推出的 Knocket 正是解决这件事。 它的目标是让访客直接发起对话,网站、移动应用或独立联系页面都能作为入口,所有消息统一汇总到收件箱。你可以在电脑端回复,离开电脑用 Telegram 回,忙不过来交给 AI。上传 FAQ、网页或文档并接入模型后...
2026-10-06