19个AI血战星际争霸:GPT-6全胜仍不敌人类新手
想太多,就连最聪明的AI也会被拖死。43分钟、11138个推理token、6批指令——0个作战单位。这是Grok 4.6在《星际争霸:母巢之战》中交出的成绩单。把推理拉到最高档位xhigh的Grok,从开局苦思冥想到游戏结束,连一个能上场打仗的兵也没造出来。同一榜单另一头,GPT-6 Astra同样火力全开,18战18胜,胜率100%。这份名为Brood War Bench的星际大模型榜单,在Hacker News上火了。
榜单作者Ben Swerdlow开篇就给出判断:就连全胜冠军GPT-6 Astra,也打不过一个人类新手。Hacker News评论区有人点破要害:“它们不是玩不了,只是需要太多时间。你要是在模型思考的时候把游戏暂停,它就能玩。”

榜单诞生颇具戏剧性。开发者Ben起初做了个全靠智能体操作的星际版本,拉朋友一起玩。这帮人几乎没碰过星际,打起来却不输老玩家,秘诀是只管打字喊“进攻”,造兵、集结、开打全交给AI。Ben好奇:如果人类彻底闭嘴,让模型自己玩,它们能活多久?于是GPT、Claude、Grok三大家族19名AI选手登场,171局AI大乱斗开打。比赛跑在Freestyle云端虚拟机上,每局单开一台机器,游戏数据和AI每一步思考记录全都留底。
做数学题、写代码,大模型可以发呆5分钟再交卷。但打星际不行,这里没有回合制,只有一刻不停的实时战场。你思考的每一秒,对面都在狂挖矿、爆兵,大部队已朝你家高地冲来。老一代模型还拿回合制路数打即时战略,结果脑子还在转,家已被推平。

把回合制思维演绎到极致的是Grok。编号G043对局里,它疯狂输出战略推理,但43分钟游戏里总共只发出6批指令,平均7分多钟才动一次手。G003里造了3个机枪兵,始终没走到敌人基地;G002里造了2个狂热者,同样没能穿过地图。最高推理档位下2胜15负。比赛打到11分半,Astra早已兵强马壮,Grok场上平均只有不到7个农民和几个兵。搞笑的是,Grok国库里躺着远超Astra的巨额存款。Astra的农民和狂热者拆掉了Grok主基地,Grok手里一个作战单位都没有,账上还躺着928块水晶矿。
如果说Grok是被自己想太多拖死,那Astra就是专门逼别人想太多。Astra所在的Codex家族最绝的一招是骚扰,经常只派一个最基础的采矿农民横穿整张地图跑到敌人家溜达。人类玩家眼里这种农民随手就能赶走,但在AI局里这招是降维打击。对面AI一看到这个农民,瞬间陷入沉思,花几十秒疯狂计算“我该怎么处理这个农民”,基地彻底停摆。在RTS里骚扰是为破坏经济;到了AI对AI,最大杀伤力是把对面AI直接拖到宕机。

Astra也有弱点,内部像不和睦的草台班子,管经济、管造兵、管打仗的各干各的,新兵刚造出来就被拉去前线白给。不过作者发现,只要他亲自下场当总指挥把子智能体串起来,Astra立刻就懂得攒兵、挑时机了。Codex家族还有股顽强劲儿,有一局Astra的兄弟GPT-5.6 Terra部队全军覆没、主基地被拆,它把仅剩的指挥中心拉上天,飘到地图另一头角落,硬撑6分钟才被消灭。
最像在打星际的是Fable。它打法最正,老实搞经济、发展科技树,很少投机取巧。有一局憋出飞龙;另一局把神族高级建筑挨个盖齐。比赛打到11分半时,农民、兵力、建筑、科技几项数据都压着Astra。但好学生未必拿第一。Fable胜率83.3%排第三,却追不上Astra。有一局它科技摆满一桌子,还没转化成战斗力,就被Claude Opus 5乱拳打死。节奏上也差很远:Astra对局时长中位数只有8分10秒,爱慢慢种田的Fable被拖到10分37秒。三个大模型三种灵魂:Codex像满肚子坏招的街痞,Grok像考场上死磕第一题的轴学霸,Fable则是翻着攻略逐字照做的老实人。
既然想太多会死,是不是脑子越空越好?GPT-5.6 Sol推理开到最高档,胜率反而垫底,还不如medium档。可到了Astra这里,想得越深赢面越大,最高档直接拿下100%胜率。更有趣的是账单:Astra开到最高推理档,每分钟只操作12.6次,平均一局只花10.54美元;换成最低档,操作频率翻倍到每分钟25.7次,一局反而烧掉21.07美元。最高档位出手少一半、花钱少一半、赢得最多。这说明新一代模型已经懂得思考需要成本,也知道什么时候该停下脑子去动手干活。
有人会问:7年前AlphaStar不是早就击败过职业选手吗?2019年初DeepMind公布AlphaStar战绩:两个5:0横扫职业选手TLO和MaNa,10局比赛职业选手一局没赢。后来DeepMind给它加上和人类一样的限制,只能通过
更多推荐阅读

Bengio高徒Bonnie Li从DeepMind转会OpenAI
9月16日,谷歌DeepMind核心研究员Bonnie Li宣布离职,转会OpenAI。她曾深度参与Gemini 2.5/3、世界模型Genie 2/3及具身智能体Sima 2研发,并提到OpenAI在Ilya Sutskever主政时期的“Feel the AGI”口号。对曾以12:1人才净流入比傲视硅谷的DeepMind而言,这仅是冰山一角——其对主要竞对的人才留存比已骤降至2:1。 201...
2026-09-23
OpenAI神秘Aeon曝光,正面迎战Meta Muse
今天,OpenAI 正式发布 GPT-6 Sol 和 GPT-6 Luna,但外界更关心其个人 AI 智能体 Aeon(Codex Bot)何时推出。近两个月,个人 AI 智能体从边缘话题变成普通用户手机上的新图标。Meta 9 月 8 日推出 Muse,据 Business Insider 报道,其从美国应用商店排名第二跃升至第一,风头盖过长期霸榜的 ChatGPT。此前,xAI(现更愿被称作 ...
2026-09-23
阿里谷歌同时重做电脑,AI原生PC真要来了
在刚结束的高通骁龙峰会上,阿里千问展示了面向AI打造的PC产品Qwen Book。同时,首批Googlebook将于下月初发售,两者不约而同地使用相似定位:“AI原生电脑”。 过去两年的AI PC通常意味着增加一颗NPU并预装聊天助手。这一轮尝试有所不同,Google和千问都把改造深入到操作系统,AI不再等待用户打开单独窗口,而是主动读取屏幕内容、调用其他应用,并在后台持续完成任务。 首批Go...
2026-09-23
Meta的AI让真人代打电话,被骂到紧急撤回
路透社9月22日爆料,Meta正在为员工测试一项名为“human concierge”(真人礼宾)的新功能,让真人代替AI帮Muse用户打电话办事。用户将任务交给Muse后,Muse可将部分电话请求转交外部承包商,由真人拨打电话完成。该服务尚处内部测试阶段,未向普通用户公开,但消息传出后引发争议,Meta已紧急撤回该计划。 Muse是Meta新推出的AI应用,上线十天即登顶美国App Store...
2026-09-23
千问办公发布企业上下文,让Agent真正读懂公司
在大模型忙于刷 Benchmark 时,不能说话的 Jev 意外成为 AI 圈新顶流,反映出大模型应用价值正从“生成什么”延伸到“能否理解复杂信息并做出可靠判断”。在企业办公场景中,员工一句“帮我整理报价”背后可能牵涉客户历史、库存、折扣、审批权限和部门协作。AI 若只会生成文档而不了解业务背景,很难真正进入工作流。企业需要的是能理解业务上下文、知道与谁协作、清楚权限边界的 AI。 千问办公在杭...
2026-09-23
小米开源大模型登顶全球第一,罗福莉长文揭秘RL立功
9月21日,小米MiMo团队发布并全面开源新一代MiMo V2.6系列,包括Pro、Flash、Ultraspeed三款模型。其中MiMo V2.6 Pro在Artificial Analysis智能指数(AA Intelligence Index v4.3)中得分46,超过Kimi K3和Qwen3.8 Max,位列全球开源模型第一、国产模型第一。该榜单上,Fable 5.1得分53,GPT-6...
2026-09-23