19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手

  新智元报道

  想太多,就连最聪明的 AI 也会被拖死。

  43 分钟、11138 个推理 token、6 批指令——0 个作战单位。

  这是 Grok 4.6 在《星际争霸:母巢之战》里交出的一张绝望成绩单。

  游戏中,把推理拉到最高档位 xhigh 的 Grok,从开局苦思冥想到游戏结束,硬是连一个能上场打仗的兵也没造出来。

  而在同一张榜单的另一头,GPT-6 Astra 同样火力全开,18 战 18 胜,胜率 100%。

  这两天,这份名为 Brood War Bench 的星际大模型榜单,在硅谷程序员扎堆的 Hacker News 上火了。

  Brood War Bench 榜单前 10 名。Astra 开最高推理档 xhigh,18 战全胜,Grok 三个档位全在榜尾。

  如今已是 OpenAI 员工的 OpenClaw 之父 Peter Steinberger,不忘转发为自家模型造势:新榜单来了。

  AI 正在数学圈连破世纪难题,有人惊呼奇点降临,势头猛到让陶哲轩都公开发声要放慢脚步。

  可这份榜单的作者 Ben Swerdlow,一开篇就甩出一个画风完全不同的判断:

  就连全胜冠军 GPT-6 Astra,也打不过一个人类新手。

  Hacker News 评论区有人一句话点破要害:「它们不是玩不了,只是需要太多时间。你要是在模型思考的时候把游戏暂停,它就能玩。」

  还有人直接开嘲:「搞得好像这些模型不是通用智能一样。」

  全网最聪明的 AI,为什么会在星际里被自己的思考拖死?

  是不是离 AGI 还远着呢?

  游戏永远不会停下来等你

  这个榜单的诞生,有点戏剧性。

  起初,开发者 Ben 只是做了个全靠智能体操作的星际版本,拉上几个朋友一起玩。

  这帮人几乎没碰过星际,可打起来却一点不输玩了好多年的老炮。

  他们的秘诀简单到离谱:只管打字喊一句「进攻」,造兵、集结、开打,全交给 AI。

  这让 Ben 不禁好奇:如果人类彻底闭嘴,让这些模型自己玩,它们能活多久?

  于是,GPT、Claude、Grok 三大家族的 19 名 AI 选手悉数登场,一场 171 局的 AI 大乱斗就此开打。

  比赛跑在 Freestyle 的云端虚拟机上,每局单开一台机器,同时开打,游戏数据和 AI 的每一步思考记录全都留了底。

  做数学题、写代码,大模型可以发呆 5 分钟再一次性交卷。

  但打星际不行。

  这里没有 AI 习惯的回合制,只有一刻不停的实时战场。

  你思考的每一秒钟,对面的农民(英文玩家叫 worker,负责采矿的工人单位)都在狂挖矿,兵营在疯狂爆兵,大部队已经朝你家高地冲了过来。

  老一代模型还拿回合制的路数打这种即时战略游戏,结果脑子还在转,家已经被推平了。

  Steinberger 的帖子下,有网友一语道破:

  有意思,难怪 AI 做游戏的时候,总爱做回合制的。

  Grok 苦想 43 分钟

  一个兵也没上场

  把这种回合制思维演绎到极致的正是 Grok。

  在编号 G043 的对局里,Grok 堪称思想上的巨人、行动上的矮子。

  它疯狂输出大段大段的战略推理,但 43 分钟的游戏里,总共只发出了 6 批指令,平均 7 分多钟才动一次手。

  这不是偶然。

  G003 里,Grok 造了 3 个机枪兵,始终没走到敌人基地;G002 里,它造了 2 个狂热者,同样没能穿过地图。

  兵是造出来了,就是打不到对面。

  最高推理档位下它 2 胜 15 负,惨不忍睹。

  数据曲线很直观:比赛打到 11 分半,Astra 早就兵强马壮,而 Grok 场上平均只有不到 7 个农民和几个兵。

  搞笑的是,Grok 的国库里,其实躺着远超 Astra 的巨额存款。

  钱在兜里,大脑在运转,就是死活不动手。

  Astra 的农民和狂热者拆掉了 Grok 的主基地,Grok 手里一个作战单位都没有,账上还躺着 928 块水晶矿。

  在星际这种残酷的战场上,想得久可不叫深思熟虑,叫挂机等死。

  Astra 的必杀技

  让对手想到死

  如果说 Grok 是被自己想太多拖死的,那 Astra 就是专门逼别人想太多,把对手活活拖死。

  Astra 所在的 Codex 家族,最绝的一招是骚扰。

  它经常只派一个最基础的采矿农民,横穿整张地图跑到敌人家溜达。在人类玩家眼里,这种战斗力为零的农民随手拉两个工兵就能赶走。

  但在 AI 局里,这招简直是降维打击。

  对面的 AI 只要一看到这个农民,瞬间陷入沉思,花上几十秒去疯狂计算「我该怎么处理这个农民」。

  在这宝贵的几十秒里它什么都不干,基地彻底停摆。

  Astra 的骚扰部队拆掉了 Grok 的主基地,Grok 手里一个作战单位都没有,账上还躺着 928 块水晶矿。

  在即时战略游戏(RTS)里,骚扰对方是为了破坏经济;到了 AI 对 AI,骚扰的最大杀伤力,是把对面的 AI 直接拖到宕机。

  当然,Astra 也有弱点。

  它的内部像是一个不和睦的草台班子,管经济的、管造兵的、管打仗的各干各的。

  新兵刚造出来就被管打仗的 AI 拉去前线白给,完全不懂什么叫集结部队。

  不过作者也发现,只要他亲自下场当总指挥、把几个子智能体串起来,Astra 立刻就懂得攒兵、挑时机了。

  Codex 家族还有一股顽强劲儿。

  有一局,Astra 的兄弟 GPT-5.6 Terra 部队全军覆没,主基地也被拆了。

  它把仅剩的一个指挥中心(人族建筑可以起飞)拉上天,一路飘到地图另一头的角落,硬是又撑了 6 分钟才被消灭。

  最像在打星际的是 Fable

  全场好几局都想让作者替它使劲儿的,其实是游戏优等生 Fable。

  它的打法最正,老老实实搞经济,踏踏实实发展科技树,很少投机取巧。

  有一局它憋出了飞龙;另一局,它把神族一整排高级建筑挨个盖齐,连出高阶圣堂武士要用的圣堂档案馆都造好了。

  比赛打到 11 分半时,农民、兵力、建筑、科技,Fable 几项数据都压着 Astra。

  可好学生未必能拿第一。

  Fable 虽然胜率高达 83.3% 排在第三,却依然追不上 Astra。

  有一局它科技摆满了一桌子,还没等转化成战斗力,就被 Claude Opus 5 乱拳打死。

  Fable 盖满了兵营、重工厂和学院,账上还躺着 2800 多块晶矿,却被自家 Opus 5 的枪兵一路推平。

  节奏上也差得很远:Astra 的对局时长中位数只有 8 分 10 秒,爱慢慢种田的 Fable,这个数字被拖到了 10 分 37 秒。

  三个大模型,三种灵魂。

  Codex 像个满肚子坏招儿的街痞,Grok 像考场上死磕第一题的轴学霸,而 Fable 则是那个翻着攻略逐字逐句照做的老实人。

  想得越久

  不一定打得越好

  既然想太多会死,那是不是脑子越空越好?

  也不全是。

  GPT-5.6 Sol,推理开到最高档,胜率反而垫底,还不如 medium 档。

  可到了 Astra 这里,想得越深赢面越大,最高档直接拿下 100% 胜率。

  更有趣的是账单。

  Astra 开到最高推理档,每分钟只操作 12.6 次,平均一局只花 10.54 美元;换成最低档,操作频率翻倍到每分钟 25.7 次,一局反而要烧掉 21.07 美元。

  最高档位,出手少一半,花钱少一半,赢得最多。这说明新一代模型显然已经进化了。

  它们懂得了思考是需要成本的,也知道什么时候该停下脑子去动手干活。

  7 年前 AI 赢过职业选手

  今天为何打不过新手?

  有人肯定会问:7 年前,DeepMind 的 AlphaStar 不是早就击败过职业选手了吗?

  没错。2019 年初,DeepMind 公布了 AlphaStar 的战绩:两个5:0,横扫职业选手 TLO 和 MaNa。

  2019 年,AlphaStar 对阵职业选手 MaNa 第二局。下方是 AI 的决策过程:读取局面、判断往哪打、造什么兵,同时预估胜负。

  10 局比赛,职业选手一局没赢。

  后来,DeepMind 给它加上了和人类一样的限制:只能通过屏幕镜头看局部地图,每秒能做的操作次数也被压低。

  就这样,它又匿名混进欧洲天梯,一路打上宗师段位,超过 99.8% 的人类玩家。

  一边是天梯前 0.2%,一边连会光炮快攻的新手都打不过。

  难道是 AI 的技术倒退了?

  其实,两者比的根本是两码事。

  AlphaStar 打的是《星际争霸 II》,更像是纯粹的应试机器:靠吃海量录像和疯狂自我对战堆出来的星际特长生,这辈子只学了这一件事。

  而今天这些在初代《母巢之战》里对战的大模型,是没有任何星际基础的通才。

  它们全靠临场读题、调用工具、现学现卖,而且每一步都得先想完才能出手。

  专才打败职业选手并不稀奇,通才想要跨界通关,还要再等等。

  文章最后,作者抛出自己的结论:

  AI 冠军再无敌,也防不住人类新手最爱用的光炮快攻。它们组织不起复杂的阵型,也执行不了长远的战术。

  过去几年,我们给 AI 出的都是回合制考题,问来问去只有一句:你算得对不对?

  可星际不一样。它和自动驾驶、具身机器人一样,身处一个不会暂停的世界,对手随时在动。

  这场测试,也暴露了 AI 走向自主行动时最要命的短板:烧掉更多思考 token,未必换来更强的智能体。

  下一阶段的 Agent 之争,比的可能不再只是谁想得更深,而是谁能在有限的时间里,把观察、决策、执行连成一个不停转动的闭环。

  星际里的翻车,或许就是 AI 进入真实世界前的一次预演。

  参考资料:

  https://bw.swerdlow.dev/report?utm_source=chatgpt.com

  https://x.com/steipete/status/2101748820237500557

  编辑:元宇