在这场科技竞赛中,哪怕是最优秀的人工智能也会因思虑过重而遭遇惨败。在《星际争霸:母巢之战》中,Grok 4.6以43分钟、11138个推理token和6次指令的绝望记录,未能动员出一个作战单位。无论是推理到最顶端的Grok,还是在榜单上熠熠生辉的GPT-6 Astra,游戏的结局却截然不同:Astra在18场对战中全胜,战绩完美。这个名为Brood War Bench的星际大模型排名,近期在硅谷程序员聚集的Hacker News上引发热议。
Brood War Bench榜单的前十位中,Astra无疑是耀眼的明星,以最高推理档位xhigh赢得每一场比赛。而Grok则窘迫地在末尾徘徊,未能逃脱败绩的命运。OpenAI的成员Peter Steinberger,作为OpenClaw的创始人,不忘在社交网络上为自家模型宣传:“新榜单来袭。”如今,AI在破解数学难题上已屡创佳绩,一些专家甚至感叹奇点已至,引得陶哲轩公开呼吁减缓前进的步伐。然而,排行榜的作者Ben Swerdlow却对这一幕持有不同态度,他强调:即便是表现突出的GPT-6 Astra,也难以胜任一名普通人类新手的挑战。Hacker News的评论区有人一针见血地指出:“它们并不是无法下棋,而是需要过多时间。如果模型在思考时可以暂停游戏,它们就能顺利进行。”甚至有人打趣道:“简直像是在宣扬这些模型并非通用智能一样。”
究竟是什么导致这最强大的AI在《星际争霸》里被思维拖沓?它们距离真正的通用人工智能究竟有多远? MK体育
这一榜单的诞生可谓充满戏剧性。最初,开发者Ben仅是在做一个全由智能体操作的星际版本,邀请几个朋友一同参与。尽管这些朋友在星际的操作上几乎毫无经验,却在比赛中表现得丝毫不逊于老玩家。秘诀简单而直接:只需输入指令“进攻”,接下来的兵员生产、集结和作战均由AI完成。这样的尝试让Ben产生了好奇:如果完全不干预,让这些AI自主进行对战,它们能存活多久?于是,GPT、Claude和Grok三大AI体系的19名选手被召集,展开了一场规模庞大的171局对抗赛。
这场比赛在Freestyle的云端虚拟机上进行,每局比赛都独立运行,AI的每一步思考和游戏数据均被完整记录。虽然在解数学题和编写代码上,大模型可以从容思考数分钟再做出回应,然而在《星际争霸》这样的实时战略游戏中,却无暇思考。这里没有回合制的思维方式,只有瞬息万变的战场拼杀。在每一秒的思考之中,对手的工人正疯狂采矿,兵营不断生产新兵。而老一代的AI仍试图以回合制的方式来应对这种即时战略游戏,结果是在思考之际己方的基地已被攻陷。
这一切都是Grok的真实写照。在编号为G043的比赛中,Grok显示出超凡的战术思维,却因迟缓的行动而惨淡收场。它在43分钟的游戏里,尽管进行了长达数分钟的战略推理,却仅发出了6次指令,平均每次行动间隔超过7分钟。这并非个例。在G003中,Grok仅仅制造出3个机枪兵,却始终未能带队进攻敌方基地;在G002中,尽管造出了2个狂热者,依然无果于响应。虽然造出的兵员不少,却始终未能抵达对面的阵营。数据极其清晰:比赛进行到11分钟时,Astra已经拥有实力雄厚的军队,而Grok的战场上仅有不足7个工人和寥寥几个士兵。更讽刺的是,Grok的经济储备远超Astra,原本手握948块水晶矿,却连一个能上场的兵员都未造出。在这残酷的战场上,长时间的思考并不能算是深思熟虑,反而成了被动挨打的根本原因。 MK体育
反观Astra,其获胜的秘诀在于施加压力,让对手陷入深思。其所在的Codex家族早已掌握了骚扰策略,通常是派遣一个普通的采矿工人穿越整个战场,目标直指敌人基地。从人类玩家的视角来看,这种毫无威胁的工人随便派遣两个工兵就能驱逐。然而,在AI之间,这一策略显得极具威慑力。对手的AI在看到这个工人后,立刻陷入深思,浪费数十秒进行复杂的计算,思索如何应对。在这短暂的时间窗口中,它们的基地却陷入停滞。最终,Astra轻松摧毁了Grok的主基地,而Grok仍未能掀起一场反击,账面上尚且存有928块水晶矿。
在这种快速的即时战略游戏中,骚扰不仅仅是破坏对方经济,甚至在AI与AI的对抗中,有时会导致对手直接陷入宕机。当然,Astra也并非无懈可击。其背后的操作就像一个不和谐的团队,每个子智能体都在各自的领域内孤立运作。新兵刚成立便被立刻派往前线,却不懂得如何进行适当的集结。不过,通过人工干预,Ben发现只要亲自指挥将各个智能体的行动串联起来,Astra便能迅速掌握集结以及时机把握的能力。