事件专题 ·多源确认

Brood War Bench 实测:主流大模型打《星际争霸》不敌人类新手

Ben Swerdlow 开发了 Brood War Bench,让通用大模型以智能体形式对战 1998 年的《星际争霸:母巢之战》,结果没有一个模型超过人类新手水平。Codex Astra 以 18 场全胜排第一,靠的是派 Probe 工人去对方基地骚扰,经济运营和大规模作战反而偏弱。Claude Fable 排第三,胜率 83.3%,会老实发展经济、爬科技树,甚至造出过 Mutalisk、研究到圣堂武士科技。Grok 4.6 最差,在一场 43 分钟的比赛里输出超 11000 个推理 token,只发出 6 批指令,全程没造一个战斗单位。一个会用光子炮速推的人类新手就能赢下所有模型,测试平台已在 bw.swerdlow.dev 开放。

当前结论

Grok 4.6 想了 43 分钟没造一个兵,让大模型打《星际争霸》,结果全员输给新手,翻车过程挺好看。

10 个信源54° AI 热度最后更新 2026/9/21 18:12:28

证据链

10 个信源
相关来源 1歸藏(guizang.ai)
查看原文
相关来源 6eric zakariasson
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。