主要来源宝玉
查看原文事件专题 ·多源确认
Brood War Bench 实测:主流大模型打《星际争霸》不敌人类新手
Ben Swerdlow 开发了 Brood War Bench,让通用大模型以智能体形式对战 1998 年的《星际争霸:母巢之战》,结果没有一个模型超过人类新手水平。Codex Astra 以 18 场全胜排第一,靠的是派 Probe 工人去对方基地骚扰,经济运营和大规模作战反而偏弱。Claude Fable 排第三,胜率 83.3%,会老实发展经济、爬科技树,甚至造出过 Mutalisk、研究到圣堂武士科技。Grok 4.6 最差,在一场 43 分钟的比赛里输出超 11000 个推理 token,只发出 6 批指令,全程没造一个战斗单位。一个会用光子炮速推的人类新手就能赢下所有模型,测试平台已在 bw.swerdlow.dev 开放。
当前结论
Grok 4.6 想了 43 分钟没造一个兵,让大模型打《星际争霸》,结果全员输给新手,翻车过程挺好看。
10 个信源54° AI 热度最后更新 2026/9/21 18:12:28
证据链
10 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。