论文Agent 与开发者10:27EnigmaForge 基准:不给问题只给故事,25 个模型直觉能力差 22 倍25 个模型在这个基准上只给故事不给问题,直觉成绩差了 22 倍,排名和常规榜单完全对不上,还有模型被自己的过滤器拦住,很值得细看。#EnigmaForge#基准测试#推理模型#SAT求解器aarXiv cs.AI@Daniel Eisner原文稍后读已读值得跟进有用关注 EnigmaForge