06:47elvis@omarsar0ProximalHQ 发布 FrontierSWE v2 超长编码基准测试,更新了任务套件和方法论。测试显示前沿模型间存在巨大性能差距,Claude Fable 5.1 领先优势明显,超过 25 个百分点。该基准专注于超长视野编码任务,是评估前沿模型能力的重要工具。论文FrontierSWEFable 5.1Claude推荐理由:ProximalHQ 推出了超长编码基准 v2,Claude Fable 5.1 在测试中大幅领先其他模型。原文稍后读已读值得跟进有用关注 FrontierSWE
05:03Suhail@SuhailProximal公司发布了FrontierSWE v2,这是一个更新的超长视野编程基准。新版本v2扩展了任务套件并改进了方法论。基准测试显示前沿模型之间存在较大性能差距,Claude Fable 5.1以显著优势领先。AI模型FrontierSWEProximalHQClaude Fable 5.17 个信源在谈事件专题推荐理由:Proximal发布了新版编程基准FrontierSWE v2,Claude Fable 5.1在测试中表现最佳。原文稍后读已读值得跟进有用关注 FrontierSWE
09:15官方账号xAI@xaiGrok 4.5 在 Proximal 的 FrontierSWE 基准测试中综合排名第二,仅次于 Claude Fable 5。在实现与性能维度上同样位列第二。在研究能力维度上排名第一,超过 Opus 4.8、GPT-5.5 和 GLM-5.2。该基准测试评估模型在真实软件工程任务中的表现。AI模型Grok 4.5FrontierSWEProximal推荐理由:Grok 4.5 在代码基准上超越 GPT-5.5 和 Opus 4.8,研究能力还拿了第一,值得关注。原文稍后读已读值得跟进有用关注 Grok 4.5
04:01elvis@omarsar0GLM 5.2 在 FrontierSWE 基准上排名第 3,得分仅次于 Fable 5 和 Opus 4.8,并超越 GPT-5.5。这是首个缩小 Anthropic/OpenAI 与其他提供商之间差距的模型,同时也是目前最强的开源权重模型。该成绩展示了开源模型在编码任务上的竞争力。AI模型GLM 5.2FrontierSWEGPT-5.510 个信源在谈事件专题推荐理由:GLM 5.2 在编码基准上干掉了 GPT-5.5,开源里最强,值得关注。原文稍后读已读值得跟进有用关注 GLM 5.2