AITOPAI热报
今日全部早读
地区
东盟中国趋势
外观
登录 / 注册
AITOPAI热报

FrontierSWE

共 4 条相关 AI 资讯
9月3日
06:47
06:47elvis@omarsar0
ProximalHQ 发布 FrontierSWE v2 超长编码基准测试,更新了任务套件和方法论。测试显示前沿模型间存在巨大性能差距,Claude Fable 5.1 领先优势明显,超过 25 个百分点。该基准专注于超长视野编码任务,是评估前沿模型能力的重要工具。
论文FrontierSWEFable 5.1Claude

推荐理由:ProximalHQ 推出了超长编码基准 v2,Claude Fable 5.1 在测试中大幅领先其他模型。
原文
05:03
05:03Suhail@Suhail
Proximal公司发布了FrontierSWE v2,这是一个更新的超长视野编程基准。新版本v2扩展了任务套件并改进了方法论。基准测试显示前沿模型之间存在较大性能差距,Claude Fable 5.1以显著优势领先。
AI模型FrontierSWEProximalHQClaude Fable 5.1
事件专题

推荐理由:Proximal发布了新版编程基准FrontierSWE v2,Claude Fable 5.1在测试中表现最佳。
原文
7月16日
09:15
09:15官方账号xAI@xai
Grok 4.5 在 Proximal 的 FrontierSWE 基准测试中综合排名第二,仅次于 Claude Fable 5。在实现与性能维度上同样位列第二。在研究能力维度上排名第一,超过 Opus 4.8、GPT-5.5 和 GLM-5.2。该基准测试评估模型在真实软件工程任务中的表现。
AI模型Grok 4.5FrontierSWEProximal

推荐理由:Grok 4.5 在代码基准上超越 GPT-5.5 和 Opus 4.8,研究能力还拿了第一,值得关注。
原文
6月17日
04:01
04:01elvis@omarsar0
GLM 5.2 在 FrontierSWE 基准上排名第 3,得分仅次于 Fable 5 和 Opus 4.8,并超越 GPT-5.5。这是首个缩小 Anthropic/OpenAI 与其他提供商之间差距的模型,同时也是目前最强的开源权重模型。该成绩展示了开源模型在编码任务上的竞争力。
AI模型GLM 5.2FrontierSWEGPT-5.5
事件专题

推荐理由:GLM 5.2 在编码基准上干掉了 GPT-5.5,开源里最强,值得关注。
原文
今日全部早读东盟登录