SWE-bench Pro是AI编程领域的重要评测基准,用于评估模型在真实软件工程任务上的表现能力。近期OpenAI发现约30%的评测任务存在缺陷,引发了行业对其可靠性的广泛质疑。
SWE-bench Pro
product · 首次出现 2026-05-22 · 最近出现 2026-09-25 · 累计提及 38
综述
相关报道
10 条在档- Microsoft 提出 Taste-Bench:智能体在任务分叉点仅 59.7% 选对方向elvis
- 腾讯混元Hy4预览版登陆ClineHunyuan
- Auggie CLI 重构:每任务成本降53%,质量持平Augment Code
- TrajDebug:追踪错误生命周期识别长程智能体轨迹关键失败arXiv cs.AI
- Argus:面向长时程推理的通用智能体运行时arXiv cs.AI
- SuperScout:先侦察仓库再路由编码智能体,降低成本arXiv cs.AI
- OpenAI下调GPT-5.6系列价格,Luna输入降80%小互
- OpenAI 发现热门AI编程测试SWE-Bench Pro中约30%任务有缺陷Decoder
- OpenAI 指出 SWE-Bench Pro 约 30% 评测任务存在缺陷IT之家
- SWE-Bench Pro 约30%任务存在缺陷,OpenAI 撤回推荐shao__meng