SWE-bench Pro

product · 首次出现 2026-05-22 · 最近出现 2026-09-25 · 累计提及 38

综述

SWE-bench Pro是AI编程领域的重要评测基准,用于评估模型在真实软件工程任务上的表现能力。近期OpenAI发现约30%的评测任务存在缺陷,引发了行业对其可靠性的广泛质疑。

SWE-bench Pro 近期进展

OpenAI指出SWE-Bench Pro约30%评测任务存在缺陷,已撤回对该评测的推荐 OpenAI 指出 SWE-Bench Pro 约 30% 评测任务存在缺陷。OpenAI随后使用模型驱动代理和人工评审对SWE-bench Pro进行审计,试图提高评测质量 OpenAI 用模型驱动代理和人工评审审计 SWE-Bench Pro。腾讯混元Hy4预览版已登陆Cline,可能与SWE-bench Pro等AI编程评测有关 腾讯混元Hy4预览版登陆Cline。Auggie CLI重构后每任务成本降低53%,质量保持稳定,这反映了行业对AI编程工具优化的持续努力 Auggie CLI 重构:每任务成本降53%,质量持平。

当前焦点与观察点

SWE-bench Pro的缺陷问题引发了行业对AI编程评测可靠性的思考,未来评测体系需要更严格的验证机制。多家科技公司正在优化AI编程工具,如SuperScout通过先侦察仓库再路由编码智能体来降低成本 SuperScout:先侦察仓库再路由编码智能体,降低成本。长时程推理技术如Argus和TrajDebug的出现,可能为解决SWE-bench Pro中的长程依赖问题提供新思路 Argus:面向长时程推理的通用智能体运行时 TrajDebug:追踪错误生命周期识别长程智能体轨迹关键失败。OpenAI下调GPT-5.6系列价格,Luna输入降80%,这可能使更多开发者能够参与SWE-bench Pro等评测。

相关报道

10 条在档