SWE-bench

general · 首次出现 2026-05-22 · 最近出现 2026-09-23 · 累计提及 107

综述

SWE-bench 近期进展

SWE-bench 是一个用于评估软件工程任务中代码推理能力的基准测试集,它包含了多种任务和评估指标,是研究者和开发者评估和比较代码推理模型性能的重要工具。

SWE-bench 近期进展

  • SWE-Prime:更少轨迹,更好性能 - 一项新的研究提出了 SWE-Prime,通过减少轨迹数量来提高代码推理性能,这一改进为代码推理模型的发展提供了新的方向。
  • PAIChecker:检测SWE-bench类基准中PR与Issue不对齐 - PAIChecker 工具被开发出来,用于检测 SWE-bench 类基准中预测结果与问题描述之间的不匹配,这对于确保基准测试的准确性和可靠性至关重要。
  • PhoenixRepair:多智能体框架提升软件修复策略探索 - 该研究提出了一种多智能体框架,旨在提升软件修复策略的探索效率,这对于自动化软件修复技术的发展具有重要意义。
  • 当前焦点与观察点

      SWE-bench 在软件工程领域的研究和应用正不断深入,其作为一个基准测试集的重要性日益凸显。观察点包括:
    • 代码推理模型的性能评估和比较。
    • 基准测试集的改进和扩展。
    • 软件修复策略的自动化和优化。

    相关报道

    10 条在档