事件专题 ·多源确认

SWE-Prometheus:用 60 个代码仓库评测工程治理能力的新基准

SWE-Prometheus 是一个评测编码智能体工程治理能力的新基准,任务从修 bug 扩展到识别仓库风险、排序干预并验证改动,覆盖 6 个治理维度、共 60 个仓库。10 个模型在 22 个仓库的公开子集上评测,平均 Normalized Governance Improvement 介于 0.0568 到 0.5760,行为破坏率在 0% 到 23% 之间。一个与仓库无关的模板在冻结的 10 仓库批次上取得平均 NGI 0.272,但增益集中在 Tests & CI、Quality Gates 和 Documentation,在 Reproducible Environment 与 Dependency & Security 上没有提升。论文还报告了 no-op 条件的中位 NGI 为零,两名教师在 60 个维度评分中 exact agreement 达 57 个,并指出包含行为失败的对比中 Kimi-K3 占优。

当前结论

给做代码智能体的朋友:这个新基准不测修 bug,测的是治理仓库,10 个模型里 Kimi-K3 在完整对比里表现最好,评分方法也挺有意思。

6 个信源44° AI 热度最后更新 2026/9/24 12:23:52

证据链

6 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。