论文Agent 与开发者多源确认09:26SWE-Prometheus:用 60 个代码仓库评测工程治理能力的新基准给做代码智能体的朋友:这个新基准不测修 bug,测的是治理仓库,10 个模型里 Kimi-K3 在完整对比里表现最好,评分方法也挺有意思。#SWE-Prometheus#Kimi-K3#编码智能体#基准评测5 个信源在谈事件专题aarXiv cs.AI@Jiajun Wu 等 12 人6 个信源在谈原文稍后读已读值得跟进有用关注 SWE-Prometheus