8月28日
18:08
18:08官方账号arXiv cs.AI@Dewu Zheng, Ruizhe Ye, Yanlin Wang, Yang Ye, Hongyu Zhang, Ensheng Shi, Xilin Liu, Yuchi Ma, Jianxing Yu, Zibin Zheng
精选73°
SWE-Prime是一种多粒度、两阶段的SFT数据选择方法。该方法在轨迹级别筛选高质量代表性子集,在段落级别评估各段落对解决方案的贡献度和学习价值。实验显示,使用SWE-Prime选择的10%轨迹子集进行训练,在SWE-Bench Pro和SWE-Bench Verified基准上分别获得12.2%和24.2%的相对性能提升。
推荐理由:SWE-Prime用10%数据训练就能超越全数据效果,解决了软件工程领域模型训练数据质量低的问题。
7月21日
7月7日
11:39
11:39官方账号arXiv cs.AI@Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini
LLM-as-a-Verifier通过计算评分token logits的期望生成连续分数,替代传统的离散评分方法。该框架从评分粒度、重复评估和准则分解三个维度缩放验证能力,在Terminal-Bench V2上达86.5%,SWE-Bench Verified上达78.2%,RoboRewardBench上达87.4%,MedAgentBench上达73.3%。其细粒度信号可用于任务进度估计和RL训练,在SAC和GRPO上提升样本效率。论文还提供了Claude Code扩展,帮助开发者监控代理系统。
事件专题

推荐理由:这篇论文提出一种不依赖额外训练的验证框架,用连续分数替代离散评分,在四个agent基准上刷新了成绩,还顺手提升了RL样本效率。