事件专题 ·多源确认

Google 论文提出 RRSI:防止智能体 harness 自动进化过拟合基准

Google 的论文研究智能体 harness 自动进化中的过拟合问题:Meta-Harness 在 Harvey LAB evolve split 上达到 93.0,但在 JobBench、GDPval 和 APEX-Agents 三个分布外基准上仅提升 0.3 到 1.5 分。RRSI 在提议者侧加入随时间收缩的编辑预算,在评估侧用 critic 拒绝基准特定编辑、pruner 清理代价过高或无用的编辑。RRSI 在 evolve split 上得 90.5,但在三个 held-out 基准上提升 3.5 到 4.7 分,同时把每轮 token 消耗从 3.80M 降到 2.42M。配合 Gemini 3.5 Flash,RRSI 将 Terminal-Bench 2.1 成绩从 64.6 提到 78.7,并将 2.2 分的提升迁移到 SWE-bench Verified。

当前结论

Google 这篇论文值得做 Agent 的人细读:自动优化 harness 会让你 eval 分数涨但真实任务变差,RRSI 用双向正则化解决了这个问题。

3 个信源73° AI 热度最后更新 2026/9/23 20:13:02

证据链

3 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。