事件专题 ·单一信源

CMU 提出通过编辑 harness 代码优化智能体,4B 提案模型胜过 35B 教师

CMU 的论文提出 harness learning:用强化学习训练一个提案模型,读取任务、当前 harness 代码和执行报告后生成 harness 的代码修改,而 solver 模型权重始终不变。奖励信号为修改后 harness 的得分。在 Reasoning Gym 上,训练后的 4B 提案模型在单步修改任务中超过了 35B 的教师模型,并能泛化到训练中未见过的任务族。在 HotpotQA 上训练的提案模型还能持续改进 MuSiQue 和 2WikiMultihopQA 上的 harness。

当前结论

卡内基梅隆这篇论文挺有意思:不调模型权重,靠 RL 训一个 4B 小模型去改智能体外壳代码,结果干翻了 35B 教师,做 agent 的可以看看。

2 个信源44° AI 热度最后更新 2026/10/3 23:38:01

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。