AITOPAI热报
今日全部早读
地区
东盟中国趋势
外观
登录 / 注册
AITOPAI热报

权重平均

共 1 条相关 AI 资讯
5月28日
11:29
11:29官方账号arXiv cs.AI@Kunhao Zheng, Pierre Chambon, Juliette Decugis, Jonas Gehring, Taco Cohen, Benjamin Negrevergne, Gabriel Synnaeve
精选
该研究探讨了在代码强化学习(RL)中,通过外推权重平均(extrapolative weight averaging)能否在不额外训练的情况下,扩展微调检查点之间的帕累托前沿。研究者针对竞争性编程任务,使用嵌套单元测试覆盖(从低覆盖到高覆盖)训练检查点,发现正确性与效率之间存在权衡:高覆盖奖励减少优化失败但增加正确性失败,整体解决率不变。通过低覆盖和高覆盖检查点的插值可恢复该前沿,而外推则能超越训练端点。该现象在纯推理、工具使用和智能体编码三种推理设置以及32B和7B两种模型规模下均成立。外推权重平均的集成方法在LCB/hard基准上,以相同样本预算将pass@250提升了3.3%。结果表明,嵌套单元测试覆盖诱导的前沿可通过外推权重平均进行导航、扩展和利用。
论文代码RL权重平均正确性-效率前沿

推荐理由:代码RL领域首次系统揭示正确性与效率的权衡前沿,做编程竞赛或代码生成优化的团队可以直接用外推权重平均提升模型性能,无需额外训练成本。
原文
今日全部早读东盟登录