12:06官方账号arXiv cs.LG@Peixuan Han, Runhui Wang, Ketan Ramaneti, Jie Hao, Gerald Friedland, Chris Kong精选73°Cliff是一种新的奖励塑造策略,利用现成LLM识别推理过程中的首次错误。该方法将推理分解为正确前缀和错误后缀两部分,并将此信号转换为令牌级优势。在12种不同场景的实验中,Cliff的推理性能表现优异,比在线蒸馏方法提升15%,比标准GRPO提升7%。即使使用能力适中的教师模型,Cliff也能有效提升RLVR的精细监督效果。论文CliffRLVR强化学习推荐理由:研究人员提出Cliff方法,通过识别首次错误来改进强化学习,性能提升显著且适用性广。原文稍后读已读值得跟进有用关注 Cliff
11:40官方账号arXiv cs.LG@Christophe D. Hounwanou, John Emeka Eze, Yaé U. Gaba该研究结合大型语言模型与强化学习,将LLM规划器和RL控制器架构形式化为目标增强马尔可夫决策过程。研究表明,当LLM的状态进展分数作为有界势函数时,即使LLM评分不准确,形成的奖励塑造项也能保持最优策略集。研究者在小型MDP上验证了结果,包括四种势能配置,其中一种对抗性配置放大到基础奖励幅度的20倍。论文LLMRLMDP推荐理由:这篇论文提出了LLM反馈的奖励塑造方法,即使在LLM评分不准确时也能保持最优策略,比传统方法更可靠。原文稍后读已读值得跟进有用关注 LLM