10:44官方账号arXiv cs.LG@Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang精选73°研究人员提出PAC方法,结合优势衍生的可学习性和近期奖励增益两个信号,用于大语言模型的多任务强化学习。在多级推理和多领域推理两种设置下,PAC仅需更少的采样步骤就能达到相当的验证分数,并最终超越随机采样和基于优势的课程基线。该方法通过贝叶斯汤普森采样控制器在GRPO训练过程中分配任务资源。论文PACLLM强化学习推荐理由:PAC方法解决了LLM多任务RL中任务分配问题,结合优势信号和实际奖励增益,提升训练效率。原文稍后读已读值得跟进有用关注 PAC
10:26官方账号arXiv cs.AI@Baocong Zhang, Siliang Lu, Chenyang Li该论文提出一种结合基于物理的预测性安全滤波器的课程学习控制器,用于车辆运动与动力学控制。方法旨在缓解传统方法参数标定繁重的问题,同时提升学习控制的安全性和鲁棒性。在Python-CarSim平台上进行了验证,结果显示该方法在多种机动场景下具有更好的改进效果和可扩展性。论文CarSim课程学习安全滤波器推荐理由:这论文用安全滤波器和课程学习搞车辆控制,在CarSim上验证了,比传统方法省调参还更安全。原文稍后读已读值得跟进有用关注 CarSim
11:00官方账号arXiv cs.AI@Wendi Deng, Hang Du, Guoshun Nan, Haokun Tian, Jiaqi Yu, Xinlei Cao, Jaile Li, Jingfeng Chen, Ling Deng, Ting Li, Hao Yang, Jun Liu, Xudong Jiang, Sicong Leng多模态大语言模型在推理任务中常出现中间步骤有缺陷但最终答案正确的问题,影响可解释性。论文提出O^2-CritiCuRL框架,在离线阶段通过多轮次分析步骤标注轨迹估计步骤重要性,提取关键推理步骤;在线阶段采用逐步强化学习策略,用截断链引导模型推理缺失步骤。在多个多模态推理基准上达到SOTA,同时训练和推理效率更高。代码已开源。论文O^2-CritiCuRL多模态推理强化学习推荐理由:这篇论文提出了一种新方法,能解决多模态模型推理时中间步骤乱但结果对的问题,效果SOTA还更高效,做推理增强的可以看看。原文稍后读已读值得跟进有用关注 O^2-CritiCuRL
09:47官方账号arXiv cs.LG@Xiaoran Liu, Istvan David论文提出基于模型驱动的方法,通过混合遗传算法(结合全局搜索和启发式局部搜索)自动生成多组相似但不同的强化学习训练环境。方法将变异和约束表达为模型变换,由先进模型变换引擎操作化搜索过程。在野火缓解场景和课程学习(依赖环境家族的学习范式)中验证了方法的有效性。原型工具将手工开发环境家族的错误率降低,提升了可扩展性。论文强化学习模型驱动课程学习推荐理由:这篇论文提出用模型驱动和遗传算法自动生成RL环境变体,省去手写大量相似环境的麻烦,野火场景验证过,做课程学习的可以看看。原文稍后读已读值得跟进有用关注 强化学习
11:30官方账号arXiv cs.AI@Yichao Zhong, Yidan Lu, Yuhang Lu, Tianyang Tang, Haoguang Mai, Yixuan Pan, Tianyu Li, Li Chen, Jingbo Wang, Zhongyu Li, Peng Lu, Hongyang Li72°RoboNaldo 是一种三阶段运动引导课程强化学习框架,旨在解决人形机器人足球射门中的全身稳定性、高冲击力交互和精准度问题。它先用单一人踢参考动作学习稳定踢球先验,再适应固定球位置的任意球场景,最后扩展到移动球射门。在仿真中,RoboNaldo 的任意球射门误差比基线低 48.6%,射门速度提升 2.96 倍。在 Unitree G1 机器人上,从 3 米外射门平均误差为 0.73 米(任意球)和 0.86 米(移动球),触球后球速达 13.10 米/秒,达到职业球员射门速度的 59-71%。该工作为高动态人形机器人运动控制提供了新范式。论文人形机器人强化学习课程学习推荐理由:做足式机器人运动控制或强化学习的团队,RoboNaldo 的课程学习思路能直接借鉴——用单条参考动作引导复杂技能学习,解决了从仿真到真实部署的精度和速度难题,值得点开看方法细节。原文稍后读已读值得跟进有用关注 人形机器人
19:12官方一手arXiv: DeepSeek@Mingxiong Lin, Zhangquan Gong, Maowen Tang, Qian Li, Chuangchuang Wang, Jian Ma, Sutian Huang, Kai Tang, Haonan Lu精选论文发现GRPO算法存在两个效率问题:固定KL系数限制模型探索,均匀采样忽略中等难度题目的信息价值。提出FG-ExPO方法,包含两个轻量组件:基于准确率的自适应KL缩放(AKL)动态调整约束强度,以及高斯课程采样(GCS)聚焦模型学习前沿。在DeepSeek-R1-Distill-Qwen-1.5B和Qwen3-8B-Base上测试,AIME 2025 pass@32从63.33%提升至76.67%,8B模型平均提升2.66%。该方法在固定推理预算下扩大了模型有效探索空间。论文GRPO强化学习数学推理推荐理由:做LLM数学推理RL训练的团队,GRPO的KL系数和采样策略可以照搬这个改进,AIME 2025上13个点的提升值得一试。原文稍后读已读值得跟进有用关注 GRPO