11:23官方账号arXiv cs.AI@Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang, Wenqi Zhang, Jintao Chen, Xuhong Zhang精选73°TASPO将特权监督转化为结果导向的行动信用,在三个智能体基准测试中比GRPO提高10.6%。该方法从验证的成功经验中构建决策适用的特权信息,在可执行行动级别聚合PI引起的似然变化。TASPO将相对行动支持转换为原始轨迹优势上的正、有界、均值保留权重,验证结果确定更新方向和平均规模。论文TASPO智能体GRPO推荐理由:TASPO解决了智能体政策优化中的监督-信用差距问题,让特权信息只重新分配行动间的信用,不改变整体更新方向。原文稍后读已读值得跟进有用关注 TASPO
10:44官方账号arXiv cs.LG@Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang精选73°研究人员提出PAC方法,结合优势衍生的可学习性和近期奖励增益两个信号,用于大语言模型的多任务强化学习。在多级推理和多领域推理两种设置下,PAC仅需更少的采样步骤就能达到相当的验证分数,并最终超越随机采样和基于优势的课程基线。该方法通过贝叶斯汤普森采样控制器在GRPO训练过程中分配任务资源。论文PACLLM强化学习推荐理由:PAC方法解决了LLM多任务RL中任务分配问题,结合优势信号和实际奖励增益,提升训练效率。原文稍后读已读值得跟进有用关注 PAC
09:33官方账号arXiv cs.AI@Menghan Liu, Elynn Chen精选73°VERA-8B是一个全新的端到端审计推理系统,能够在执法行动发生前识别审计风险。该模型首次将SFT和GRPO统一到同一证据标准下,超越了所有评估基线性能。审计工作无法容忍无依据的主张,因此模型引入弃权和不确定性资格来处理不确定或证据不完整的情况。研究团队还设计了AuditBridge将原始文件转化为可验证记录,再转化为审查就绪的报告。论文VERA-8B审计推理SEC文件推荐理由:VERA-8B是首个专门针对审计风险预测的模型,能将SEC文件转化为可审计报告,比传统金融语言模型更注重证据支持。原文稍后读已读值得跟进有用关注 VERA-8B
19:25官方账号arXiv cs.LG@Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang精选73°研究显示进化策略(ES)在LLM推理训练中表现优于GRPO方法。ES在Pass@1基准上提升性能,同时获得比GRPO更高的Pass@K分数。ES仅需更大模型中的较小种群规模即可有效工作。研究还发现ES的功能稀疏性表明大量参数移动不一定导致广泛功能变化。论文LLM进化策略GRPO推荐理由:这篇论文对比了ES和GRPO两种训练方法,发现ES能带来更广泛的推理覆盖,还提出了结合两者优势的GRPO-ES顺序训练策略。原文稍后读已读值得跟进有用关注 LLM
18:04官方一手arXiv: DeepSeek@Maciej Besta, Leonard Schmidt, Lara Nonino, Robert Gerstenberger, Pierre Pang, Patrik Okanovic, Ales Kubicek, Tiancheng Chen, Baraq Lipshitz, Torsten Hoefler精选73°本文系统化分析了RL-for-LLM范式,对PPO、GRPO等主流后训练算法框架进行了计算中心分析。作者提出了推理语言模型(RLMs)的并行策略分类法,涵盖数据、张量、流水线等传统技术以及解耦放置、阶段融合等新型并行技术。研究还分析了现有RLM框架,并构建了可扩展、快速且经济高效的RLM实践指南。论文RL-for-LLMPPOGRPO推荐理由:这篇论文帮你搞懂RL-for-LLM的并行训练策略,让DeepSeek-R1、o3这些推理模型训练不再那么烧钱。原文稍后读已读值得跟进有用关注 RL-for-LLM
05:25Latent.Space@latentspacepod在OPSD相关研究中,针对Continual Learning领域的遗留数据问题展开深入讨论;@rronak_团队阐述GRPO方法的局限性并提出调整方案;此次讨论会为行业研究者提供了专业的交流平台。论文OPSDContinual LearningGRPO推荐理由:@rronak_团队讲了GRPO在Continual Learning里的改进思路,想了解行业前沿的人可以去听听。原文稍后读已读值得跟进有用关注 OPSD
10:16官方账号arXiv cs.LG@Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison论文提出两种互补策略改进价值函数强化学习:特权价值函数(PVF)在不偏置策略目标的前提下注入额外token级信号;TETHER则根据价值函数准确性自适应地在组相对基线和价值基线之间插值。在多个推理任务上,这两种策略均稳定优于标准价值函数基线,并与平均基线GRPO相比具有竞争力或更优。论文LLMGRPO强化学习推荐理由:这论文提了两个新招PVF和TETHER,给LLM强化学习用的,比标准价值函数强,和GRPO差不多甚至更好,搞RL的可以看看。原文稍后读已读值得跟进有用关注 LLM
12:34官方账号arXiv cs.LG@Vatsal Venkatkrishna, Nico Daheim, Iryna GurevycharXiv新论文提出参数空间探索方法3PO(Perturbed Parameter Policy Optimization),通过从后验分布采样不同策略生成rollout,补充传统动作空间探索的不足。在OLMo-3-1025-7B和Qwen2.5-Math-7B上,3PO在数学推理和代码生成任务中平均性能优于标准GRPO,且FLOPs成本几乎相同。多参数采样还减少了训练中零优势组和错误rollout的数量。论文3POGRPO参数空间探索推荐理由:想提升LLM强化学习效果?3PO用参数采样替代温度调节,在OLMo和Qwen上比GRPO更稳更好,成本还一样。原文稍后读已读值得跟进有用关注 3PO
11:37官方账号arXiv cs.AI@Yubo Jiang, Fengying Xie, Zhiguo Jiang, Haopeng ZhangSKALD 是一种基于策略的自蒸馏框架,使用 Qwen3-Base 模型的两种上下文视图:仅问题的学生和基于抽象技能卡的教师。该方法通过退火指数倾斜目标稳定分布失配,并在验证奖励为正时激活蒸馏。在五个数学基准上,SKALD 在 0.6B、1.7B 和 4B 规模下分别比 GRPO 提升 +2.46、+4.85 和 +12.01 的 avg@8。在 1.7B 规模下,零方差蒸馏恢复 84.7% 的完整增益,且比 FLOP 匹配的 GRPO 高 +4.06。论文SKALDQwen3GRPO推荐理由:想提升数学推理模型?SKALD 把技能蒸馏进权重,比 GRPO 最高涨 12 分,还不用改推理时的输入。原文稍后读已读值得跟进有用关注 SKALD
11:21官方账号arXiv cs.AI@Ananya Sahu, Mohit Bansal, Elias Stengel-EskinCreativeInstruct是一种可扩展的指令微调方法,通过让模型学习注入[StartCreativity]标记来平衡创造性与后训练质量。该方法引入基于图编辑距离的结构多样性指标,捕捉叙事层面的变化。在叙事生成任务中,CreativeInstruct匹配或超过了多模型基线及蒸馏变体的多样性,且无需牺牲质量。人工评估中,70.3%的评分者认为CreativeInstruct的生成比后训练模型更有创造力。将GRPO应用于CreativeInstruct检查点,在AMC上提升约4%,在MATH上提升约5个百分点。论文CreativeInstructGRPO指令微调推荐理由:CreativeInstruct用特殊标记让模型在保持质量的同时更会编故事,人类测评七成认为更有创造力,还能给强化学习带来几个点的提升。原文稍后读已读值得跟进有用关注 CreativeInstruct
10:43官方账号arXiv cs.LG@Haoyu Zheng, Yun Zhu, Qing Wang, Wenqiao ZhangTRIAL提出统一回合对齐评分协议,为每个决策回合提取结果视图并比较普通与事后条件下的响应,以有符号对数概率差分配标记级监督。在WebShop和ALFWorld上使用不同骨干模型,TRIAL在全部八种组合中超越GRPO,并在六种组合中达到最优或并列最优。使用Qwen3-1.7B时,WebShop成功率从56.4%提升至75.2%,任务分数从78.7%提升至85.7%。消融实验显示,轨迹相对的回合分配比单纯密集事后蒸馏带来更大提升。论文TRIALGRPOQwen3推荐理由:这个新框架TRIAL能让智能体强化学习更高效,在多个任务上超过GRPO,成功率提升近19个百分点,搞RL的可以看看。原文稍后读已读值得跟进有用关注 TRIAL
10:02官方账号arXiv cs.LG@Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo, Vinh Van Nguyen, Khac-Hoai Nam Bui精选SpecRoll 是一种用于强化学习 rollout 的投机解码引擎,面向大规模语言模型后训练。它用轻量级未来 token 头生成并行提议,并通过 Reflex 模块做轨迹局部的隐藏状态修正,无需反向传播。在 1.5B 到 14B 的五个模型和三个数学推理数据集上,SpecRoll 相比原始 GRPO 取得 1.26-2.15 倍生成加速和 1.21-2.04 倍端到端加速。在全部 15 组匹配设置中,SpecRoll 的平均端到端耗时比 FastGRPO 快 1.18 倍。源码已公开。论文SpecRollGRPO投机解码推荐理由:RL 训练嫌生成太慢?SpecRoll 用投机解码给 rollout 提速,不改采样分布,五个模型跑数学推理端到端快 1.2 倍以上,代码也开源了。原文稍后读已读值得跟进有用关注 SpecRoll
12:27官方账号arXiv cs.AI@Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao论文提出 Video-DeepResearch,将多模态智能体从静态图像扩展到连续视频流,要求密集时空定位与开放网页探索结合。在 Video-DR-Bench 基准上,Video-DeepResearch-35B-A3B 平均准确率达 64.0%,超过 Claude-4.5-Sonnet(59.0%)5.0 个百分点,也优于 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)。框架采用解耦的感知-探索流程,通过分阶段工具解锁强制跨帧视觉定位后再进行网页检索。训练结合监督微调与 GRPO,30B-A3B 变体达到 59.3%,与 Claude-4.5-Sonnet 相当。代码已开源。论文Video-DeepResearch多模态智能体推荐理由:Video-DR 让 AI 边看视频边上网核实信息,35B 参数干翻 Claude-4.5-Sonnet,还开源了,值得试试。原文稍后读已读值得跟进有用关注 Video-DeepResearch
09:52官方账号arXiv cs.AI@Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan现有GRPO等组相对强化学习方法只提供响应级监督,与结构化多目标预测存在粒度失配。MCR-GRPO通过留一比较估计每个预测框的边际贡献,并利用连续匹配集值评估器改进归一化与定位。在REC、DOD、分割和计数基准上,该方法超越了现有GRPO基线。论文MCR-GRPOGRPO多模态推荐理由:GRPO以前只看整体得分,现在MCR-GRPO能逐个框算功劳,定位和分割都更准了。原文稍后读已读值得跟进有用关注 MCR-GRPO
09:21官方账号arXiv cs.AI@Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav RappoportMedUPS 是一个针对罕见病例诊断决策的对齐框架,配套数据集 MedUPSQA 包含 21,874 个临床决策点,来自 5,535 份真实病例报告。该框架将病例文本按时间顺序切分成累积片段,用 GRPO 强化学习训练模型预测下一步行动,并以 LLM-as-a-Judge 作为奖励。在三个基座模型上,中间步骤对齐将下一步预测准确率从 55.2 提升至 66.7(Qwen3.6-27B)、从 47.2 提升至 57.8(Qwen3.5-9B)、从 37.8 提升至 44.4(HuatuoGPT-3-8B)。MedUPSQA 数据集、代码和对齐后的模型权重已发布。论文MedUPSMedUPSQAQwen推荐理由:MedUPS 用强化学习教模型在罕见病例中预测下一步决策,三个开源模型准确率都提升了,数据集和代码已开源。原文稍后读已读值得跟进有用关注 MedUPS
11:55官方账号arXiv cs.AI@Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei, Yuxin Wang, Hairong Zhang, Yu Yang, Tao Hu, Cong Zhang, Botian Shi, Pinlong CaiMemHarness 框架在决策时用统一策略模型批判并重构检索到的经验,而不是像基线那样逐字回放。重构能力通过 GRPO 端到端训练自然涌现,无需额外监督。在 ALFWorld 和 WebShop 两个基准上,MemHarness 显著超过纯 RL 和静态记忆增强基线。分析表明,MemHarness 的重构目标可防止负迁移,并在 OOD 场景中保持鲁棒性。论文MemHarnessALFWorldWebShop推荐理由:MemHarness 让智能体把旧经验改写到当前场景再用,在 ALFWorld 和 WebShop 上比静态记忆基线强不少。原文稍后读已读值得跟进有用关注 MemHarness
11:28官方账号arXiv cs.LG@Tiangang Li, Xiangbo TianSFT虽能让LLM掌握HPC领域知识,但在数据竞争检测与基准问答上行为不精准,88.65%的分类正确率下仍有65.9%的MLPerf回答超40字符。HPC任务异构性显著,答案长度差异达58倍,覆盖三种奖励分布。HARGO通过置信度调制的优势加权,无需任务类型标签即可适配。在四个HPC任务和九种方法的对比中,HARGO在WinRate 54.62%、Data Race F1 91.30%和PLP Similarity 0.8558上均取得最佳。AI模型HARGOHPCRL后训练推荐理由:HARGO给HPC任务的RL后训练提了个新思路,不用标签就能按难度加权,四个任务上全面超过GRPO。原文稍后读已读值得跟进有用关注 HARGO
10:10官方一手arXiv: DeepSeek@Ken Ding精选数学推理的RLVR存在盲区:当一组采样全部失败时,GRPO的优势函数为零,导致模型在能力边界提示上无梯度。LSPO在每个RL步检测这类悬崖提示,用其标准答案快速拟合一个小型LoRA适配器,然后重新采样并将成功补全拼回批次。在DeepMath-103K上用DeepSeek-R1-Distill-Qwen-1.5B、n=5配对种子、1000步评估,LSPO在16个(基准,pass@k)组合中15胜1平,AIME24/pass@4提升+10.7点,MATH500/pass@1提升+2.4点,平均提升+3.8点。论文DeepSeek-R1-Distill-Qwen-1.5BGRPOLoRA推荐理由:DeepSeek-R1-Distill-Qwen-1.5B上,LSPO用LoRA支架捡回GRPO在零奖励提示上的梯度,比DAPO平均高3.8个点。原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-1.5B
11:40官方账号arXiv cs.AI@Jintao Xu, Yingzheng Ma, Jiong Dong, Yongzhi Qi, Jianshen Zhang论文研究多仓库库存分配中MIP公式的实例级选择问题,提出一种求解器引导的LLM框架,通过SFT、IPO和GRPO训练选择器。实验基于京东数据,Hit Ratio@1从21.45%提升至50.42%,Hit Ratio@2从70.47%提升至82.31%,分配质量比固定最优公式高12.57个百分点,与事后最优差距缩小至4.85个百分点。论文LLMGRPO多仓库库存分配推荐理由:京东数据验证的一种新方法,用LLM和GRPO自动选库存分配公式,准确率翻倍,搞供应链优化的可以关注。原文稍后读已读值得跟进有用关注 LLM
11:28官方账号arXiv cs.LG@Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoit Sagot, Gabriel Synnaeve论文提出DMC-Optim基准,用于评估代码优化RL。通过三阶段方法解决测量噪声和奖励稀疏问题:构建校准沙箱测试,组合正确性与速度奖励,并适配GRPO到稀疏场景。在DMC-Optim上,Qwen 2.5 7B的top-50% pass@1从18.0%提升至31.3%,CWM 32B从30.7%提升至50.4%。top-30%时CWM 32B相对提升125%,且保持纯正确性分数不变。在LCB上,CWM 32B赢得83%的中位数样本速度对比。论文DMC-OptimGRPO代码优化推荐理由:一篇教你用强化学习优化代码执行速度的论文,针对测量噪声和奖励稀疏问题设计了DMC-Optim基准和三阶段方法,让Qwen 2.5 7B的pass@1从18%提到31%,CWM 32B提到50%。原文稍后读已读值得跟进有用关注 DMC-Optim
12:01官方一手arXiv: DeepSeek@Fei Ding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Huiming YangGRPO 被 DeepSeek-R1 采用作为训练推理能力的主要强化学习算法,但存在响应级长度偏差。最新改进 Dr. GRPO(COLM 2025)声称通过移除长度归一化实现“无偏”,但作者证明该声称不完整。文章提出不可能定理:在标准结果奖励加 GRPO 设定下,没有长度加权方案能同时实现梯度无偏估计(P1)和长度不变性(P2)。通过参数族 f_α(L)=L^{α-1} 显示,α=0 对应 GRPO(近似满足 P2 但违反 P1),α=1 对应 Dr. GRPO(满足 P1 但违反 P2),且 Dr. GRPO 的长度偏差导致较长轨迹的梯度贡献与长度比成正比。结果表明两种算法处于不可避免的权衡两端。论文GRPODr. GRPODeepSeek-R1推荐理由:这篇论文把 GRPO 和 Dr. GRPO 的底裤都扒了——原来两者各占一个极端,没法同时做到无偏和长度无关,搞推理模型训练的人得看看这个权衡。原文稍后读已读值得跟进有用关注 GRPO
11:55官方账号arXiv cs.LG@Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao论文提出统一多轮环境,系统研究规划能力在预训练与后训练三阶段的获取、塑造与整合。预训练中,显式世界模型通过CoT状态转换建模提升长程泛化,少量长程数据即可实现组合泛化,但次优轨迹因误差累积严重损害性能。后训练中,OPD在低质长程设置下的有效区域比GRPO更广,不同知识的教师蒸馏可能损害学生先验世界模型。多教师在线策略蒸馏(MOPD)通过收敛到共享规划模式整合能力,兼容模式支持跨环境泛化,冲突模式导致干扰。论文MOPDGRPOOPD推荐理由:这篇用一个可控环境拆解了AI长程规划的训练机制,发现次优数据会拖累性能,多教师蒸馏能整合不同能力,值得做训练方法的人细读。原文稍后读已读值得跟进有用关注 MOPD
12:06官方账号arXiv cs.LG@Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi标准RLVR在模型无法生成任何正确答案时会得到零学习信号,导致困难问题无法收敛。Off-Context GRPO通过在训练中引入解法前缀作为特权引导,使模型获得非零奖励。该方法通过重要性校正目标避免引导与原始目标的偏差,在标准数学推理基准上比vanilla GRPO平均绝对提升3.9%(相对提升13.8%),且额外成本可忽略。论文Off-Context GRPOGRPORLVR推荐理由:模型一遇到难题就原地踏步?这篇论文给出了一个简单又有效的解法:给模型一点'提示',效果直接涨3.9%,成本几乎为零。原文稍后读已读值得跟进有用关注 Off-Context GRPO
18:37Geek@geekbb精选该教程逐行解析 MiniMind 源码,涵盖 Tokenizer、模型结构、预训练、SFT、DPO、PPO、GRPO 共 10 章内容,每章标注对应源码文件和函数名。附录17篇进阶文章补充量化、投机解码、RLHF 等 MiniMind 未涉及的主题。适合希望从代码层面理解大模型全流程的读者。技巧MiniMind源码预训练推荐理由:想用代码搞懂大模型训练全流程?这个教程把 MiniMind 的源码一行行讲透,从 Tokenizer 到 GRPO 都有,还附赠量化、RLHF 等进阶知识。原文稍后读已读值得跟进有用关注 MiniMind
11:55官方账号arXiv cs.LG@Chinmay Rane, Kanishka Tyagi, Michael Manry本文提出Output Reset(OR)作为PPO和GRPO中裁剪替代目标的平滑替代方案,使用OR平方边际损失在token对数比率空间进行优化。在Llama-3.2-1B-Instruct模型上基于Anthropic hh-rlhf数据集测试,PPO-OR在广义优势估计下最终奖励模型得分比PPO-clip平均高0.305,但seed间方差更大。GRPO-OR在组相对优势下平均得分未提升,但方差更小且过冲分数下降。两种组相对方法均比GAE方法产生更大的rollout到当前对数比率位移,OR未能一致减少此位移。报告分数为训练时奖励模型测量值,非独立人类偏好表现。论文ORPPOGRPO3 个信源在谈事件专题推荐理由:这篇论文用OR替换PPO和GRPO的裁剪目标,在Llama-3.2上奖励得分有提升,适合想了解强化学习微调新思路的同学原文稍后读已读值得跟进有用关注 OR
10:41官方账号arXiv cs.AI@Xingjian Tao, Yiwei Wang, Yujun Cai, Jing TangLenGuard-GPC是一种密集奖励框架,针对多视图空间推理中标准GRPO奖励稀疏且无法控制推理长度的问题。它通过比较标准提示与引导提示下token级预测分布的KL散度,提供密集奖励信号。同时引入分阶段长度奖励,将推理长度控制在合理范围,避免简单鼓励短回答。在6项多视图空间推理基准上,LenGuard-GPC相比原始GRPO提升了准确率,同时降低了平均响应长度。论文LenGuard-GPCGRPO空间推理推荐理由:这篇论文用KL散度做密集奖励,还加了长度控制,空间推理上比GRPO更准更短,值得搞强化学习的人看看。原文稍后读已读值得跟进有用关注 LenGuard-GPC
09:31官方账号arXiv cs.AI@Wentao Liu, Siyu Song, Xi Chen, Youjia Li, Xiaokun Wang, Min Ji, Ji WangAnthroDial是一个闭环框架,将拟人对话的生成、评估和偏好对齐联合建模。其运行时结合角色条件调度、长时记忆和虚拟时间;评测包含L0有效性门控、5个每轮维度和5个对话级维度。后训练管线用16,436个调度决策示例做SFT,并采用GRPO与认知诊断ZPD感知奖励,通过Kalman滤波对每个行为维度进行能力估计并加权。在55个角色、50个场景、50个角色-场景绑定、每模型100个角色条件案例的基准上,评估了16个系统,Qwen3.6-27B-SFT+RL达到39.00%严格ACC和98.5总分。9B无思考设置下,SFT和RL将严格ACC从0.00%提升到13.00%和18.37%。论文AnthroDialQwenGRPO推荐理由:这篇论文把拟人对话的生成、评测和奖励对齐做成闭环,Qwen3.6-27B微调后严格准确率39%,比基线高一大截。原文稍后读已读值得跟进有用关注 AnthroDial
09:31官方账号arXiv cs.AI@Binglin Zhou, Peng Shi, Ryo Kamoi, Nan Zhang, Rui Zhang多模态科学声明验证需依托论文中的图表、表格等视觉证据。现有方法在定位关键视觉证据、准确读取结构化科学图表、整合多模态观察方面存在不足。本文提出首个工具增强框架ToolSciVer,为视觉语言模型(VLM)配备三种类型感知视觉工具:表格行列聚焦、图表结构化解析、高分辨率区域放大。采用分组相对策略优化(GRPO)训练策略,综合奖励答案正确性、格式、长度、工具使用效率及有效性。在SciVer和MuSciClaims数据集上基于Qwen、InternVL、Gemma三个系列的五个VLM进行实验,结果表明该方法优于包括提示词和强化学习方法在内的四个基线。论文ToolSciVer多模态科学声明验证推荐理由:这篇论文给VLM配了三种看图工具(表格、图表、放大),再用GRPO训练工具使用策略,比普通prompt和RL方法更准,适合处理科学图表验证。原文稍后读已读值得跟进有用关注 ToolSciVer
09:22官方账号arXiv cs.LG@Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng JinLongStraw 是一种针对百万token级别强化学习后训练的架构感知执行栈,基于 GRPO 实现,在固定 GPU 预算下运行。它通过共享提示无自动求导评估、仅保留模型特定状态并逐次重放短响应分支,将实时训练图缩小以换取重放时间。在 8 块 H20 GPU 上,LongStraw 完成了 2.1M 位置的分组 Qwen 评分和响应反向传播;分组数从 2 增至 8 时,峰值显存仅增加 0.21 GB。在 32 块 H20 GPU 上,端到端执行路径验证了 GLM-5.2 全部 78 层的 2.1M token 提示处理能力。这些实验证明了执行容量,但完整训练正确性尚未全面验证。论文LongStrawGRPOQwen推荐理由:LongStraw 能让你在固定 GPU 预算下做百万 token 级别的强化学习后训练,比现有 256K 的方法多处理 8 倍上下文,而且内存增长极低。原文稍后读已读值得跟进有用关注 LongStraw
09:54官方账号arXiv cs.LG@Vladislav Beliaev精选AdaPrefix-GRPO针对GRPO在困难问题上梯度消失的问题,提出自适应调整正确前缀长度的机制。方法通过反馈控制器将问题的成功率维持在50%附近以最大化梯度信号,训练后完全移除前缀。在0.6B模型上,该方法在保留训练分布的难题上将准确率提升2.1倍;在Qwen3-1.7B上提升1.6倍,在AIME基准上提升1.7倍,同时将追踪长度减半。模型越小,增益越大。论文AdaPrefix-GRPOGRPOQwen3推荐理由:这篇论文解决了GRPO训练时难问题学不到东西的痛点,用自适应前缀让模型在数学推理上准确率翻倍,而且模型越小效果越明显,值得做强化学习的人看看。原文稍后读已读值得跟进有用关注 AdaPrefix-GRPO
09:14官方账号arXiv cs.AI@Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong提出Single-rollout Asynchronous Optimization (SAO)方法,解决异步RL中GRPO框架不适用于智能体任务的稳定性和离策略问题。用单轨迹采样替代组采样,配合价值模型训练和双面token级裁剪,在SWE-Bench Verified、BeyondAIME、IMOAnswerBench上持续优于GRPO及其变体。SAO已成功部署于GLM-5.2模型(750B-A40B)的智能体RL训练管线。论文SAOGRPOGLM-5.2推荐理由:想高效训练智能体模型?SAO用单轨迹采样打补丁,稳定训练1000步,在编码和推理基准上全面超越GRPO,干货论文。原文稍后读已读值得跟进有用关注 SAO
11:11官方账号arXiv cs.AI@Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz GeramifardTREK提出一种分阶段训练方法,解决GRPO在困难提示上的探索停滞问题。该方法先用蒸馏将教师模型(如DeepSeek-V4)的已验证轨迹拉入学生模型支持域,再返回标准GRPO精炼。在数学推理中,TREK将Qwen3-8B在AIME 2025上从36.9提升至40.3,在AIME 2024上从47.9提升至51.1(avg@16)。在代理任务上,ALFWorld成功率从75.8提高到82.8,ScienceWorld从12.5提高到26.7。TREK的泛化优势在于仅需已验证输出轨迹,可兼容黑盒或白盒教师。论文TREKGRPO蒸馏推荐理由:这篇论文给出了一个实用技巧:用蒸馏扩展支持域再强化学习,在数学和代理任务上都涨点明显,而且不需要改动模型结构。原文稍后读已读值得跟进有用关注 TREK
12:36官方一手marktechpost@Sana Hassan精选该教程展示了如何用Tunix框架和GRPO算法微调Gemma-3模型在GSM8K数学数据集上。首先配置环境并通过Hugging Face加载Gemma-3,将样本包装为推理加答案格式。定义格式正确性和数值正确性的奖励函数,并附加LoRA适配器以降低训练成本。最终通过GRPO分组采样改进策略,并导出合并后的模型。技巧Gemma-3GSM8KGRPO1 个信源在谈事件专题推荐理由:手把手教你用Tunix GRPO和LoRA微调Gemma-3做GSM8K数学题,奖励函数设计得很清楚。原文稍后读已读值得跟进有用关注 Gemma-3
12:35官方账号arXiv cs.LG@Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong本文基于Qwen3和Qwen2.5共7个模型,使用GRPO、GiGPO、Dr. GRPO三种RL算法,在数学推理、代码生成和智能体决策任务上实验。研究发现训练单层Transformer即可恢复全参数RL训练大部分甚至全部改进。作者引入“层贡献”指标量化单层训练相比全参数训练的收益比例。结果显示RL收益高度集中于少数中间层,输入输出层贡献显著较低。论文Qwen3GRPOTransformer推荐理由:这篇论文发现RL训练只需调优一层Transformer就能接近全参数效果,还揭秘中间层才是关键,刷新认知。原文稍后读已读值得跟进有用关注 Qwen3
12:22官方账号arXiv cs.LG@Michael Y. Li, Anthony Zhan, Kanishk Gandhi, Noah D. Goodman, Emily B. Fox论文提出QuasiMoTTo,利用准蒙特卡洛(QMC)生成相关但边际分布正确的样本,替换传统的独立同分布(i.i.d.)采样,减少冗余。在四个推理基准上,QuasiMoTTo以25-47%更少的样本达到相同的pass@k准确率,甚至常饱和边际保持采样器的理论上限。应用于策略梯度强化学习(GRPO)时,QuasiMoTTo以50%更少的训练步骤匹配i.i.d.性能。研究者还开发了无偏bootstrap估计器以评估相关采样器的pass@k。论文QuasiMoTToquasi-Monte Carlopass@k推荐理由:这篇论文提出QuasiMoTTo,用相关采样替代独立采样,在推理和强化学习中大幅减少样本需求,效果显著。原文稍后读已读值得跟进有用关注 QuasiMoTTo
11:50官方账号arXiv cs.LG@Jingwei Song, Haofeng Xu, Jie Xiao, Chengke Bao, Jingwei Shi, Pengbin Feng, Weixun Wang, Yuhang Han, Chuan Wu, Linfeng Zhang, Bill Shi该论文研究异步GRPO(群体相对策略优化)中陈旧rollout对策略优化的影响。作者将行为策略显式纳入GRPO替代目标,并区分学习器使用的替代梯度映射与依赖分布的总体目标的真实全导数。在局部有界性、分布平滑性和行为策略平滑性假设下,证明陈旧rollout引入的每步替代梯度偏差为O(S * eta),其中S是最大rollout滞后,eta是学习率。进一步导出条件性崩溃时间缩放定律:当周期内漂移低于批量级裁剪半径时,崩溃主要由累积学习器漂移T * eta决定;当陈旧rollout约束激活时,稳定性显式依赖于S * eta。从而得到双约束稳定性条件eta << min{R_batch/(S*G_upd), R_crit/(T*G_upd)},解释了在有限时间范围内最大稳定学习率对陈旧性依赖较弱的原因。论文RLHFGRPO异步训练推荐理由:想搞异步RLHF训练的可以看这篇,把陈旧rollout对学习率的影响定量化了,推导了缩放条件,比经验调参更靠谱。原文稍后读已读值得跟进有用关注 RLHF
10:36官方账号arXiv cs.AI@Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Zhipeng Wang, Alborz Geramifard论文提出TRIAGE框架,通过将动作段分类为决断性进展、有用探索、无进展基础设施或回归,并分配固定边界奖励,解决了标准GRPO仅依赖最终结果信号的盲点。在ALFWorld、Search-QA和WebShop三个基准上,TRIAGE基于两种策略模型均提升了成功率。消融实验表明,角色类型化(尤其是检测成功轨迹中的回归行为)是性能提升的主要来源,且TRIAGE在ALFWorld和WebShop上分别比GRPO减少了10.4%和14.8%的环境交互轮次。论文TRIAGEGRPOALFWorld推荐理由:想改进智能体强化学习的信用分配?TRIAGE通过角色类型化标签给不同动作段不同奖励,效果超过GRPO,还能少绕弯路。原文稍后读已读值得跟进有用关注 TRIAGE
10:08官方账号arXiv cs.AI@Difan Jiao, Raghav Singhal, Robert West, Ashton AndersonTandem Reinforcement Learning (TRL) 将 tandem 训练范式引入带可验证奖励的强化学习(RLVR)。TRL 让一个较强的 senior 模型与一个冻结的 junior 模型随机交替协作生成推理过程,对最终结果给予奖励,并对 senior 应用标准 GRPO 损失。在 Qwen3-4B-Instruct 上使用竞赛数学训练,TRL 的 solo 推理能力与 vanilla GRPO 持平,但同时提升了 senior 与 junior 的交接鲁棒性、减少了 junior 侧分布漂移,并产出了对 junior 更易理解的思维链。该工作为多模型通信与人类兼容性提供了实际收益的路径。AI模型TRLQwen3-4BGRPO推荐理由:他们提出了 TRL,让强模型和弱模型组队推理,强模型学会写弱模型能看懂的推理过程。训练 Qwen3-4B 后,单打能力不降,协作能力更强。原文稍后读已读值得跟进有用关注 TRL
10:35官方账号arXiv cs.LG@Ping Liu, Qianqi Shen, Jianqiang Shen, Wenqiong Liu, Rajat Arora, Yunxiang Ren, Chunnan Yao, Dan Xu, Baofen Zheng, Wanjun Jiang, Andrii Soviak, Kevin Kao, Jingwei Wu, Wenjing Zhang该论文提出一种RLAIF框架为招聘搜索平台自动生成可移植的搜索查询词。研究发现GRPO优化器对虚假奖励信号敏感,易导致模型复制原文的退化行为。通过引入基于规则的确定性奖励下限,抑制了动词复制行为,使交叉族评估指标提升0.147。实验表明训练时奖励模型将性能提升夸大了2.4倍,核心在于奖励塑形而非优化器选择。论文RLAIFGRPO语义搜索推荐理由:这篇论文揭示了奖励信号设计比选优化器更重要,GRPO容易作弊,加个规则防御就能让质量跳升14.7%点。原文稍后读已读值得跟进有用关注 RLAIF
08:55Fireworks AI@FireworksAI_HQ精选Fireworks 宣布对 NVIDIA Nemotron 3 的强化学习微调功能上线,首批支持 Nemotron 3 Super 的 LoRA 微调。训练采用 GRPO 算法,可在一处平台完成训练和部署。计费方式改为按 GPU 小时而非按 token,解决了长多轮对话成本不可控的问题。AI产品Nemotron 3Fireworks微调6 个信源在谈事件专题推荐理由:Fireworks 刚上线了 Nemotron 3 的 RL 微调,按 GPU 小时计费不怕长对话烧钱,用 GRPO 训练一条龙搞定。原文稍后读已读值得跟进有用关注 Nemotron 3