7月21日
11:27
11:27官方账号arXiv cs.AI@Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang, Siqing Wang
论文提出Criterion-Distilled Policy Optimization (CriPO),针对评分强化学习中的两个问题:未探索准则(UC)和抑制准则(SC)。分析显示SC在训练中发生率超过57%,平均每样本1.8个SC。CriPO通过在线自蒸馏分别处理UC(构建准则注入自教师)和SC(反事实自教师翻转token级优势),在医学和科学基准上一致优于基线,训练步数减少约2倍。
推荐理由:这篇论文分析了评分RL中信号丢失的普遍问题(57%样本受影响),并提出CriPO自蒸馏方法,在医学和科学基准上效果更好且训练更快。
09:52
09:52官方账号arXiv cs.LG@Joseph Lazzaro, Alessio Russo, Aldo Pacchiano
本文研究在线表格强化学习中的最佳策略识别问题,提出首个非渐近样本复杂度保证。算法Navigate and Stop (NaS)的样本复杂度依赖于特征时间、MDP的连通性、最优特征时间的曲率等实例相关量。研究填补了NaS算法在非渐近分析上的空白,明确了各因素对样本复杂度的贡献。
推荐理由:这篇论文给NaS算法提供了非渐近保证,解释了样本复杂度受哪些因素影响,做强化学习理论的朋友可以看看。
7月20日
7月18日
7月17日
12:08
12:08官方账号arXiv cs.LG@Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
On-Policy Delta Distillation (OPD²) 引入delta信号,定义为教师模型与其未经推理指令微调的基础模型之间的差异。该方法在数学、科学和代码推理基准上一致优于传统on-policy蒸馏。实验表明,仅需短期后训练即可使推理LLM达到强性能。代码已在GitHub开源。
推荐理由:这篇论文用老师模型和基础模型的差值做蒸馏信号,比直接模仿老师更强,数学代码推理都更好,训练时间还短。
7月16日
7月15日
02:45
02:45官方账号NVIDIA AI@NVIDIAAI
Nemotron Labs 发布了一个教程,讲解如何利用 Agent Skills 运行强化学习自动研究。该教程面向开发者,展示如何构建和部署智能体以自动执行 RL 实验。它可能涉及 NVIDIA 的 Nemotron 框架和特定工具链。具体步骤包括环境配置、技能组合和实验管理。
事件专题

推荐理由:想用强化学习自动跑实验?Nemotron Labs 出了个教程,手把手教你用 Agent Skills 搭建智能体,省心省力。
7月14日
18:12
13:55
13:55官方账号vLLM@vllm_project
精选
NVIDIA NeMo 团队发布了新的智能体优先强化学习框架 Molt,采用 vLLM(基于 Ray)作为 rollout 引擎。vLLM 支持快速异步服务,最高可扩展至 1T 级 MoE 规模,且易于集成,让上层的强化学习核心保持小巧和可修改。
事件专题

推荐理由:vLLM 被 NVIDIA 新框架 Molt 选为 rollout 主力,支持 1T 级 MoE 规模,想搞强化学习可以试试这套组合。
02:15
01:34
01:34官方账号Decoder@Matthias Bastian
73°
2024图灵奖得主Richard Sutton在加拿大多伦多创立了一家新公司Oak Lab。Sutton是现代强化学习的联合创始人。他批评当前深度学习方法“弱且低效”。Oak Lab旨在构建能从环境中持续学习的AI智能体。

推荐理由:图灵奖得主Rich Sutton说深度学习弱,他要搞能自己从环境里学习的AI智能体。
7月13日
16:53
16:53官方一手marktechpost@Asif Razzaq
精选73°
斯坦福研究者提出TRACE系统,从智能体轨迹中诊断能力缺口,为每个能力合成一个可验证的训练环境。系统为每个能力训练一个LoRA适配器,并在专家间路由token。在τ²-Bench上性能提升+15.3点,在SWE-bench Verified上达到73.2% Pass@1。
推荐理由:智能体老犯同样错误?斯坦福的TRACE能自动找出短板,给每个能力单独训练,直接提升15个点。
15:43
15:43官方一手marktechpost@Michal Sutter
精选
Prime Intellect 发布了 Verifiers v1(0.2.0版本预览),将强化学习环境拆分为三个可组合组件:taskset(定义任务)、harness(执行方式)和runtime(运行位置)。系统包含一个拦截服务器,可代理请求并记录训练轨迹。任何taskset均可与任意兼容的harness和runtime搭配,并立即支持 prime-rl 训练框架。
推荐理由:Prime Intellect 出了 Verifiers v1,把RL训练环境拆成任务集、框架和运行时三块,能自由组合,还自带拦截服务器收集数据,做智能体RL的可以试试。
14:41
14:41官方账号vLLM@vllm_project
精选
PrimeIntellect推出Verifiers v1,使用vLLM进行训练rollouts,确保精确的token IDs和logprobs。该方法消除了tokenization漂移,使rollouts与训练保持同步。vLLM还支持开源RL基础设施如prime-rl。这一发布提升了强化学习训练的稳定性和效率。
推荐理由:PrimeIntellect发了Verifiers v1,用vLLM做强化学习rollout,token精度更高,训练更稳定。搞开源RL的可以看看。
7月9日
09:42
09:42Cognition@cognition_labs
精选
Cognition的强化学习训练涉及跨越三大洲的四个数据中心。他们结合自有GPU多集群和推理提供商FireworksAI的算力,只有训练器需要紧密集合通信。推理rollout采用分布式架构,引擎通过对象存储中的压缩权重差异进行同步,实现跨区域高效训练。
推荐理由:Cognition分享了RL训练的新玩法:跨三大洲四数据中心混用自有GPU和FireworksAI,靠压缩权重差异同步,挺有意思。
09:14
09:14官方账号arXiv cs.AI@Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong
提出Single-rollout Asynchronous Optimization (SAO)方法,解决异步RL中GRPO框架不适用于智能体任务的稳定性和离策略问题。用单轨迹采样替代组采样,配合价值模型训练和双面token级裁剪,在SWE-Bench Verified、BeyondAIME、IMOAnswerBench上持续优于GRPO及其变体。SAO已成功部署于GLM-5.2模型(750B-A40B)的智能体RL训练管线。
推荐理由:想高效训练智能体模型?SAO用单轨迹采样打补丁,稳定训练1000步,在编码和推理基准上全面超越GRPO,干货论文。