9月3日
11:51
11:51官方账号arXiv cs.LG@Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar, Boris Ginsburg
78°
NVIDIA研究人员使用22,000道精选问题训练了Nemotron-3-Nano-CC和Ultra-CC模型。Nano-CC模型通过后训练从130分提升至291分,配合GenCorrect策略达到468分,超过IOI 2025金牌线438.3分。Ultra-CC模型在IOI 2026模拟中取得535.4分,超越人类最高分498.27分。
事件专题

推荐理由:NVIDIA训练的编程竞赛模型首次在IOI中击败人类冠军,分数535.4远超金牌线361.12。
9月2日
15:44
10:49
10:49官方账号arXiv cs.AI@Kshitij Tayal, Arun Sharma, Genta Indra Winata, Anirban Das, Sambit Sahu
精选73°
自然语言正成为提升语言智能体的主要反馈渠道,能传达意图、偏好和因果结构。该研究提出语言强化学习(VRL)范式,围绕反馈生效时机和修改内容形成三大支柱:语言作为基础信号定义任务目标和奖励结构;语言作为反思性反馈指导测试时推理;语言作为学习信号通过训练调整模型参数。
推荐理由:这篇论文首次系统梳理了语言强化学习,将现有研究分为三大类,帮助理解语言如何重塑智能体开发。
10:15
10:15官方账号arXiv cs.LG@Haoyuan Deng, Haichao Liu, Wenkai Guo, Yuan Ling, Zaijia Yang, Yuanjiang Xue, Haosheng Sun, Liangzi Wang, Ziwei Wang
精选73°
Facet-0 是一个新的机器人基础模型,专为亚毫米级精密装配任务设计。该模型在 ManuFacet-1K 数据集上训练,包含 1000 小时的同步力数据。在五个亚毫米级计算机装配任务中,Facet-0 达到 82% 的平均成功率,而最强基线模型仅为 15%。系统实现了 0.5 毫米的放置精度和 50 毫秒的命令延迟。
推荐理由:Facet-0 模型通过预测和评估接触后果,让机器人能完成高精度装配,成功率比最强基线高出 5 倍多。
10:12
10:12官方账号arXiv cs.LG@Matteo Merler, Giovanni Bonetta, Davide Zago, Rossella Cancelliere, Bernardo Magnini
73°
研究人员提出SAGE框架,通过熵值选择性查询视觉语言模型(VLM)教师。该框架在训练过程中仅在不确定时查询VLM,执行建议动作,并将指导提炼为轻量级强化学习策略。在稀疏奖励视觉推理和导航任务中,SAGE学习到的策略在评估时无需VLM指导,并在多个环境中优于无引导的强化学习。
推荐理由:SAGE框架让VLM只在关键时刻提供指导,大幅减少调用次数,学习到的策略甚至能超越VLM教师表现。
10:11
10:11官方账号arXiv cs.LG@Tomáš Holeček, Viliam Lisý
精选73°
NashDreamer是一种基于模型的强化学习框架,专为双人零和博弈设计。该框架引入了多智能体循环状态空间模型(MARSSM),在四个基准游戏中显著提升了早期训练的样本效率。研究还分析了Dreamer算法族在随机环境中面临的后验崩溃问题。
推荐理由:斯坦福团队推出NashDreamer,解决零和博弈中的非平稳性问题,比无模型基线训练效率更高。
09:37
09:37官方账号arXiv cs.AI@Fanrui Zhang, Ruixue Ding, Qiang Zhang, Xi Chen, Boli Chen, Shihang Wang, Qiuchen Wang, Hongmin Zhan, Jinxin Bian, Li xingchao, Peijin Zheng, Hao cheng, Pengjun Xie, Kaipeng Zhang, Jiawei Liu, Zheng-Jun Zha
精选73°
研究人员提出ARISE-RL框架,通过任务/评分生成器与推理求解器的协同进化解决开放智能体训练难题。该框架引入RG-SED蒸馏技术,仅在记忆带来经验奖励提升时进行知识蒸馏。团队还发布ECR-Bench基准测试,涵盖单工具深度研究和多工具旅行规划任务。实验显示ARISE-RL在所有评估基准上取得稳定的最先进性能。
推荐理由:OpenAI新框架ARISE-RL用评分协同进化解决开放智能体训练难题,ECR-Bench基准测试验证效果。
05:43
9月1日
11:23
11:23官方账号arXiv cs.AI@Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang, Wenqi Zhang, Jintao Chen, Xuhong Zhang
精选73°
TASPO将特权监督转化为结果导向的行动信用,在三个智能体基准测试中比GRPO提高10.6%。该方法从验证的成功经验中构建决策适用的特权信息,在可执行行动级别聚合PI引起的似然变化。TASPO将相对行动支持转换为原始轨迹优势上的正、有界、均值保留权重,验证结果确定更新方向和平均规模。
推荐理由:TASPO解决了智能体政策优化中的监督-信用差距问题,让特权信息只重新分配行动间的信用,不改变整体更新方向。
11:22
11:22官方账号arXiv cs.AI@Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo
78°
该研究探讨了大型推理模型(LRM)如何随着人类监督逐渐退出学习循环而持续改进。论文提出了从L0到L4的五级阶梯,追踪学习过程中哪些部分仍受人类控制。研究分析了奖励机制从单个人类判断发展到可重用验证器的过程,以及学习从人工策划任务向自主生成课程和环境演进的路径。
推荐理由:这篇论文系统分析了大推理模型如何减少人类依赖,提出了五级发展阶梯和三种评估对象。
10:49
10:49官方账号arXiv cs.LG@Michal Korniak, Kamil Dybek, Benjamin Eysenbach, Marco Bagatella, Michał Bortkiewicz
精选73°
研究者将对比强化学习(CRL)从单步动作扩展到动作块,在18个离线环境和11个在线环境中分别实现了31.7%和93.1%的性能提升。研究发现,在CRL中,动作块比单步动作携带更多关于目标的信息,显著提升了评价器的表示能力。这种改进并非完全通过建模非马尔可夫、时间扩展策略或传播无偏多步回报来实现。
推荐理由:这篇论文展示了对比强化学习通过动作块建模获得显著性能提升,揭示了动作块携带更多目标信息的新机制。
10:44
10:44官方账号arXiv cs.LG@Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang
精选73°
研究人员提出PAC方法,结合优势衍生的可学习性和近期奖励增益两个信号,用于大语言模型的多任务强化学习。在多级推理和多领域推理两种设置下,PAC仅需更少的采样步骤就能达到相当的验证分数,并最终超越随机采样和基于优势的课程基线。该方法通过贝叶斯汤普森采样控制器在GRPO训练过程中分配任务资源。
推荐理由:PAC方法解决了LLM多任务RL中任务分配问题,结合优势信号和实际奖励增益,提升训练效率。
09:15
09:15官方账号arXiv cs.AI@Xinke Jiang, Yue Fang, Zhibang Yang, Jiaran Gao, Zhixin Zhang, Tao Feng, Rihong Qiu, Wentao Zhang, Hongxin Ding, Ruizhe Zhang, Yongxin Xu, Yuheng Huang, Xu Chu, Junfeng Zhao, Yasha Wang
精选73°
AgenticRag-R1 是一种新型强化学习框架,通过内存栈和细粒度动作空间深度整合推理、检索和记忆功能。该模型在多跳、开放域和智能体推理基准测试中表现优于强基线模型,支持多种骨干模型规模。研究团队引入了分层动作感知奖励机制和信息感知轨迹拒绝策略,实现有效的长时程学习。
推荐理由:清华团队推出 AgenticRag-R1,解决多步推理中的检索适应性问题,比传统方法更聪明。
8月31日
23:49
23:49Fireworks AI@FireworksAI_HQ
精选
FireworksAI发布了一体化平台,支持强化学习全流程操作。该平台整合了训练、采样、服务和重新训练功能。平台专为大规模强化学习设计,能够处理样本回放、评分、权重更新和重新采样等循环操作。
推荐理由:FireworksAI推出强化学习全流程平台,实现训练到推理闭环,适合大规模RL项目使用。
11:43
11:43官方账号arXiv cs.LG@Nan Wang, Mohit Yadav, Jonathan Wulff, Aidan Rosenbaum, Kezhou Chen, Yuvan Sharma, Xu Dong, Yiwei Tao
精选73°
Aero Hand Open是一款仿真就绪的拟人化肌腱驱动手,包含仿真模型、执行映射和强化学习训练包。该手通过肌腱传动降低成本,但难以在仿真器中建模。研究人员发布了完整设计、仿真模型、映射关系和训练环境,支持策略完全在仿真中训练并直接部署。
推荐理由:MIT发布了仿真就绪的肌腱驱动手Aero,包含完整训练包,无需微调即可部署。
8月28日
21:00
18:14
18:14官方账号arXiv cs.AI@Zike Yuan, Han Zhang, Jianzhi Yan, Le Liu, Cai Ke, Huozhi Zhou, Jian Xie, Jiran Yin, Yukun Cao, Yue Yu, Hui Wang, Ming Liu, Bing Qin
精选73°
GRAIN是一种单智能体框架,通过强化学习优化,使用结构不变性奖励指导LLM学习鲁棒的文本到结构映射。该框架在GRIT基准测试上比多智能体基线准确率高16.45%,延迟降低约24%。GRAIN将SFT模型的OOD差距从15.77%缩小到7.80%,并在训练分布外的大规模图上保持鲁棒性。
推荐理由:MIT团队推出GRAIN框架,用单智能体解决图推理中的标识符和任务表述变化问题,比多智能体方案更快更准。
16:19
8月27日
21:20
21:20IT之家博客/媒体
高通技术公司副总裁Anshuman Saxena表示,基于高通的SoC平台,可构建L3级自动驾驶解决方案。骁龙8797至尊版已为各级别驾驶辅助解决方案做好准备。高通在ADAS路线图方面在中国、日本、德国及欧洲和北美车企中均获得认可。强化学习在辅助驾驶中的应用取决于计算能力和传感器配置。

推荐理由:高通副总裁Anshuman Saxena透露,高通的骁龙8797至尊版已为各级别驾驶辅助解决方案做好准备,强化学习在辅助驾驶中的应用也备受关注,值得关注。
21:19
21:12
21:12orange.ai@oran_ge
Microduck是一款25厘米高的开源双足机器人,配备15个执行器和多种传感器,支持强化学习训练。内置多种预训练策略,可进行多种动作,售价低于400美元。详情及购买请访问pollen-robotics.com/microduck/。
推荐理由:Microduck机器人可爱又开源,适合喜欢DIY和机器人技术的朋友,价格亲民,功能丰富,值得一试。
20:19
20:19官方账号Clement Delangue@ClementDelangue
Hugging Face今日发布Microduck机器人,售价399美元,开源,可使用强化学习教授新技能,能行走、捡起物品、摔倒后自行站起来,甚至滑旱冰。旨在推广开源、经济实惠的机器人,以普及物理AI和世界模型!
推荐理由:Hugging Face发布了Microduck机器人,价格亲民,功能丰富,是学习物理AI和机器人技术的不错选择。
19:00
10:23
10:23IT之家博客/媒体
巴雷特·佐夫从OpenAI离职后,再次加入谷歌,担任研究副总裁,将强化学习(RL)和后训练经验带入Gemini团队。佐夫曾于Google Brain和OpenAI工作,参与ChatGPT研发。
事件专题

推荐理由:巴雷特·佐夫重返谷歌,将强化学习经验带入Gemini团队,对AI领域感兴趣的朋友不容错过。
8月24日
10:59
10:59官方账号arXiv cs.AI@Haonan Jia, Shichao Dong, Zenghui Sun, Jiawen Zheng, Ziqi Miao, Gege Shi, Qiuyu Zhao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng
本文提出Re$^3$Cap,一种基于检索引导的图像描述优化策略,通过强化学习提升图像描述准确性。该方法通过识别图像描述中的幻觉和遗漏,实现更精确的描述。在COCO-LN500基准测试中,Re$^3$Cap相较于GRPO平均提升了8.64%的相关推理性能。
推荐理由:Re$^3$Cap模型通过检索引导优化图像描述,比GRPO提升了8.64%的推理性能,值得一看。
8月23日
8月22日
00:06