9月2日
10:13
10:13官方账号arXiv cs.LG@Jingtan Wang, Arun Verma, Xiaoqiang Lin, Zhengyuan Liu, Nancy F. Chen, Daniela Rus, Bryan Kian Hsiang Low
精选73°
研究解决了大模型后训练中监督微调(SFT)与强化学习(RL)的标注预算分配问题。该研究提出了近最优区域概念,即使在2-10%的小容忍度下,该区域也很宽。研究发现近最优区域随模型规模扩大而变宽,并能从小代理模型可靠转移到大型目标模型。研究结果在不同任务、模型家族和基于偏好的离策略与基于奖励监督的在策略RL方法中保持一致。
推荐理由:研究人员发现小模型实验就能确定可转移的近最优区域,无需大规模搜索,大幅降低大模型训练成本。
8月31日
23:49
23:49Fireworks AI@FireworksAI_HQ
精选
FireworksAI发布了一体化平台,支持强化学习全流程操作。该平台整合了训练、采样、服务和重新训练功能。平台专为大规模强化学习设计,能够处理样本回放、评分、权重更新和重新采样等循环操作。
推荐理由:FireworksAI推出强化学习全流程平台,实现训练到推理闭环,适合大规模RL项目使用。
8月19日
7月24日
01:13
01:13官方账号NVIDIA AI@NVIDIAAI
72°
NVIDIA AI展示使用PrimeIntellect托管RL训练,将Nemotron 3 Nano在数学任务上的准确率从22%提升至91%,总成本低于5美元。工作流程包括基线检查、奖励训练和重新测试,最终输出可下载的LoRA适配器。该方案可通过修改一行代码扩展至Nemotron 3 Super和Ultra。
事件专题

推荐理由:花5美元用托管RL把Nemotron 3 Nano的数学准确率从22%拉到91%,还能一键扩展到更大模型,太实用了!
7月7日
11:39
11:39官方账号arXiv cs.AI@Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini
LLM-as-a-Verifier通过计算评分token logits的期望生成连续分数,替代传统的离散评分方法。该框架从评分粒度、重复评估和准则分解三个维度缩放验证能力,在Terminal-Bench V2上达86.5%,SWE-Bench Verified上达78.2%,RoboRewardBench上达87.4%,MedAgentBench上达73.3%。其细粒度信号可用于任务进度估计和RL训练,在SAC和GRPO上提升样本效率。论文还提供了Claude Code扩展,帮助开发者监控代理系统。
事件专题

推荐理由:这篇论文提出一种不依赖额外训练的验证框架,用连续分数替代离散评分,在四个agent基准上刷新了成绩,还顺手提升了RL样本效率。
7月2日
15:20
6月29日
19:47
19:47eric zakariasson@ericzakariasson
73°
Elon Musk在推文中透露,Cursor团队为v9模型的SFT和RL训练做出了重要的工程贡献。当前1.5T参数量的模型已通过补充训练加入Cursor数据。而两周前开始的2T参数量训练在数据范围和规模上大幅改进,训练配方也获得多项升级,预计7月底完成,8月发布。
事件专题

推荐理由:Elon Musk说他们和Cursor团队合作训练v9模型,2T参数量的版本数据更全,8月就能见到,值得关注。
6月28日
07:07
07:07Suhail@Suhail
精选
Hamish Ivison等人发布了Tmax,一个基于强化学习的开源终端智能体模型。在默认设置和65k token预算下,Tmax优于之前的开源终端使用工作。团队公开了所有训练数据、模型权重和rollouts,方便复现和进一步研究。
推荐理由:Tmax把终端智能体的RL训练配方全开源了,65k token里就跑赢之前的工作,想自己训智能体的可以抄作业。