论文11:50
主动离线到在线强化学习

这篇论文解决了离线到在线RL中一个关键难题:在有限交互次数下,如何主动挑选微调策略而不是盲目均分预算。实验结果挺实在,值得做RL方向的朋友看看。

arXiv cs.LG原文

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。