11:16官方账号arXiv cs.LG@Zheyuan Zhang, Manqing Mao, Hong Wang, Zhuoer Wang, Samson Koelle, Jie Yuan, Yanjun Lin, James Feng, Nikki Lijing Kuang, Yanfang Ye, Wei NiuRAIL是一种训练时框架,通过在线上下文bandit建模干预选择,学习如何为策略生成rollout。它利用影子到实时程序收集干预轨迹,训练恢复控制器,使控制器随策略演化持续学习。在多个设置下,RAIL在有限rollout预算下持续提升性能。结果表明恢复感知干预能生成更有信息量且更少冗余的rollout,增强后训练的学习信号。论文RAIL强化学习大语言模型推荐理由:这篇论文提出RAIL,把干预选择当成在线学习问题,让模型在有限预算下学到更有效的rollout,适合做RL后训练的人看。原文稍后读已读值得跟进有用关注 RAIL
11:13官方账号arXiv cs.LG@Zhuohang Li, Liqun Huang, Wei Xu, Zhengming Zhu, Nie Lin, Xiao Ma, Xinjun Sheng, Ruoshi Wen精选Vision-Language-Action (VLA) 模型在灵巧操作中容易因高维动作空间和接触丰富的动力学产生累积误差。现有交互式模仿学习(IIL)在接管时存在人机指令不匹配,导致机器人手部“手势跳跃”。Hand-in-the-Loop (HandITL) 提出一种无缝干预方法,将人类纠正意图与自主策略执行融合,避免手势跳跃。实验表明,相比直接遥操作接管,HandITL 减少接管抖动 99.8%,降低抓取失败率 87.5%,平均完成时间缩短 19.1%。在三个长时灵巧任务上,用 HandITL 收集的干预数据训练的策略平均性能提升 19%。论文灵巧操作VLA模型人机交互推荐理由:灵巧操作是机器人领域的硬骨头,HandITL 解决了人机干预时的“手势跳跃”痛点,做机器人操作或 VLA 模型微调的团队可以直接参考实验方法,减少训练数据收集中的噪声。原文稍后读已读值得跟进有用关注 灵巧操作