论文10:31DRIVE:用多样性驱动的 RL 微调提升 VLA 泛化能力一篇机器人方向的新论文:给 VLA 模型加了个多样性奖励来做 RL 微调,π_0 分布外成绩提了 5.3 分,真机上成功率也从 64% 涨到 73%。#DRIVE#VLA#强化学习#π_0aarXiv cs.LG@Haoru Li 等 8 人原文稍后读已读值得跟进有用关注 DRIVE