机器人领域的“RLHF 时刻”还缺什么:EXPO-FT 方法解析
Chelsea Finn 团队写了篇博客,讨论机器人怎么走 LLM 后训练的老路,还给出 EXPO-FT 方法,抓鸡蛋这类任务做到了 30 次全成功,只花 19 分钟真机交互。
Perry Dong 和 Chelsea Finn 在博客中提出,机器人预训练(VLA、世界-动作模型)已规模化,但缺少类似 LLM 的标准化后训练流程。文章指出机器人 RL 的三大难点:真实交互样本昂贵、一条任务链含数百次决策导致信用分配困难、环境随机性污染奖励信号。作者提出 EXPO-FT 方法,采用小模型编辑动作、大模型吸收改进的三段式设计。在六个操作任务上 EXPO-FT 达到 30/30 全成功率,平均仅需 19 分钟在线交互,超过 HG-DAgger、HIL-SERL 等基线。
机器人领域正处在 LLM 的 “GPT-2 时刻”:预训练(VLA、世界-动作模型)已经规模化,赋予了模型广而不稳的能力;行业现在缺的是一套标准化、可复用的后训练方法,把“能做”变成“每次都可靠地做”。 语言模型走过的路径:监督指令微调 → RLHF → 可验证奖励的 RL(RLVR),最终收敛成一套社区共享的“即插即用”流水线:强预训练底座 + 明确的环境/奖励定义 + 锚定参考模型的 RL + 对 reward hacking 的监控。 @perryadong 和 @chelseabfinn 两位作者认为机器人需要等价方案,且可靠性要求更苛刻,因为“机器人的一次坏动作不会等人来审核,它直接就发生了”。 pd-perry.github.io/posts/post-tra… 这套方案需要两样东西: · 算法:对十亿参数级模型稳定、且能从极少量真实经验中学习; · 协议:如何定义成功、如何复位场景、人如何介入反馈,这些目前在机器人学中都还是手工活。 为什么机器人 RL 与 LLM RL 是两回事? · 样本成本:围棋和 LLM 的动作生成廉价、可并行、易验证;机器人经验昂贵,而且“对真实物体的仿真可能比任务本身更难”。这迫使方法必须重用历史(off-policy)数据。 · 时间形状:LLM 一次 RL 回合对应一条完整回复;机器人是几百到上千步低层控制的链式决策(如 20ms 一拍、抓一个杯子约 500 次决策),奖励只在链条末端出现,信用分配极难。 · 随机性:物体滑落、传感器噪声、外部扰动让环境非确定,进一步污染信用分配。 三者共同把机器人推向基于价值(value-based)的 RL,而这恰恰是在十亿参数规模上最缺乏验证的方法族。这就是全文要解决的核心矛盾。 为什么现有方法都不行:一张“排除法地图”? 1. Q 梯度反传去噪过程 - Diffusion Q-Learning 系 信号要穿过长长的去噪链,贵且不稳;蒸馏到 1–2 步牺牲表达力 2. 采样后选择 - EMaQ、SfBC、IDQL 稳定,但策略本身从不学习,上限被底座模型的提议能力封死 3. 用动作梯度引导去噪步 - Psenka 2023、Fang 2024 需精细正则化,易不稳定 4. 在输入噪声空间上引导 - Wagenmaker et al. 2025 低风险,但只能重组冻结模型已知的行为,技能天花板由预训练决定 更深一层:经典 value-based RL(DDPG/TD3/SAC)假设高斯单峰策略,而前沿模型用扩散/流式生成来表现多模态行为(比如抓杯子可以抓柄也可以抓杯身);且价值方法“靠预测自己的未来预测来学习,再把这些预测当真值使用”,自举误差在十亿参数规模上被放大成不稳定。 EXPO-FT:作者给出的候选答案 机制设计相当精巧,核心是一个“大小模型分工 + 吸收回写”的三段式: 1. 编辑策略(edit policy):一个轻量级小模型,对底座模型输出的候选动作做有界的小幅修正,把动作从低价值区域推向所在模态的价值高峰。RL 的不稳定性被限制在这个小模型里,不会让大模型产生危险动作。 2. 执行时选择:机器人从底座模型采样若干候选动作,逐一编辑,再由价值函数挑出最优的那个执行。 3. 吸收(absorption):被选中且成功的动作回灌给预训练大模型继续训练,小编辑策略发现的改进被大模型的全部容量消化,从而真正学到新行为,而不是停留在噪声空间的重组。 人在环路中的角色是监督者:机器人出错时人工干预,干预数据进入训练(作者以 Waymo 远程安全员类比其可扩展性)。 实验结果:六个复杂操作任务(彩灯绕钩走线并插电、台球进球、花插瓶颈、翻鸡蛋、平衡球等),EXPO-FT 达到 30/30 全成功率,平均仅需 19 分钟在线交互,显著超过 SFT on π0.5、HG-DAgger、DSRL、HIL-SERL 等基线(后者的平均成功数大致在 5.5–20.5 区间)。 开放的协议问题 标题里 "Universal" 一词的真正所指。作者列出了配方化之前必须社区收敛的问题:奖励如何指定(机器人没有 RLVR 等价物,学习型成功分类器/奖励模型是有希望的方向)、复位由谁做(学习型复位策略、可逆任务设计)、人介入多少何时如何用、超参数默认值(学习率、UTD 比、停止准则、时域、控制频率)、初始化数据如何加权。他们已发布 EXPO-FT 的调参参考,作为朝这个方向迈出的一步。 Perry Dong @perryadong What will be the “RLHF” moment for robotics? What will it take to get robotics to where LLMs are today and beyond? New blog post with @chelseabfinn sharing some thoughts on the state of RL for frontier robotics models and what's missing 👇 Blog: pd-perry.github.io/posts/post-tra… H 🔗 View Quoted Tweet 💬 3 🔄 0 ❤️ 4 👀 820 📊 4 ⚡