论文10:59SQAM:用标量伴随匹配做 Q-Learning,加速流策略 RL 微调流策略微调太慢的问题有解了,这篇 SQAM 砍掉了每步的反向传播计算,OGBench 难题成功率提升最多 35 个点,还验证到了真实双臂机器人上。#SQAM#OGBench#强化学习#flow policyaarXiv cs.AI@Yonghoon Dong 等 6 人原文稍后读已读值得跟进有用关注 SQAM