论文09:47论文:将 Jev 决策模型用作强化学习中的参考策略与探索裁判有意思的尝试:Jev 不生成文本、一次前向就出答案,论文让它当参考策略、探索裁判和回放评分器,MiniGrid 和 Atari 上都跑赢了标准 RL 学习器。#Jev#强化学习#MiniGrid#AtariaarXiv cs.LG@Yi Ma 等 5 人原文稍后读已读值得跟进有用关注 Jev