论文10:36Pareto Q-Learning with Reward Machines:多目标强化学习算法这篇论文提出了PQLRM,把Pareto Q-Learning和奖励机器结合起来,在多目标任务里比基线收敛更快,还能找到普通方法找不到的最优策略。#PQLRM#Reward Machines#Pareto Q-Learning#多目标强化学习aarXiv cs.LG@Arnaud Lequen 等 3 人原文稍后读已读值得跟进有用关注 PQLRM