论文政策与合规21:13Defensive Policy Gradient:去掉重要性权重方差假设的 O(ε⁻³) 采样复杂度优化策略梯度的人可以看看:新算法 Defensive Policy Gradient 不再依赖重要性权重方差假设,就能拿到 O(ε⁻³) 采样复杂度,还配了下界证明。#REINFORCE#策略梯度#强化学习#Defensive Policy GradientaarXiv cs.LG@Gabor Paczolay 等 5 人原文稍后读已读值得跟进有用关注 REINFORCE