论文20:13论文:解析解 broker-trader 博弈中 PPO 奖励正确仍学不准这篇用有解析解的金融博弈当考卷,发现 PPO 奖励给对了也学不准,问题出在 critic 排序动作的能力上,对做 RL 金融应用的人很有参考价值。#PPO#强化学习#reward shaping#论文aarXiv cs.AI@Siu Tung Wong, Carlo Campajola原文稍后读已读值得跟进有用关注 PPO