11:50官方账号arXiv cs.LG@Shaker Al-Tamari, Waled Kadour在倒立摆基准上,TD3教师模型(Twin Delayed DDPG)的策略被蒸馏至浅层决策树学生。通过自定义物理感知特征和噪声Oracle Rollouts生成数据集,学生模型性能与教师相当。控制理论分析显示从连续控制转向离散规则控制导致高频Bang-Bang执行和稳定双模态极限环。BIBO稳定性得到维持,同时提供了全局和局部可解释性。论文TD3可解释性决策树推荐理由:研究者用决策树“拆解”了黑箱TD3,在倒立摆任务上性能不减,还解析了控制规律,适合安全关键AI参考。原文稍后读已读值得跟进有用关注 TD3
11:22官方账号arXiv cs.LG@Slava Andrejev论文提出将Lyapunov特征指数作为强化学习倒立摆稳定问题的密集奖励信号。代理成功找到了Kapitza摆的经典振荡运动。此外,代理还能够阻尼摆的摆动,使其严格保持竖直状态,超越了Kapitza摆的稳定效果。该方法展示了物理信息奖励在复杂控制任务中的有效性。论文Lyapunov exponentKapitza pendulum强化学习推荐理由:这篇论文用Lyapunov指数做奖励,让强化学习不仅复现了Kapitza摆,还找到了更稳的竖直不倒方案,挺有意思。原文稍后读已读值得跟进有用关注 Lyapunov exponent