10:11官方账号arXiv cs.LG@Tomáš Holeček, Viliam Lisý精选73°NashDreamer是一种基于模型的强化学习框架,专为双人零和博弈设计。该框架引入了多智能体循环状态空间模型(MARSSM),在四个基准游戏中显著提升了早期训练的样本效率。研究还分析了Dreamer算法族在随机环境中面临的后验崩溃问题。论文NashDreamer强化学习零和博弈推荐理由:斯坦福团队推出NashDreamer,解决零和博弈中的非平稳性问题,比无模型基线训练效率更高。原文稍后读已读值得跟进有用关注 NashDreamer
11:42官方账号arXiv cs.LG@Akshay Balsubramani该研究提出了一种两人零和重复博弈框架,其中学习者和自然之间的值恒等式同时实现了贝叶斯更新和指数权重后悔的精确计算。论文将终端支付定义为比较器在固定相对熵条件下相对于先验的最大收益,并将一步约束设定为学习者混合行动下自然移动的信息预算。研究证明Gibbs/Bayes权重作为学习者的唯一Bellman等化器,使每轮损失独立于自然移动方向。后悔被精确分解为三个部分:每轮信息损失、重调温漂移和比较器相对于先验的信息,这一分解框架统一了bandit、后验采样、聚合和boosting等多种方法。论文贝叶斯更新后悔分解零和博弈推荐理由:这篇论文揭示了贝叶斯博弈中后悔分解的统一框架,将多种机器学习方法纳入同一理论体系。原文稍后读已读值得跟进有用关注 贝叶斯更新