09:36官方账号arXiv cs.LG@Taiane Schaedler Prass, Alisson Silva Neimaier, Guilherme Pumi该论文将概率回归树(PRTrees)扩展为可直接处理缺失预测变量,无需预先插补。提出了三种策略:均匀概率法、部分观测法和降维平滑法,均保持概率守恒和边际兼容性。在多个真实数据集上与经典回归树CART对比,结果显示填充策略对预测性能影响最大。当数据缺失比例较高时,所提方法常优于CART,同时保留树模型的解释性。论文PRTreesCART概率回归树推荐理由:这篇论文给PRTrees加了直接处理缺失值的能力,不用先插补。在缺数据多的场景下比CART更准,关键还保持树模型好解释。原文稍后读已读值得跟进有用关注 PRTrees
09:41官方账号arXiv cs.LG@Ziheng Wei, Annie Qu, Rui Miao离线强化学习中,即时奖励常因记录稀疏或审查而缺失,导致评估偏差。本文聚焦奖励缺失非随机(MNAR)场景,在有限时域MDP下研究离线策略评估(OPE)。作者利用未来状态作为影子变量,结合奖励依赖倾向模型辨识全数据条件均值奖励。进一步引入桥函数并通过min-max估计避免双重采样,提出Fitted-Q-Evaluation风格估计器。在模拟数据和MIMIC-III Sepsis数据上,该方法在误差和一致性上优于现有基线。论文OPEMNARMDP推荐理由:想处理真实场景奖励缺失的强化学习玩家可以看这篇,用影子变量和桥函数解决偏差问题,实验比传统方法稳。原文稍后读已读值得跟进有用关注 OPE