15:34官方账号arXiv cs.LG@Ondrej Bajgar, Peter Tisnikar, Alessandro Abate, Konstantinos Gatsis, Maike OsborneQVIRL是一种新型贝叶斯逆强化学习方法,通过变分分布学习最优Q值,从专家演示中推断奖励函数后验。该方法结合了可扩展性与不确定性量化,适用于安全关键应用和主动学习。在网格世界、Lunar Lander、Highway Environment及两个ATARI游戏等任务中表现优异,且是首个能从原始像素观测训练的贝叶斯IRL方法。论文QVIRL逆强化学习贝叶斯推荐理由:想学逆强化学习?QVIRL能边学边给不确定性,还能主动问你要数据,比老方法稳多了。原文稍后读已读值得跟进有用关注 QVIRL
10:52官方账号arXiv cs.LG@Oussama Boussif, Mohammed Mahfoud, Younesse Kaddar, Moksh Jain, Sida Li, Damiano Fornasiere, Xiaoyin Chen, Yoshua Bengio, Esmeralda S. Whitammer符号回归旨在寻找描述目标变量与输入间随机依赖的代数表达式,不同于固定模型结构的参数拟合,它是在表达式空间中的搜索问题。ERRLESS(熵正则化强化学习用于表达式结构采样)通过最大熵强化学习,学习一个神经网络策略来逐步构建抽象语法树,从而从给定数据的表达式后验分布中采样。在Feynman基准上,ERRLESS取得了有竞争力的结果,同时生成简短且可解释的表达式。与SMC基线相比,ERRLESS近似后验预测均值实现了较高的决定系数(R²),凸显了贝叶斯视角在符号回归中的优势。论文ERRLESS符号回归强化学习推荐理由:想找能处理噪声数据、还能告诉你不确定性有多大的回归方法?ERRLESS用强化学习从后验里采样表达式,Feynman基准上表现不错,表达式还短。原文稍后读已读值得跟进有用关注 ERRLESS
05:59官方一手marktechpost@Sana Hassan精选本教程基于Google Meridian完整演示贝叶斯营销组合建模流程,从安装库、检查GPU到加载含媒体曝光、花费、转化、收入的地理级数据集。教程展示了如何将原始列映射到Meridian数据模式,并使用基于ROI的先验定义可解释的模型参数。最终输出媒体测量、ROI分析和预算优化结果,帮助营销团队量化各渠道贡献并重新分配预算。技巧Google Meridian营销组合建模贝叶斯推荐理由:想学Google Meridian做营销归因和预算分配?这篇手把手教程带你跑通整个流程,有实操代码和地理级数据示例。原文稍后读已读值得跟进有用关注 Google Meridian
09:36官方账号arXiv cs.LG@Afiq Abdillah Effiezal Aswadi, Haotong Ma, Susan Wei贝叶斯滤波变压器(BFT)是一种在两阶段生成序列上训练的 Transformer:先由先验抽取潜在任务,再根据该任务生成观测。在理想极限下,BFT 的下一词预测等于贝叶斯后验预测分布(PPD),但实际训练仅逼近该分布。论文提出预测蒙特卡洛(PMC)方法作为可解释性工具,仅利用下一词生成即可近似 BFT 内部隐含的先验和后验分布。PMC 被应用于三个任务族(0-Markov 和 1-Markov 可交换性),揭示了此前在预测空间观察到的现象在隐空间中依然存在。论文BFTPMC可解释性推荐理由:这篇论文提出了PMC方法,能直接看穿BFT模型内部认为的贝叶斯先验是什么,比传统对比法更靠谱。做可解释性研究的朋友可以试试。原文稍后读已读值得跟进有用关注 BFT