8月27日
09:32
09:32官方账号arXiv cs.AI@Xu Zheng, Zichuan Liu, Zhuomin Chen, Mayur Akewar, Janki Bhimani, Jason Liu, Mo Sha, Jingchao Ni, Wei Cheng, Dongsheng Luo
现有时间序列数据深度学习模型解释方法分为归因解释和反事实解释,但两者研究独立,导致归因方法缺乏因果验证,反事实方法不稳定。本文从信息论角度重新审视时间序列可解释性,提出统一目标函数,引入模型{\modelname},在合成和真实世界基准上优于现有方法,提供可靠归因和稳定的反事实解释。
推荐理由:这篇论文提出了一个新颖的时间序列解释框架{\modelname},它结合了归因和反事实解释,对于需要透明和可解释模型行为的应用来说非常有用,值得一读。
7月1日
10:45
10:45官方账号arXiv cs.AI@Zifan Carl Guo, Laura Ruis, Jacob Andreas, Belinda Z. Li
73°
论文发现,用固定反事实解释训练语言模型(LM)时,产生的解释更忠实于当前行为而非训练目标。该现象在谄媚(sycophancy)和拒绝(refusal)等任务中出现。即使同时进行其他后训练目标,解释也能追踪行为偏移。结果表明,固定数据集的反事实解释可作为可扩展的后训练信号。
推荐理由:论文发现,用模型早期检查点的解释训练自己,它给出的解释反而更忠实于当前行为,能追踪行为变化,挺神奇的。
6月16日
10:52
10:52官方账号arXiv cs.LG@Eric Günther, Balázs Szabados, Kristof Meding, Gunnar König, Sebastian Bordt, Ulrike von Luxburg
论文提出解释卡(Explanation Cards)来增强算法解释的实用性,通过补充鲁棒性和有效性信息以及明确解释指南。以反事实解释和SHAP为例展示构建方法。解释卡将正确解读的责任从用户转移至提供者。该方案可操作化欧盟AI法案的可解释性条款。
推荐理由:这篇论文提出了解释卡,能帮你避免被算法解释误导,而且用SHAP和反事实解释举了具体例子。