20:21官方账号arXiv cs.LG@Dezheng Han, Anbang Zhang, Zhihao Zhu, Shuaishuai Guo精选73°研究人员提出FiUni框架,用于批级别任务检测和参数高效持续适应。该框架基于预训练模型的Fisher信息矩阵K-FAC近似的主子空间正交性观察,能反映不同任务间的相似性。FiUni构建FIM衍生的冻结子空间引导LoRA适配,同时匹配每个传入批窗口的Fisher主子空间与历史子空间。实验显示FiUni能有效推断潜在批级别任务关联,并在更少可训练参数下达到与先进任务感知CL方法相当的性能。论文FiUni持续学习Fisher信息矩阵推荐理由:清华团队提出FiUni框架,用Fisher信息矩阵解决无任务持续学习,比传统方法更高效。原文稍后读已读值得跟进有用关注 FiUni
18:12官方账号arXiv cs.LG@Nikita Sevriukov, Anna Barabanova, Uliana Gagarina, Karina Ivanova, Sofiia Kasaeva, Ilya Levin, Marina Sheshukova逆强化学习(IRL)旨在从专家演示中恢复奖励函数,通常被建模为双层优化问题,内层为策略优化,外层衡量策略与专家数据的差异。然而,外层更新需要计算涉及内层目标逆Hessian向量积的超梯度,计算成本高昂。本文证明在内层最优处,内层目标的Hessian与策略的Fisher信息矩阵成正比,从而提出基于Fisher的超梯度,与自然超梯度下降紧密相关。为应对大规模Fisher矩阵的瓶颈,作者使用流式谱草图近似逆Fisher向量积,避免显式构造Fisher矩阵。在离散和连续控制环境中,该方法相比一阶随机双层基线,实现了有竞争力的策略性能和奖励排序质量,同时降低了曲率存储复杂度并提升了计算效率。论文逆强化学习超梯度Fisher信息矩阵推荐理由:这篇论文给IRL的超梯度计算找了个巧妙的捷径,用Fisher矩阵和谱草图省下大量算力,做强化学习的朋友可以看看。原文稍后读已读值得跟进有用关注 逆强化学习