AITOPAI热报
今日精选全部动态早读东盟 AIAgent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOPAI热报

Fisher信息矩阵

共 2 条相关 AI 资讯
8月28日
20:21
20:21官方账号arXiv cs.LG@Dezheng Han, Anbang Zhang, Zhihao Zhu, Shuaishuai Guo
精选73°
研究人员提出FiUni框架,用于批级别任务检测和参数高效持续适应。该框架基于预训练模型的Fisher信息矩阵K-FAC近似的主子空间正交性观察,能反映不同任务间的相似性。FiUni构建FIM衍生的冻结子空间引导LoRA适配,同时匹配每个传入批窗口的Fisher主子空间与历史子空间。实验显示FiUni能有效推断潜在批级别任务关联,并在更少可训练参数下达到与先进任务感知CL方法相当的性能。
论文FiUni持续学习Fisher信息矩阵

推荐理由:清华团队提出FiUni框架,用Fisher信息矩阵解决无任务持续学习,比传统方法更高效。
原文
8月12日
18:12
18:12官方账号arXiv cs.LG@Nikita Sevriukov, Anna Barabanova, Uliana Gagarina, Karina Ivanova, Sofiia Kasaeva, Ilya Levin, Marina Sheshukova
逆强化学习(IRL)旨在从专家演示中恢复奖励函数,通常被建模为双层优化问题,内层为策略优化,外层衡量策略与专家数据的差异。然而,外层更新需要计算涉及内层目标逆Hessian向量积的超梯度,计算成本高昂。本文证明在内层最优处,内层目标的Hessian与策略的Fisher信息矩阵成正比,从而提出基于Fisher的超梯度,与自然超梯度下降紧密相关。为应对大规模Fisher矩阵的瓶颈,作者使用流式谱草图近似逆Fisher向量积,避免显式构造Fisher矩阵。在离散和连续控制环境中,该方法相比一阶随机双层基线,实现了有竞争力的策略性能和奖励排序质量,同时降低了曲率存储复杂度并提升了计算效率。
论文逆强化学习超梯度Fisher信息矩阵

推荐理由:这篇论文给IRL的超梯度计算找了个巧妙的捷径,用Fisher矩阵和谱草图省下大量算力,做强化学习的朋友可以看看。
原文
精选动态早读东盟登录