AITOPAI热报
今日精选全部动态早读东盟 AIAgent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOPAI热报

因果干预

共 4 条相关 AI 资讯
8月27日
10:46
10:46官方账号arXiv cs.AI@Raphaël Bonnet-Guerrini, Johann Ioannou-Nikolaides, Inar Timiryasov, Vincenzo Piuri
本研究首次将稀疏自编码器机制可解释性应用于粒子物理学。通过研究在IceCube数据上预训练并针对方向重建微调的ν中微子基础模型,我们使用严格的验证协议(包括保留测试、匹配干扰控制和独立字典训练的复制)识别了模型表示中的验证物理概念图。因果干预表明,方向头几乎没有利用这个图。受此未充分利用的信息启发,我们在同一事件级表示上训练了一个不确定性头,以预测模型的角重建误差。与方向头不同,它因果依赖于图中的质量和亮度特征。在20%的选择效率下,这个可解释估计器将中值角分辨率从20.2°提高到3.2°。这些结果表明,机制可解释性可以揭示模型内部表示中编码的学到的潜在物理,并有助于设计利用它的下游任务。
论文稀疏自编码器ν中微子基础模型物理概念图

推荐理由:这篇论文展示了如何利用稀疏自编码器在ν中微子基础模型中寻找可解释的潜在表示,这对于理解模型的内部工作原理和设计下游任务非常有帮助。与传统的方向头相比,这种新的不确定性头在预测角重建误差方面表现出色。
原文
8月18日
15:35
15:35官方账号arXiv cs.AI@Yiqi Liu, Yang Wang, Songxin Wang, Chenghao Xiao, Chenghua Lin
该研究通过受控保留设置,对语言模型拒绝回答时的内部机制进行了因果分析。研究发现,即使模型生成干净拒绝,正确答案仍可从隐藏状态线性恢复。释放被抑制的答案只需单位置补丁,而重新施加抑制则需要跨多个位置的干预。平均答案到拒绝的位移向量不能作为可靠的可逆线性控制开关。这表明拒绝并非简单对称开关,探针可恢复性可能高估真实行为控制能力。
论文LLM拒绝机制因果干预

推荐理由:这篇论文用因果干预实验拆解了LLM拒绝机制,发现答案释放和拒绝恢复不对称,对AI安全审计很有参考价值。
原文
7月21日
11:38
11:38官方账号arXiv cs.AI@Prakhar Gupta, Terry Jingchen Zhang, Florent Draye, Bernhard Schölkopf, Zhijing Jin
该研究在5个模型家族和7种BCT偏差类型上,通过探针、跨数据集迁移和因果干预三种方法提取偏差方向。发现偏差主要来自对齐微调,预训练基座模型几乎不受影响。每个偏差在隐藏状态中形成一个独立的因果方向,可解码并操控以恢复无偏答案。跨偏差纠缠具有模型特异性,行为相似的偏差占据不同方向。该干预方法能消除大部分偏差错误,同时保留正确回答。
论文对齐微调谄媚线索诱导偏差

推荐理由:这篇论文用五类模型分析了LLM为何容易被提示带偏,发现全是微调惹的祸,每个偏差还有独立方向,能直接修正。
原文
5月11日
11:45
11:45官方账号arXiv cs.AI(学术论文)
本研究通过押韵对联完成任务,测试语言模型在生成过程中是否存在对结构约束的未来标记的内部规划。使用线性探针和激活补丁方法,在Qwen3、Gemma-3和Llama-3三个系列超过十个规模的模型上进行实验。探针显示所有模型在行边界处都能线性解码未来押韵信息,且信号随规模增强。然而,激活补丁表明只有Gemma-3-27B在因果上依赖此编码,出现从押韵词到行边界的因果驱动转移(约第30层)。其他模型在整个生成过程中持续依赖押韵词,尽管行边界有强探针信号,但因果影响近乎为零。通过两阶段路径补丁,研究成功定位了Gemma-3-27B中负责转移的五个注意力头,恢复了约90%的押韵路由能力。
论文语言模型机制理解因果干预

推荐理由:该工作揭示了不同语言模型在规划能力上的根本差异:仅部分模型(如Gemma-3-27B)真正依赖内部的前瞻性计划,而其他模型则依赖逐词条件。这对理解模型内部机制和未来设计更可控的生成系统有参考价值。
原文
精选动态早读东盟登录