11:43官方账号arXiv cs.LG@Yuzhang Luo, Chenpeng Wang, Jianhui Chen, Liangming Pan精选73°研究团队提出了一种基于影响函数的响应重写方法,在四个开源大模型上测试。与传统的重加权干预相比,重写方法产生了更强、更持久且双向的行为转变。影响函数选择的样本在重写干预中展现出更大的杠杆作用,且变化集中在目标相关行为上。这一发现在安全拒绝任务中也表现出相同的定性对比。论文训练数据归因影响函数开源大模型推荐理由:研究人员发现影响函数选中的样本通过重写而非重加权能更有效改变模型行为,这对训练数据归因方法评估有重要启示。原文稍后读已读值得跟进有用关注 训练数据归因