11:43官方账号arXiv cs.LG@Yuzhang Luo, Chenpeng Wang, Jianhui Chen, Liangming Pan精选73°研究团队提出了一种基于影响函数的响应重写方法,在四个开源大模型上测试。与传统的重加权干预相比,重写方法产生了更强、更持久且双向的行为转变。影响函数选择的样本在重写干预中展现出更大的杠杆作用,且变化集中在目标相关行为上。这一发现在安全拒绝任务中也表现出相同的定性对比。论文训练数据归因影响函数开源大模型推荐理由:研究人员发现影响函数选中的样本通过重写而非重加权能更有效改变模型行为,这对训练数据归因方法评估有重要启示。原文稍后读已读值得跟进有用关注 训练数据归因
10:51官方账号arXiv cs.LG@Mathieu Dagréou, Aurélien Bellet精选该论文研究了机器学习模型隐私审计中的金丝雀(canary)生成问题,旨在通过单次训练运行高效评估隐私泄露。作者提出一种结合影响函数贪婪初始化与双层优化的方法,生成既高可检测又低干扰的金丝雀,通过促进嵌入空间多样性减少金丝雀间干扰。实验表明,该方法在更低计算成本下获得比现有方法更强的隐私泄露估计,为差分隐私审计提供了实用改进。论文隐私审计差分隐私金丝雀生成推荐理由:做隐私审计或差分隐私研究的团队,这篇论文直接解决了单次运行审计中金丝雀干扰的痛点,提出的方法计算效率高且效果更好,值得点开看具体实现。原文稍后读已读值得跟进有用关注 隐私审计