10:47官方账号arXiv cs.LG@Md Mokarram Chowdhury, Ernie Chang, Yang Li精选73°研究人员通过机械可解释性方法分析了角色扮演越狱如何导致模型拒绝有害请求的能力减弱。研究涵盖两个基准测试、三个模型家族和四种包装器,发现成功攻击保留了有害与良性请求的区分度,但在回答开始时拒绝表达减弱,这种现象称为安全传递衰减。移除与场景框架相关的激活可以恢复拒绝能力,这些效果与模型在没有角色扮演时拒绝有害请求的内部结构共享。论文角色扮演越狱安全传递机械可解释性推荐理由:这篇论文揭示了角色扮演越狱如何绕过AI安全机制,找到了具体的安全防护目标。原文稍后读已读值得跟进有用关注 角色扮演越狱
15:35官方账号arXiv cs.AI@Yiqi Liu, Yang Wang, Songxin Wang, Chenghao Xiao, Chenghua Lin该研究通过受控保留设置,对语言模型拒绝回答时的内部机制进行了因果分析。研究发现,即使模型生成干净拒绝,正确答案仍可从隐藏状态线性恢复。释放被抑制的答案只需单位置补丁,而重新施加抑制则需要跨多个位置的干预。平均答案到拒绝的位移向量不能作为可靠的可逆线性控制开关。这表明拒绝并非简单对称开关,探针可恢复性可能高估真实行为控制能力。论文LLM拒绝机制因果干预推荐理由:这篇论文用因果干预实验拆解了LLM拒绝机制,发现答案释放和拒绝恢复不对称,对AI安全审计很有参考价值。原文稍后读已读值得跟进有用关注 LLM