事件专题 ·多源确认

VaccineBooster:混合防御提升模型对有害微调的鲁棒性

研究人员提出VaccineBooster方法,结合嵌入扰动和梯度衰减两种技术,保护Llama-2-7B模型免受有害微调攻击。该方法在BeaverTails对齐后,OpenAI moderation分数降至0.315,仅使用梯度衰减的变体保持了50%的拒绝率。实验表明嵌入扰动主要减少有害内容,梯度衰减则保留拒绝行为。

当前结论

OpenAI新研究结合两种防御技术,让模型在保持拒绝能力的同时减少有害内容输出。

11 个信源41° AI 热度最后更新 2026/9/29 07:04:31

证据链

11 个信源
相关来源 10Rappler: Technology
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。