Against在人工智能领域主要指对抗性训练和防御机制,是AI安全研究中的重要方向,用于保护模型免受恶意攻击和有害影响。
Against近期进展
2024年7月3日发布的论文Learning Only What Valid Adapters Can Express: Subspace-Constrained Adaptation Against Fine-Tuning Poisoning探讨了对抗微调中毒的子空间约束适应方法,提出了新的防御策略。该研究通过限制模型适应的子空间,有效防止了恶意数据注入导致的模型性能下降。
2024年6月30日发表的Defending Against Harmful Supervision Hidden in Benign Samples研究了如何防御隐藏在良性样本中的有害监督,为AI安全提供了新思路。这种方法能够识别并过滤掉看似无害但实际包含有害指令的训练数据。
写AGENTS.md规则前看看Harness-IF:区分真规则与巧合讨论了在构建AI规则系统时如何避免过度拟合,强调了Against原则的重要性。
当前焦点与观察点
目前,Against研究方向正从简单的对抗样本防御扩展到更复杂的模型鲁棒性保护。随着AI模型规模扩大和应用场景增多,针对模型安全的Against研究显得尤为重要。未来,跨领域的Against防御策略和自适应防御机制将成为研究热点。