对抗训练

general · 首次出现 2026-05-22 · 最近出现 2026-08-31 · 累计提及 6

综述

对抗训练近期进展

对抗训练是一种在机器学习中通过模拟对抗攻击来增强模型鲁棒性的技术。近期,该领域的研究取得了显著进展,以下是一些关键进展。

CGRm:面向长尾对抗训练的新重平衡方法

原文标题:CGRm:面向长尾对抗训练的新重平衡方法 该方法针对长尾对抗训练中的数据不平衡问题,提出了一种新的重平衡方法,有效提高了模型在长尾数据上的性能。

OpenAI 发布 GPT-5.6 Sol,对抗 prompt 注入失败率降低 6 倍

原文标题:OpenAI 发布 GPT-5.6 Sol,对抗 prompt 注入失败率降低 6 倍 OpenAI 最新发布的 GPT-5.6 Sol 模型在对抗 prompt 注入方面的失败率降低了 6 倍,显示出对抗训练在提升模型安全性方面的潜力。

结合可验证奖励与人类演示的语言模型训练方法

原文标题:结合可验证奖励与人类演示的语言模型训练方法 该研究提出了一种结合可验证奖励和人类演示的方法,以提升语言模型的训练效果。

语义通信中继辅助系统中的语义泄漏与隐私保护

原文标题:语义通信中继辅助系统中的语义泄漏与隐私保护 该研究关注语义通信中继辅助系统中的隐私保护问题,提出了一种新的方法来减少语义泄漏的风险。

ASAM:对抗子空间对齐实现鲁棒多模态知识编辑

原文标题:ASAM:对抗子空间对齐实现鲁棒多模态知识编辑 ASAM 方法通过对抗子空间对齐,实现了鲁棒的多模态知识编辑。

LCGuard:多智能体系统中安全KV缓存共享的潜在通信防护框架

原文标题:LCGuard:多智能体系统中安全KV缓存共享的潜在通信防护框架 LCGuard 框架旨在保护多智能体系统中的 KV 缓存共享,通过潜在通信防护来增强系统的安全性。

当前焦点与观察点

对抗训练领域的研究正逐渐从单一任务扩展到多模态、多智能体等复杂场景。同时,如何平衡模型性能与安全性,以及如何处理数据隐私问题,成为当前研究的焦点。

相关报道

7 条在档