09:42官方账号arXiv cs.AI@Chi Wang, Hanwen Wang, Yu Xia, Zihan Wang, Guangdong BaiCaliber是一种针对分数返回API的模型提取防御方法,通过向内部logits添加独立同分布高斯噪声来干扰攻击者。论文证明噪声尺度与预测一致性单调递减,并推导了固定输入下恢复干净logits所需查询次数的闭式极小极大下界。在三十多个模型-数据集组合上,逐模型校准的平均绝对相对误差为0.6%-1.4%。端到端实验显示替代模型性能与配置的退化程度一致。论文Caliber模型提取API安全推荐理由:这篇论文提出了Caliber,一种给API返回分数加噪的防御方法,能控制攻击者提取模型的成本,还给出了理论保证和实验数据。原文稍后读已读值得跟进有用关注 Caliber
11:39官方账号arXiv cs.AI@Bang An, Yibo Yang, Dandan Guo, Ebtisam Alshehri, Carlos Hinojosa, Bernard Ghanem论文提出Embedded Attack,将有害的问答对嵌入良性训练样本中,测试表明代表性防护机制在样本级别难以检测。为应对这一威胁,作者提出双参考SFT(DR-SFT),通过词元级正则化将DPO风格的对比目标适配到SFT,在粗粒度数据过滤之外缓解有害微调。实验证明该攻击能绕过现有防御,而DR-SFT可有效降低有害行为。论文Embedded AttackDR-SFTAI安全推荐理由:这篇论文揭示了有害微调的新方式,提出Embedded Attack和DR-SFT,对AI安全研究者很有启发。原文稍后读已读值得跟进有用关注 Embedded Attack