12:17官方账号arXiv cs.AI@Qinghua Mao, Wanying Qu, Dadi Guo, Leitao Yuan, Qingyu Liu, Yu Li, Guanxu Chen, Yanwei Fu, Xi Lin, Xia Hu, Dongrui Liu精选73°SafeEvolve是一种经验驱动的安全对齐框架,通过安全提示和分层技能的组件级更新实现可审计的运行时控制。该框架采用SFT-RL两阶段范式,在AgentDojo基准测试中,Qwen3.5-4B模型的安全响应率降低3倍,同时良性效用从59.79%提升至61.86%。实验证明该方法在安全-效用权衡上优于现有基线模型。论文SafeEvolveQwen3.5-4BAgentDojo推荐理由:SafeEvolve通过策略协同进化提升AI智能体安全性,在降低有害响应的同时保持性能,比现有方法更有效。原文稍后读已读值得跟进有用关注 SafeEvolve
19:57官方账号arXiv cs.AI@Xiaokun Guo, Zhen Xu, Dongdong Huo, Yanqiu Zhang, Wei Wang, Qinfu Yang, Dongjin Yu, Yu Wang精选73°SARA系统解决了工具增强LLM智能体中工具输出从数据变为命令的安全风险。该系统将行动诱导与执行授权分离,在AgentDojo和AgentDyn测试中,将ASR控制在0.63%以下。SARA通过上下文隔离的行动探测和No-History-Promotion技术,保持任务效用同时提升安全性。论文LLM agentsSARA工具安全推荐理由:研究人员提出SARA框架,解决了LLM智能体中工具输出被滥用的安全问题,在四个主要评估设置中表现优异。原文稍后读已读值得跟进有用关注 LLM agents