12:17
12:17
官方账号arXiv cs.AI@Qinghua Mao, Wanying Qu, Dadi Guo, Leitao Yuan, Qingyu Liu, Yu Li, Guanxu Chen, Yanwei Fu, Xi Lin, Xia Hu, Dongrui Liu SafeEvolve是一种经验驱动的安全对齐框架,通过安全提示和分层技能的组件级更新实现可审计的运行时控制。该框架采用SFT-RL两阶段范式,在AgentDojo基准测试中,Qwen3.5-4B模型的安全响应率降低3倍,同时良性效用从59.79%提升至61.86%。实验证明该方法在安全-效用权衡上优于现有基线模型。
推荐理由:SafeEvolve通过策略协同进化提升AI智能体安全性,在降低有害响应的同时保持性能,比现有方法更有效。
12:16
12:16
官方账号arXiv cs.AI@Jianlyu Chen, Yuyang Hu, Hongjin Qian, Jiawei Liu, Wenqing Wei, Xiaolong Chen, Defu Lian, Zhicheng Dou, Chaozhuo Li, Qiwei Ye, Zheng Liu 研究人员提出DisCo技能驱动型研究代理,能将广泛使用的ML仓库提炼为可重用技能。该代理创建了AREX-Skill Library,包含5000多个从1000个常用ML仓库中提炼的验证技能,组织成20个领域和178个能力家族。使用GPT-5.5作为骨干模型,在MLE-bench基准上得分提升134.3%,在PaperBench上提升34.4%,在FrontierCS上提升9.2%,在PassNet上提升14.0%。
推荐理由:DisCo代理把GitHub仓库变成可重用技能,在多个AI研究基准上大幅提升性能,比无技能版本表现更好。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。