9月3日
12:17
12:17官方账号arXiv cs.AI@Qinghua Mao, Wanying Qu, Dadi Guo, Leitao Yuan, Qingyu Liu, Yu Li, Guanxu Chen, Yanwei Fu, Xi Lin, Xia Hu, Dongrui Liu
精选73°
SafeEvolve是一种经验驱动的安全对齐框架,通过安全提示和分层技能的组件级更新实现可审计的运行时控制。该框架采用SFT-RL两阶段范式,在AgentDojo基准测试中,Qwen3.5-4B模型的安全响应率降低3倍,同时良性效用从59.79%提升至61.86%。实验证明该方法在安全-效用权衡上优于现有基线模型。
推荐理由:SafeEvolve通过策略协同进化提升AI智能体安全性,在降低有害响应的同时保持性能,比现有方法更有效。
8月5日
11:38
11:38官方账号arXiv cs.AI@Dongjie Yang, Siyan Lin, Leixian Shen, Rui Sheng, Huamin Qu, Zixin Chen
论文提出TACT框架,用于训练和评估教学自适应的英语辅导模型。该框架包含13种辅导策略的Tutor-Strategy分类法和描述学生行为的Student-Move分类法。基于两套分类法构建的TACTCorpus覆盖260段师生对话,含32,379条标注。后训练的TACTutor在TACTBench(78个场景)上比基座模型Qwen3.5-4B提升20.30%,并在50名学习者的盲测中获得最高评分。
推荐理由:这篇论文把教学策略拆成13种,用260段真实对话和3.2万条标注训练出TACTutor,在78个测试场景比基座涨了20%,盲测还赢过商业模型。