8月28日
19:37
19:37官方账号arXiv cs.AI@Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong
精选73°
研究人员发现当前LLM智能体安全机制存在组合失效问题。传统安全监控器仅在单次轨迹内工作,无法检测跨迭代攻击。论文提出LoopHarness系统,通过持久化非衰减安全状态,将未授权操作期望数量控制在常数范围内。该研究在Agent-SafetyBench基准上进行了完整评估,包含清洁和攻击场景的配对测试。
推荐理由:MIT学者发现LLM智能体安全漏洞,提出LoopHarness解决跨迭代攻击问题,安全性能显著提升。
7月1日
10:44
10:44官方账号arXiv cs.AI@Sergio Hernández-Gutiérrez, Matteo Merler, Ilze Amanda Auzina, Joschka Strüber, Ameya Prabhu, Matthias Bethge
QVal是一个无训练测试床,直接评估密集监督信号的质量。它通过Q对齐指标衡量信号是否按强化学习参考策略的Q值排序动作。在四个环境、七个方法家族中基准测试21种密集监督方法,涉及1200+次评估实验和六个开源模型。结果发现简单提示基线持续优于近年提出的密集监督方法,且性能按方法家族聚类。
推荐理由:这篇论文提出了一个高效的评估框架,帮你省去昂贵的训练代价来判断哪种监督信号对长程智能体更有效,结论很实用。