11:41官方账号arXiv cs.AI@Yifeng He, Jicheng Wang, Yinzhe Zhao, Jiachen Liu, Hao ChenarXiv 论文提出自主研究智能体的 generate-and-rank 范式忽略了稀疏反馈问题。研究者认为其控制循环与灰盒模糊测试器一致,需在每次实验暴露廉价密集的认知进步信号。该信号应指导下一步干预,使智能体搜索而非重复采样,最终验证仍需保护性证据避免自适应复用。论文提出测试候选信号预测验证进步、反馈导向搜索比重复采样单位成本更多验证发现、保护性验证减少假发现。论文自主研究模糊测试反馈架构推荐理由:这篇论文把自主研究比作模糊测试,点出反馈架构才是瓶颈,不是生成。想搞懂 AI 科研智能体该往哪走,值得一看。原文稍后读已读值得跟进有用关注 自主研究
11:41官方账号arXiv cs.LG@Zhibin Kang, Hanmo You, Dong Wang, Haiming Zheng, Junjie Chen这篇论文对强化学习智能体的模糊测试方法进行了首次全面实证研究,从有效性、多样性、效率和实用性四个维度评估了五种最先进方法(MDPFuzz、SeqDivFuzz等)和随机测试。实验在MountainCar、BipedalWalker和CARLA三个复杂度递增的环境中进行统一配置。结果显示,MDPFuzz等吞吐量导向方法在发现崩溃方面更有效,而SeqDivFuzz等鼓励探索的方法更擅长发现多样化的崩溃行为。模糊测试产生的崩溃可有意义地提升智能体鲁棒性,并支持准确的跨方法泛化安全监控。论文强化学习模糊测试MDPFuzz推荐理由:这篇论文系统对比了RL模糊测试方法,告诉你MDPFuzz找崩溃快、SeqDivFuzz找花样多,还测了在CARLA等环境下的实际效果,做RL安全测试的别错过。原文稍后读已读值得跟进有用关注 强化学习