18:42官方一手arXiv: DeepSeek@Linhao Wu, Yizhou Chen, Zhen Yang, Pengyu Xue, Dan HaoCausalRepair是一个基于对话的自动程序修复框架,通过双切片策略构建最小因果上下文。静态切片净化测试语义,动态切片基于执行轨迹捕获精确运行时依赖。在Defects4J V1.2、V2.0和Defects4J-Trans上使用DeepSeek-V3评估,正确修复313个缺陷,优于ReinFix和TSAPR,平均修复成本降至0.029美元。论文CausalRepairDeepSeek-V3Defects4J推荐理由:想搞LLM自动修bug的可以看看,CausalRepair用双切片把上下文搞干净了,修复数比ReinFix多,成本还低。原文稍后读已读值得跟进有用关注 CausalRepair
11:03官方一手arXiv: DeepSeek@Tiancheng Ma, Nasir U. Eisty该研究基于Defects4J中10个真实bug(Lang 1、3-11),提出需求驱动流水线,比较5个LLM(DeepSeek-V3、Gemma-3n、Llama-3、Mistral-7B、Qwen-3)生成Java测试预言的正确性与泛化能力。实验表明LLM生成的预言与需求预言(REQ)的一致性高于与系统(SUT)的一致性,宏平均准确率、精确率、召回率和F1均报告,但不同bug和模型间方差显著。需求技术性/模糊性评分与预言准确率之间的相关性弱且置信区间宽,未发现可检测的线性关系。研究结论为初步可行性证明,旨在推动更大规模实证。论文Defects4JLLM测试预言推荐理由:这篇论文用10个真实bug和5个流行LLM测试了它们能否直接从业务需求写测试断言,发现效果还行但差异大。如果你想了解LLM在自动化测试中的实际能力,这篇值得看看。原文稍后读已读值得跟进有用关注 Defects4J