00:28OpenRouter@OpenRouterAIOri Eval 允许用户用自然语言描述 bug,并自动生成一个能证明该 bug 存在的失败 eval。修复 agent 后,该 eval 转为通过并保留在测试套件中,持续验证修复效果。用户可以将 Ori Eval 集成到 GitHub Actions,确保回归问题不会进入生产环境。AI产品Ori EvalGitHub Actions测试生成推荐理由:它能把一句 bug 描述变成自动测试,先失败后通过,挂到 CI 里就能挡住回归,挺省心的。原文稍后读已读值得跟进有用关注 Ori Eval
11:53官方账号arXiv cs.AI@Andras Ferenczi, Jordan Docherty, Mariya Bessonov, Matthew Findlay, Krishna Lingamneni论文提出Locksmith Loop,一种代理式测试合成方法,用于验证COBOL到Java的迁移正确性。该方法在商品硬件上同时运行COBOL源码和Java目标,通过Witness Search穿透分支并执行奇偶保留变异。在三个案例研究(两个开源程序和一个内部生产程序,规模从430到4,114行)中,Locksmith将分支覆盖率提升至接近完全,内部程序达到91.90%。生成的Java在所有接受测试用例中通过确定性奇偶校验。论文Locksmith LoopCOBOLJava推荐理由:这论文搞了个Locksmith Loop来验证COBOL转Java,实测分支覆盖率能到91.9%,比随机测强多了。原文稍后读已读值得跟进有用关注 Locksmith Loop
10:49官方账号arXiv cs.AI@Kaiwen Zhang, Guanjun Liu该论文提出一种Petri-net引导的LLM测试生成方法,用于并发有状态Rust API。方法将API资源、生命周期依赖建模为有色Petri网,推导合法深状态、近合法及偏序并发场景,作为LLM代码合成的约束中间表示。通过局部保真契约和结构修复循环确保模型意图在具体化过程中保留,Petri引导的调度塑造优先探索高冲突并发骨架。分层语义预言机区分合成失败与API预期行为违反,实验结果表明该方法在生成可执行测试和覆盖并发缺陷方面优于基线。论文RustLLMPetri-net推荐理由:这篇论文用Petri网编排LLM,自动生成并发Rust API的测试用例,比纯LLM生成的更可靠,能挖到深层并发bug。原文稍后读已读值得跟进有用关注 Rust