12:15官方账号arXiv cs.AI@Zhen Zhao, Qihang Yang, Feifei Dai, Xiangfang Li, Bo LiMineValiCoder 提出一种协作闭环测试驱动开发(TDD)框架,包含三个模块:测试用例质量挖掘(TCQM)通过自验证过滤缺陷测试,并行TDD迭代优化生成高质量代码候选,二分图代码-测试互验(BiCoTeV)动态建模代码-测试交互进行可靠选择。在 HumanEval 上 Pass@1 达 96.34%,MBPP 上 87.40%,APPS 上 64.00%,LiveCodeBench 上 51.33%,显著优于现有方法。MineValiCoder 有效缓解了 LLM 随机性导致的不稳定代码生成问题。论文MineValiCoder测试驱动开发代码生成推荐理由:这篇论文用MineValiCoder框架搞定代码生成不可靠问题,HumanEval跑出96.34%通过率,比之前的方法强一截,搞LLM代码的同学值得看看。原文稍后读已读值得跟进有用关注 MineValiCoder
10:08官方账号arXiv cs.AI@Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl论文提出掩码感知策略梯度方法,解决强化学习应用于掩码扩散语言模型(MDLM)时对数似然估计难的问题。方法将MDLM生成建模为两阶段动作MDP,策略梯度分解为token项和掩码项。联合优化两项后,模型在GSM8K上达87.1%准确率,在MBPP上达53.4%得分,均达到当前最优。论文MDLM扩散语言模型策略梯度推荐理由:这篇论文给扩散语言模型加了个策略梯度法子,数学推理和编程测试成绩都刷了新高,搞RL训练模型的可以看看。原文稍后读已读值得跟进有用关注 MDLM