15:43量子位@量子位的朋友们73°阿里发布Qwen3.8-Max模型,在HumanEval编程基准上得分为84.5分,超越GPT-4o成为全球第一。该模型在代码生成、调试和优化方面表现优异,支持多种编程语言。Qwen3.8-Max还增强了多模态处理能力,能够理解和生成图文内容。AI模型Qwen3.8-Max阿里编程推荐理由:阿里Qwen3.8-Max编程能力登顶全球,代码生成超越GPT-4o,开发者必看。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
00:05elvis@omarsar0精选该论文分析了大量公开的智能体后训练轨迹。研究发现,智能体在第一步就锁定了训练策略,后续仅进行局部调整。论文尝试了三种改进方法:经验驱动的脚手架提升了GSM8K和HumanEval的分数,但策略仍保持冻结。人类指导能改变初始选择,但训练开始后智能体又回到局部循环。额外推理计算对简单任务有效,对最难任务几乎无效。论文智能体后训练GSM8K1 个信源在谈事件专题推荐理由:这篇论文测试了智能体能否训练其他智能体,发现它们在第一步就锁定了策略,后续改进效果有限。作者尝试了三种方法,但智能体仍缺乏在执行中重新考虑策略的能力。原文稍后读已读值得跟进有用关注 智能体
10:12官方账号arXiv cs.LG@Joy Jia Yin Lim, Xin Huang, Hao Peng, Yaxi Lu, Xin Cong, Zhong Zhang, Maosong Sun, Yankai Lin针对大型语言模型(LLM)后训练,研究发现其训练策略常锁定初始选择;分析公开数据后发现,训练预算多用于局部调整而非策略修订;干预实验显示,增加经验或指导仅提升执行效果,未改变策略;不同任务上的计算投入效果存在明显差异。论文LLMGSM8KHumanEval1 个信源在谈事件专题推荐理由:OpenAI做了关于大模型后训练的研究,能分析训练策略问题,和以前方法比效果不一样。原文稍后读已读值得跟进有用关注 LLM
12:14官方账号arXiv cs.AI@Xueping Gao, Jianwei Yang, Qiang Yang该研究基于30个HumanEval修复任务的900条三轮修订轨迹发现,强制修订后当前正确率从第一轮的0.820下降至第二轮后的0.673,但最终正确率升至0.847。在140亿参数模型复制实验中,使用陈旧轨迹导致34/135初始正确修复受损,而使用当前轨迹仅4/135受损(提升22.2个百分点,95% CI [8.9,37.0],Holm p=0.0337)。前瞻性540次 rollout 政策消除了初始正确的损害,但降低了错误修复能力。论文提出状态绑定证据与类型化修订契约,并在参考实现中强制可机械验证的子集。论文Agentic Code RepairHumanEval智能体推荐理由:这篇论文用实验数据告诉你,让AI反复修改代码不靠谱,并给出了带状态绑定的证据机制,做代码修复的开发者值得看看。原文稍后读已读值得跟进有用关注 Agentic Code Repair
12:15官方账号arXiv cs.AI@Zhen Zhao, Qihang Yang, Feifei Dai, Xiangfang Li, Bo LiMineValiCoder 提出一种协作闭环测试驱动开发(TDD)框架,包含三个模块:测试用例质量挖掘(TCQM)通过自验证过滤缺陷测试,并行TDD迭代优化生成高质量代码候选,二分图代码-测试互验(BiCoTeV)动态建模代码-测试交互进行可靠选择。在 HumanEval 上 Pass@1 达 96.34%,MBPP 上 87.40%,APPS 上 64.00%,LiveCodeBench 上 51.33%,显著优于现有方法。MineValiCoder 有效缓解了 LLM 随机性导致的不稳定代码生成问题。论文MineValiCoder测试驱动开发代码生成推荐理由:这篇论文用MineValiCoder框架搞定代码生成不可靠问题,HumanEval跑出96.34%通过率,比之前的方法强一截,搞LLM代码的同学值得看看。原文稍后读已读值得跟进有用关注 MineValiCoder