09:35官方账号arXiv cs.AI@Minghui Xu, Zi Wang精选73°研究分析了大语言模型在Countdown任务中的计算错误问题。构建了监督微调数据集教授模型工具使用模式。应用RLOO、RLOO++、GRPO和DAPO等强化学习方法。在1024题的独立测试基准上,Tool-DAPO将pass@1从35.8%提升至66.0%。强化学习鼓励更有效的工具使用,即使只提供最终答案奖励。技巧数学推理工具集成强化学习推荐理由:OpenAI研究团队用计算器工具+强化学习,把数学推理准确率提升30个百分点,方法开源可复现。原文稍后读已读值得跟进有用关注 数学推理
09:56官方一手arXiv: DeepSeek@Yanyu Chen, Yue Li, Yongyi Cui, Dongsheng Shi, Lichang DaiSelectBench是一个控制性基准和训练集,用于大语言模型选择性采纳检索结果中的证据。基于Qwen3.5-4B,使用DAPO强化学习方法,通过确定性规则奖励或语义法官进行后训练。在325样本的SelectBench-v2测试集上,严格成功率从原始检查点的22.46%提升至DAPO-Rule的25.54%和DAPO-DeepSeek的26.46%。两种策略均减少了禁止内容采纳,生成了更短更聚焦的回答,但提示注入跟随能力未改善。在MMLU和干净HotpotQA上未见明显退化,表明通用能力保持。论文SelectBenchDAPOQwen3.51 个信源在谈事件专题推荐理由:Qwen3.5用强化学习学会在污染检索中挑有用证据,成功率从22%提到26%,还不掉通用分。原文稍后读已读值得跟进有用关注 SelectBench