13:14Amjad Masad@amasad精选阿马德·马萨德训练国际象棋LLM时发现,单纯用棋盘→走法配对数据在投入超1000小时后遭遇明显收益递减。一次意外中,一个"先思考再走棋"的分支因产生幻觉走法而失败,但他将约8%的这种推理轨迹混合进纯走法数据,在同等训练预算下取得了优于纯数据的效果。模型通过吸收推理轨迹,在推理时不再实际执行思考过程。最终模型Elo得分达到1300。AI模型象棋AI推理模型训练技巧推荐理由:他试了在象棋AI数据里掺8%的推理数据,效果直接碾压纯数据,轻松上1300分。原文稍后读已读值得跟进有用关注 象棋AI
04:12elvis@omarsar0精选该帖子提出一个后训练技巧:训练长周期智能体(long-horizon agents)时无需使用长周期 rollout。可以在短任务(short tasks)上训练,这类任务奖励成本低且验证容易。然后利用框架(harness)将能力扩展8-32倍,显著降低训练成本。技巧post-traininglong-horizon agentsshort tasks推荐理由:这篇帖子讲了个后训练小诀窍:短任务训练就能让智能体扩展到8-32倍的长周期,省时省力,值得试试。原文稍后读已读值得跟进有用关注 post-training