11:25官方账号arXiv cs.LG@Bertil Braun, Martin Forell这篇论文提出用多个LLM对输出做两两比较、再用Elo评分生成排名的评估框架。通过可调的同意阈值,从全票一致到多数投票,控制评估置信度与覆盖率。作者在科学摘要生成的胜任力画像上做了验证,自动排名与专家判断相关性良好。相比人工评估显著减少干预成本,且不依赖参考标准。论文编号为arXiv:2607.28282v1。论文LLM评估Elo评分自动化评估推荐理由:多模型两两PK加Elo计分来评LLM输出,能调阈值控严格度,科学摘要上跟专家判断挺接近。原文稍后读已读值得跟进有用关注 LLM评估
13:14Amjad Masad@amasad精选阿马德·马萨德训练国际象棋LLM时发现,单纯用棋盘→走法配对数据在投入超1000小时后遭遇明显收益递减。一次意外中,一个"先思考再走棋"的分支因产生幻觉走法而失败,但他将约8%的这种推理轨迹混合进纯走法数据,在同等训练预算下取得了优于纯数据的效果。模型通过吸收推理轨迹,在推理时不再实际执行思考过程。最终模型Elo得分达到1300。AI模型象棋AI推理模型训练技巧推荐理由:他试了在象棋AI数据里掺8%的推理数据,效果直接碾压纯数据,轻松上1300分。原文稍后读已读值得跟进有用关注 象棋AI