论文Agent 与开发者10:30研究:RL 后训练哪些题会变好,旧 checkpoint 比先验信号预测更准arXiv 上这篇挺有意思:想知道 RL 训练后哪些题能解出来,用别的模型训过的 checkpoint 预测,比一堆先验指标都准。#DeepSeek-R1-Distill-Qwen-1.5B#Qwen2.5-Math-1.5B#强化学习#后训练aarXiv: DeepSeek@Xiaoxian Duan原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-1.5B