论文Agent 与开发者精选10:38Off-Policy Merging 持续学习方法超越 On-Policy 自蒸馏做模型持续训练的必看:不用贵的 on-policy 采样,靠 grafting 三步就能加新能力还不忘旧本事,比 SFT 和 OPSD 都强。#模型合并#SFT#STaR#持续学习aarXiv cs.AI@Chen Henry Wu 等 3 人原文稍后读已读值得跟进有用关注 模型合并