Meta 提出替代 OPSD 的训练方法,Qwen3-8B 平均准确率从 30.76% 升至 65.97%
Meta 这次没走 self-distillation 老路,用 DCE 加 SRCL 就把 Qwen3-8B 从 30% 拉到 66%,方法细节可以看看。
Meta 团队提出 DCE 与 SRCL 两种方法,作为 on-policy 自蒸馏(OPSD)的替代方案。在 Qwen3-8B 上的测试显示,平均准确率从 30.76% 提升到 65.97%,提高超过 35 个百分点。该方法省去了对 on-policy 采样的依赖。代码与论文链接已在推文中附上。
Meta's team proposes DCE + SRCL as an alternative to on-policy self-distillation (OPSD).
Achieved significant gains: 30.76% avg acc -> 65.97% on Qwen3-8B
https://t.co/nAIHRZWNDx https://t.co/u2hHD6QmpU