论文精选

Meta 提出替代 OPSD 的训练方法,Qwen3-8B 平均准确率从 30.76% 升至 65.97%

精选理由

Meta 这次没走 self-distillation 老路,用 DCE 加 SRCL 就把 Qwen3-8B 从 30% 拉到 66%,方法细节可以看看。

Meta 团队提出 DCE 与 SRCL 两种方法,作为 on-policy 自蒸馏(OPSD)的替代方案。在 Qwen3-8B 上的测试显示,平均准确率从 30.76% 提升到 65.97%,提高超过 35 个百分点。该方法省去了对 on-policy 采样的依赖。代码与论文链接已在推文中附上。

原文 · Aran Komatsuzaki (论文推介)

Meta's team proposes DCE + SRCL as an alternative to on-policy self-distillation (OPSD).

Achieved significant gains: 30.76% avg acc -> 65.97% on Qwen3-8B

https://t.co/nAIHRZWNDx https://t.co/u2hHD6QmpU