OPSD(On-Policy Self-Distillation)是一种先进的机器学习技术,通过模型自身生成的知识来提升推理能力,无需额外标注数据。这种方法在2023年7月至8月期间获得了显著进展,成为大模型训练领域的研究热点。
OPSD 近期进展
2023年8月,无监督自蒸馏方法U-OPSD仅靠模型自身生成提升推理能力,展示了OPSD在减少对标注数据依赖方面的潜力。无监督自蒸馏:U-OPSD仅靠模型自身生成提升推理能力
2023年8月,DASH方法提出面向推理模型on-policy自蒸馏的自适应监督视野,解决了OPSD在视野选择上的关键挑战。DASH:面向推理模型on-policy自蒸馏的自适应监督视野
2023年7月,β-OPSD通过策略优化推导和自蒸馏训练相结合,显著提升了模型性能。β-OPSD:用策略优化推导,用自蒸馏训练
当前焦点与观察点
OPSD面临"Thinking Collapse"问题,即模型在自蒸馏过程中可能丧失思考能力,近期研究正致力于诊断和缓解这一现象。诊断与缓解On-Policy Self-Distillation中的Thinking Collapse
视频生成领域出现了OPSD-V方法,专门面向少步自回归视频生成器的在线自蒸馏,拓展了OPSD的应用范围。OPSD-V:面向少步自回归视频生成器的在线自蒸馏方法
神经元感知数据选择方法Neuron-OPSD和无标注大模型自蒸馏技术,正推动OPSD向更高效、更精准的方向发展。Neuron-OPSD:无标注大模型自蒸馏的神经元感知数据选择