opsd·concept

OPSD

别名
首次出现
2026-05-22
最近出现
2026-08-31
累计提及
24
§ 01综述

OPSD(On-Policy Self-Distillation)是一种先进的机器学习技术,通过模型自身生成的知识来提升推理能力,无需额外标注数据。这种方法在2023年7月至8月期间获得了显著进展,成为大模型训练领域的研究热点。

OPSD 近期进展

2023年8月,无监督自蒸馏方法U-OPSD仅靠模型自身生成提升推理能力,展示了OPSD在减少对标注数据依赖方面的潜力。无监督自蒸馏:U-OPSD仅靠模型自身生成提升推理能力

2023年8月,DASH方法提出面向推理模型on-policy自蒸馏的自适应监督视野,解决了OPSD在视野选择上的关键挑战。DASH:面向推理模型on-policy自蒸馏的自适应监督视野

2023年7月,β-OPSD通过策略优化推导和自蒸馏训练相结合,显著提升了模型性能。β-OPSD:用策略优化推导,用自蒸馏训练

当前焦点与观察点

OPSD面临"Thinking Collapse"问题,即模型在自蒸馏过程中可能丧失思考能力,近期研究正致力于诊断和缓解这一现象。诊断与缓解On-Policy Self-Distillation中的Thinking Collapse

视频生成领域出现了OPSD-V方法,专门面向少步自回归视频生成器的在线自蒸馏,拓展了OPSD的应用范围。OPSD-V:面向少步自回归视频生成器的在线自蒸馏方法

神经元感知数据选择方法Neuron-OPSD和无标注大模型自蒸馏技术,正推动OPSD向更高效、更精准的方向发展。Neuron-OPSD:无标注大模型自蒸馏的神经元感知数据选择

§ 02相关报道10 条在档
  1. 01
    VISTA:基于验证器的学生-教师自适应蒸馏方法
    arXiv cs.LG
  2. 02
    DualOPSD:自适应策略自蒸馏方法
    arXiv cs.AI
  3. 03
    OPSD与Continual Learning研究讨论会聚焦数据难题
    Latent.Space
  4. 04
    无监督自蒸馏:U-OPSD仅靠模型自身生成提升推理能力
    arXiv cs.LG
  5. 05
    DASH:面向推理模型on-policy自蒸馏的自适应监督视野
    arXiv cs.AI
  6. 06
    PI条件教师打破自蒸馏:有偏但失效
    arXiv cs.AI
  7. 07
    β-OPSD:用策略优化推导,用自蒸馏训练
    arXiv cs.LG
  8. 08
    诊断与缓解On-Policy Self-Distillation中的Thinking Collapse
    arXiv cs.LG
  9. 09
    OPSD-V:面向少步自回归视频生成器的在线自蒸馏方法
    AK
  10. 10
    Neuron-OPSD:无标注大模型自蒸馏的神经元感知数据选择
    arXiv cs.AI
§ 03邻近话题

本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

/topic/OPSD