AITOPAI热报
今日精选全部动态早读东盟 AIAgent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOPAI热报

在线蒸馏

共 2 条相关 AI 资讯
8月11日
11:39
11:39官方账号arXiv cs.AI@Zichao Yu, Chengzhi Yu, Shengze Xu, Yujin Han, Bingqing Jiang, Xu Wang, Difan Zou
精选
在线策略蒸馏(OPD)是LLM后训练的核心环节,但存在退化一致性问题:学生通过重复循环获得与教师近乎完美的token一致,但整体回答有缺陷。论文将焦点转向师生不匹配,发现不匹配token分为学生多余和学生缺失两类。提出的TIDE方法采用有界Hellinger整形抑制多余token,并通过教师top-K注入恢复缺失token的概率质量。在Qwen3多个师生对上的数学推理基准中,TIDE优于标准OPD及近期基线,在强不匹配场景下Avg@8从6.9%提升至20.3%,平均响应长度缩短3.6倍。
论文TIDE在线蒸馏Qwen3

推荐理由:这篇论文讲了个反直觉的事:蒸馏时师生token一致反而可能有害。TIDE方法在数学推理上把准确率从6.9%拉到20.3%,还让回答短了3.6倍,值得做LLM后训练的人看看。
原文
8月3日
09:28
09:28官方账号arXiv cs.LG@Qian Tan, Huaifei Liang, Xuanyu Zhu, Lei Jiang, Yuqiang Li
在线蒸馏(OPD)沿学生生成轨迹提供密集教师监督,但长响应会拖慢批量完成。现有加速方法用固定预算或绝对师生一致阈值控制回滚长度,难以反映学习进度。Adaptive FastOPD 仅在当前边界区域学习趋于平稳且视野利用充分时扩展回滚视野,由四个师生信号相对值判断进度。在两个师生对上,Adaptive FastOPD 比 OPD 15K 减少训练时间 49.1%–71.2%,同时取得最高平均性能,且对超参数设置鲁棒。
论文Adaptive FastOPDOPD在线蒸馏

推荐理由:发了个叫Adaptive FastOPD的蒸馏加速方法,比OPD 15K快一半多,性能还更高。做训练加速的可以看看。
原文
精选动态早读东盟登录