8月31日
09:06
09:06官方账号arXiv cs.LG@Niccolò Ajroldi, Diana Alexandra Onutu, Haider Al-Tahan, Jörg Franke, Sampo Pyysalo, Jenia Jitsev, Aaron Klein
73°
该研究分析了英语语料上预训练密集大语言模型的学习率和批量大小缩放行为。研究开发了捕捉学习率和批量大小与模型容量和数据规模关系的模型。研究评估了最近提出的缩放形式,发现它们能有效捕捉实验中的欠训练和过训练状态。研究建立了OpenEuroLLM模型开发的基准和缩放程序。
推荐理由:OpenEuroLLM团队开源了预训练研究,揭示了学习率和批量大小如何随模型和数据规模变化。
8月21日
10:07
10:07官方账号arXiv cs.LG@Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim
该研究提出一种计算高效的两步超参数迁移框架,用于为大型 MoE 模型估算最优学习率。首先,通过 MuP 适应和 Muon 优化器,证明了最优学习率在宽度缩放模型间可一致迁移。其次,通过建立预测性缩放定律,将小模型在有限预算下的最优值线性回归,成功外推至万亿 token 规模(R²=0.95)。该方法在 155B 总参数的 MoE 基础模型预训练中得到验证。
推荐理由:研究人员提出了一种方法,能通过小模型实验,准确预测万亿 token 规模 MoE 模型的最优学习率,省去了大量计算成本。他们用 155B 参数的模型验证了方法的有效性。