adamw·general

adamw

别名
首次出现
2026-05-22
最近出现
2026-08-31
累计提及
65
§ 01综述

AdamW是机器学习领域广泛使用的一种优化算法,它是对Adam优化器的改进版本,通过权重衰减(weight decay)处理正则化问题,在深度神经网络训练中表现优异。

AdamW近期进展

NVIDIA新研究显示AdamW存在规模上限,SOAP和Muon在大规模训练中表现更优。这项研究表明当模型规模达到一定程度时,AdamW的优化效果会下降,而SOAP和Muon则能保持更好的性能。

Muon优化器与SAM结合的谱范数鲁棒性优化研究在2023年7月发布,旨在提高模型训练的稳定性和鲁棒性,特别是在面对复杂任务时表现优于传统AdamW。

CMuon基于分块动量正交化加速并稳定Diffusion Transformer训练,研究表明这种改进方法在保持训练稳定性的同时,显著提升了训练效率。

当前焦点与观察点

近期研究焦点正从传统AdamW转向更先进的优化算法如Muon及其变体。这些算法在大规模训练、强化学习和特定架构如Transformer中展现出优越性。值得注意的是,2023年8月发表的Muon与Mamba结合的研究进一步探索了状态空间模型的谱优化,这代表了优化算法发展的新方向。

AdamW虽然在中小规模模型训练中仍然有效,但在大规模训练场景下正逐渐被更先进的优化算法所替代。这种转变反映了机器学习领域对优化效率、稳定性和可扩展性的持续追求。

§ 02相关报道10 条在档
  1. 01
    神经网络优化器综述
    arXiv cs.LG
  2. 02
    Spectral Allocation: Muon超越Adam,如何改进Muon
    arXiv cs.LG
  3. 03
    Muon训练的Transformer在后grokking阶段出现表示-读出界面崩溃
    arXiv cs.LG
  4. 04
    SG-TULA:非凸非光滑采样的驯化次梯度算法
    arXiv cs.LG
  5. 05
    MESH:面向混合专家训练的内存高效Sinkhorn优化
    arXiv: DeepSeek
  6. 06
    Muon相遇Mamba:状态空间模型的谱优化
    arXiv cs.LG
  7. 07
    CMuon:基于分块动量正交化加速并稳定Diffusion Transformer训练
    arXiv cs.AI
  8. 08
    Grokked Illusion:高熵模型可缓解灾难性遗忘
    arXiv cs.LG
  9. 09
    SAM与Muon结合的谱范数鲁棒性优化
    arXiv cs.LG
  10. 10
    NVIDIA新研究:AdamW存在规模上限,SOAP和Muon在大规模训练中更优
    elvis
§ 03邻近话题

本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

/topic/adamw