Size在AI领域指模型参数规模、系统资源容量或处理能力的大小,是衡量AI系统性能的关键指标。近期,GoogleDeepMind发布了26B参数的DiffusionGemma扩散语言模型,展示了大模型规模持续增长的趋势。同时,NVIDIA研究表明AdamW优化器存在规模上限,在大规模训练中SOAP和Muon算法表现更优。
Size 近期进展
GoogleDeepMind 发布 DiffusionGemma:26B 扩散语言模型,vLLM 原生支持 26B参数的DiffusionGemma模型标志着大模型规模又上新台阶,vLLM的原生支持进一步提升了处理效率。NVIDIA新研究:AdamW存在规模上限,SOAP和Muon在大规模训练中更优 研究发现当训练规模达到特定阈值后,传统AdamW优化器效果下降,而SOAP和Muon算法在大规模训练中表现更稳定。
长上下文模型的推理速度在训练前就已定下上限 研究表明,模型上下文窗口大小在训练阶段就决定了推理速度的上限,这一发现对大模型设计有重要指导意义。