11:02官方账号arXiv cs.LG@Xiaodong Wu, Wenyi Yu, Chao Zhang, Philip Woodland精选研究通过Transformer损失景观的谱探针分析,解释了为什么Muon比Adam在大语言模型预训练中表现更好。提出Spectral-Aware Muon (SAMuon)改进方案,通过静态谱先验放大bulk部分,在124M到1B参数的模型上优于AdamW和Muon基准。SAMuon需要更少的训练token达到相同验证损失。论文Muon谱分配大语言模型推荐理由:这篇论文揭示了为什么Muon优于Adam,并提出了改进方案SAMuon,值得AI模型研究者关注。原文稍后读已读值得跟进有用关注 Muon
10:22官方账号arXiv cs.LG@Yixin Tao, Weiqiang Zheng本研究解决了在线线性优化(OLO)和在线凸优化(OCO)中的最小-最大最优交替遗憾问题,提出了一种具有 $O(\log d)$ 交替遗憾的算法,该算法在任何时间范围内都保持常数,并给出了匹配的下界。在两人零和博弈中,实现了 $O(\log d /T)$ 收敛到纳什均衡,在两人一般和博弈中实现了 $O(\log d /T)$ 收敛到粗相关均衡。此外,对于 $d$ 维紧凸集上的通用 OCO,提出了具有 $O(d\log (1+T/d))$ 交替遗憾的算法,并证明了匹配的下界 $Ω(d\log (1+T/d))$。论文在线学习博弈论优化算法推荐理由:这篇论文提出了在线学习和博弈中的最优交替遗憾算法,对于在线线性优化和在线凸优化领域的研究具有重要意义,特别是对于收敛速度和下界的研究。原文稍后读已读值得跟进有用关注 在线学习
10:39官方账号arXiv cs.LG@Emilien Dupont, Marvin Eisenberger, Borislav Kozlovskii, Abbas Mehrabian, Francisco J. R. Ruiz, Abigail See, Renfei Zhou, Josh Alman, Virginia Vassilevska Williams, Matej Balog论文将矩阵乘法指数ω的优化问题重新表述,从而能在更大范围内求解。作者结合机器学习技术设计新优化算法,并用AlphaEvolve进一步精炼。最终将ω的上界从2.371339降至2.371177,刷新了此前的最好结果。论文AlphaEvolve矩阵乘法指数优化算法推荐理由:这篇论文用AlphaEvolve把矩阵乘法指数上界刷到2.371177,比原来的2.371339又进一步,算法优化思路值得看看。原文稍后读已读值得跟进有用关注 AlphaEvolve
09:35官方账号arXiv cs.LG@George A Kevrekidis本文开发了接触哈密顿系统作为优化算法中速率证书精确传递的框架。作者提出的主要定理在三个可独立验证的假设下,证明阶为r的接触分裂(步长h)能在有限时间区间内将连续时间速率证书传递给离散算法。离散衰减包络由修正共形因子控制,误差为O(h^r)加上后向误差影缺陷。以二次重球为例,其投影耗散-跳跃谱与已知共形辛优化理论一致。数值实验验证了共形因子跟踪阶,并在病态基准和深度学习任务中展现了竞争性能。论文接触哈密顿系统优化算法收敛分析推荐理由:这篇论文把连续优化理论的收敛证书精确传递到离散算法,用接触哈密顿系统给出通用框架,二次重球例子很透彻。想理解优化加速机制可以读。原文稍后读已读值得跟进有用关注 接触哈密顿系统
09:46官方账号arXiv cs.LG@Jianing Liu, Dong H. Zhang精选非线性最小二乘优化中,参数效应曲率是LM方法的主要非线性来源。标准LM的切线空间步长在参数坐标中直更新,而测地线加速度仅在无穷小步长时精确消除该曲率。本文提出RNC-LM,通过重参数化测地线方程扩展至任意阶修正,构建有限步更新并控制步长。在经典基准测试中,RNC-LM在弯曲谷和秩亏问题上提升了收敛性和鲁棒性。在反应扩散PINN失败模式基准上,相对L2误差降至1e-3量级并恢复物理解;在大规模机器学习势能面拟合任务中,相比标准LM实现了34倍加速。论文Levenberg-MarquardtRNC-LM非线性最小二乘推荐理由:这篇论文提出RNC-LM,解决了LM方法在强曲率问题上的局限,用黎曼法坐标做高阶修正,在PINN和势能面拟合上又准又快。原文稍后读已读值得跟进有用关注 Levenberg-Marquardt
11:04官方账号arXiv cs.LG@Zijian Liu精选一篇论文证明了 Random Reshuffling(RR)在光滑凸优化中,对于任意合理的步长和有限轮次,其收敛速度均严格优于标准 SGD。此前理论认为 RR 的步长需小于 1/n 阈值才能收敛,导致其最优理论速率低于 SGD。新结果首次从数学上解决了这一长期悬而未决的问题。论文Random ReshufflingSGD优化算法推荐理由:这篇论文终于从理论上证明了机器学习中常用的 Random Reshuffling 比经典 SGD 强,对优化算法感兴趣的朋友值得一看。原文稍后读已读值得跟进有用关注 Random Reshuffling
10:15官方账号arXiv cs.LG@Shuang Li, Zhihui Zhu, Qiuwei Li该论文分析了Bregman ADMM在非凸线性约束问题上的收敛性,采用两侧相对光滑性假设替代标准Lipschitz梯度条件。该方法适用于矩阵和张量模型中的多项式目标,全局Lipschitz梯度常数可能不存在。论文证明,在不变开状态空间域上,Bregman ADMM的一步迭代定义了光滑原始-对偶不动点映射,其严格鞍点KKT点是不稳定不动点,因此从随机初始化出发以概率零收敛到严格鞍点。结合已有的一阶收敛结果,这给出了极限KKT点几乎必然二阶平稳性。数值实验在分布式矩阵分解和对称张量分解上验证了理论。论文Bregman ADMMKKT优化算法推荐理由:这篇论文证明了Bregman ADMM在非凸非Lipschitz优化中几乎必然收敛到二阶KKT点,解决了传统方法无法处理多项式目标的问题,对矩阵分解等应用有实际指导意义。原文稍后读已读值得跟进有用关注 Bregman ADMM
11:07官方账号arXiv cs.LG@Daniel Csillag, Rodrigo Schuller, Pedro Dall'Antonia, Leonidas Guibas, Luiz Velho, Tiago Novello这篇论文提出了一个新型的泛函梯度下降(FGD)算法,该算法在优化过程中自适应调整泛函梯度的表示,解决了固定近似引入误差的问题。作者证明,在光滑损失条件下该算法收敛到平稳点,在附加Polyak-Lojasiewicz条件时收敛到全局最小值,这是首个在一般环境下具有此类保证的可实现FGD方法。在回归、偏微分方程数值求解和现代计算机视觉任务中,该方法在效率和准确度上均优于固定近似FGD和神经网络基线。AI模型FGD自适应表示优化算法推荐理由:这篇论文提出了首个可实现的泛函梯度下降算法,能自适应调整梯度表示,理论上有收敛保证,实验上比传统FGD和神经网络更快更准。原文稍后读已读值得跟进有用关注 FGD
11:11官方账号arXiv cs.LG@Florian Hübler, Thomas Pethick, Suvrit SraMuon和Scion等非欧几里得优化方法在训练Transformer时表现优异,但其理论优势一直未明确。本研究证明在重尾非凸场景(随机梯度p阶中心矩有界,p∈(1,2])下,非欧几里得方法在更强的平稳性度量下达到最优样本复杂度,而欧几里得方法有额外维度依赖。对于m×n矩阵,Muon在核范数下找到ε-稳定点仅需O(min{m,n}Δ1L/ε^2(σ/ε)^{p/(p-1)})个样本,可吸收重尾噪声而无额外维度开销。实验在大型语言模型上验证了理论,并表明其他Schatten几何在某些设置下也可与Muon竞争。论文MuonScion优化算法推荐理由:Muon为何能训练Transformer?原文稍后读已读值得跟进有用关注 Muon
09:32官方账号arXiv cs.LG@Yiyuan She, Zhaojun Hu, Yifan Sun精选本文提出了一种名为“范围正则化”的新方法,用于联邦学习场景,旨在提升统计精度并促进跨客户端的规律性,从而有利于量化、编码和资源效率。该方法通过识别不同客户端间共享权重的特征,并将个性化特征的权重自适应地聚类到极值(称为极值聚类),解决了传统正则化器因半范数特性和不可分解性带来的理论分析难题。研究者开发了新的非渐近分析技术,用于评估统计精度和模式恢复的可靠性,并提出了利用局部强凸性的快速优化算法以减少迭代复杂度。实验验证了该方法在联邦学习中的有效性和效率,为分布式机器学习提供了新的理论工具。论文联邦学习正则化极值聚类推荐理由:联邦学习团队终于有了一个兼顾理论严谨和实际效率的正则化方案——极值聚类能显著提升模型压缩和通信效率,做分布式系统或资源受限场景的开发者可以直接参考实验设置。原文稍后读已读值得跟进有用关注 联邦学习
11:17官方账号arXiv cs.LG@Gjorgjina Cenikj, Jakub Kudela, Eva Tuba, Tome Eftimov精选该研究系统评估了算法选择(AS)模型在合成与真实优化场景间的泛化能力。研究使用了BBOB和CEC两个学术基准套件,以及机器人轨迹优化和无人机路径规划两个真实问题集。通过跨基准测试发现,AS模型在学术基准间表现良好,但迁移到真实领域时泛化能力显著下降。研究揭示了当前AS方法在领域特定应用中的鲁棒性挑战,为开发更可靠的实用AS系统提供了方向。论文算法选择泛化能力优化算法推荐理由:做优化算法选型或自动化机器学习的研究者值得关注——这项研究直接点出了学术基准与真实场景的鸿沟,看完能帮你避开模型部署的坑。原文稍后读已读值得跟进有用关注 算法选择
11:05官方账号arXiv cs.LG@Abdurakhmon Sadiev, Artavazd Maranjyan, Ivan Ilin, Peter Richtárik精选Muon 作为 AdamW 的替代方案在神经网络训练中表现出色,但基于线性最小化预言机(LMO)的方法通常采用同步训练,在异构分布式系统中受限于慢速工作节点。本文提出 Ringmaster LMO,一种异步 LMO 动量方法,借鉴 Ringmaster ASGD 的延迟阈值思想,通过丢弃过时梯度实现最优时间复杂度。该方法在广义 (L0, L1)-光滑性下建立了收敛保证,并开发了参数无关的变体。实验表明,在随机二次问题和 NanoChat 语言模型预训练中,Ringmaster LMO 在异构环境下显著优于同步和异步基线。论文异步训练分布式系统优化算法推荐理由:分布式训练团队终于有了异步 LMO 方法的理论保障——Ringmaster LMO 解决了异构集群中慢节点拖累效率的问题,做大规模预训练或异构系统优化的开发者值得关注。原文稍后读已读值得跟进有用关注 异步训练
13:36官方账号Weights & Biases@weights_biasesAndrej Karpathy 在社交媒体上发布了一条简短但引人深思的推文:“let there be descent”,引用自《创世纪》的“let there be light”变体。这条推文暗示了机器学习中梯度下降(descent)的核心地位,可能是在强调优化算法在AI训练中的根本作用。Karpathy 作为AI领域的重要人物,其言论常引发社区对基础概念的重新思考。这条推文可能是在鼓励开发者回归对优化本质的理解,而非追逐复杂模型。行业梯度下降KarpathyAI训练推荐理由:Karpathy 用一句话点醒了AI社区:别光顾着堆模型,梯度下降才是根本。做训练和优化的开发者看完会有感触,值得停下来想想。原文稍后读已读值得跟进有用关注 梯度下降