AITOPAI热报
今日精选全部动态早读东盟 AIAgent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOPAI热报

收敛性

共 4 条相关 AI 资讯
7月28日
11:56
11:56官方账号arXiv cs.LG@Justin Sirignano, Konstantinos Spiliopoulos, Samuel Cohen
这篇论文证明了对于一类半线性偏微分方程,使用梯度下降训练神经网络最小化PDE残差目标函数时,网络参数会全局收敛到PDE的解。研究针对Deep Galerkin Method和Physics Informed Neural Networks这两种主流方法,解决了长期存在的非凸目标函数可能只收敛到局部极小值的问题。论文结果覆盖了包含解及其一阶导数非线性的PDE类,为科学机器学习算法提供了数学基础。
论文DGMPINNPDE

推荐理由:这篇论文给DGM和PINN的用户吃了定心丸:对于一类半线性PDE,梯度下降训练真的能收敛到正确解,不是只找到局部最优。
原文
7月24日
09:24
09:24官方一手arXiv: DeepSeek@Renuka Oladri, Niveda Jawahar, Abdirisak Mohamed
DeepSeek-R1-Distill-Qwen-7B等思维链模型在推理时呈现双峰收敛模式:在令牌预算内结束(收敛)或耗尽预算无结论(非收敛)。实验显示,收敛的推理在AIME 1983-2024上准确率达90.3%,非收敛仅6.6%,总体收敛率62.0%。通过训练线性探针在隐藏状态激活(token 50-300)上,层20在token 150处达到AUC 0.608(±0.080,五折交叉验证)。激活探针优于基于令牌熵和重复统计的行为基线。扫描级置换检验p=0.063(100,000次置换),表明样本量不足以在常规阈值下确认信号,但收敛命运在生成结束前部分编码于中间表征。
论文DeepSeek-R1-Distill-Qwen-7B推理模型早期检测

推荐理由:这篇论文发现DeepSeek-R1推理非收敛在早期就能从内部表征检测到,未来可做自适应计算分配,研究推理效率的朋友可以看看。
原文
6月30日
15:10
15:10官方账号arXiv cs.LG@Matan Schliserman, Gon Buzaglo, Itay Evron, Daniel Soudry
该论文刻画了同质模型中的弱正则化持续分类问题,将其视为在任务间隔集上的顺序投影。这一结果推广了此前仅限于单任务深度模型或持续线性模型的分析。研究表明,即使对于数据线性但参数非线性的简单模型,全局收敛一般也会失败。然而,利用非凸投影理论,论文识别了同质深度网络的规则性,保证在随机和循环任务序列下的局部线性收敛。最后,分析扩展到持续回归,统一了同质模型的框架。
论文Continual LearningHomogeneous Deep NetworksDeep Networks

推荐理由:这篇论文从理论上搞清楚了持续学习中同质深度网络的收敛性质,比之前只分析线性模型或单任务模型的结果更通用。
原文
6月16日
11:07
11:07官方账号arXiv cs.LG@Daniel Csillag, Rodrigo Schuller, Pedro Dall'Antonia, Leonidas Guibas, Luiz Velho, Tiago Novello
这篇论文提出了一个新型的泛函梯度下降(FGD)算法,该算法在优化过程中自适应调整泛函梯度的表示,解决了固定近似引入误差的问题。作者证明,在光滑损失条件下该算法收敛到平稳点,在附加Polyak-Lojasiewicz条件时收敛到全局最小值,这是首个在一般环境下具有此类保证的可实现FGD方法。在回归、偏微分方程数值求解和现代计算机视觉任务中,该方法在效率和准确度上均优于固定近似FGD和神经网络基线。
AI模型FGD自适应表示优化算法

推荐理由:这篇论文提出了首个可实现的泛函梯度下降算法,能自适应调整梯度表示,理论上有收敛保证,实验上比传统FGD和神经网络更快更准。
原文
精选动态早读东盟登录