12:27官方账号arXiv cs.LG@Shiyang Li, Guangyan Sun, Jinwei Tang, Yanzhi Wang, Mingyi Hong, Caiwen DingSparseDitto 是一个基于 LLM 智能体的系统,能按矩阵、算子与目标 GPU 自动生成定制内核,覆盖 SpMV、SpMM、SpGEMM 三种稀疏算子。论文指出同一 SpMM 任务中 cuSPARSE 在 CSR 与 Blocked-ELL 格式下性能差距最高达 350 倍,现有实现无法在所有稀疏模式上占优。SparseDitto 在 NVIDIA RTX PRO 6000 上相对 cuSPARSE 取得 2.68 倍几何平均加速,最高 146.61 倍;在 H200 上平均加速 2.79 倍,最高 78.5 倍。其生成的 SpMM 内核还让全批次 GCN 训练最高提速 3.39 倍。论文SparseDittoGPU内核稀疏矩阵5 个信源在谈事件专题推荐理由:不用手写内核了?SparseDitto 用 LLM 智能体自动生成,比 cuSPARSE 平均快 2.7 倍,最高 146 倍。原文稍后读已读值得跟进有用关注 SparseDitto
12:16官方账号arXiv cs.LG@Zechen Zhang, Rui Peng Li, Yousef Saad该论文提出图神经网络多层级预条件器(GMP),将代数多重网格(AMG)层级结构作为先验,统一学习平滑、限制与插值算子。在超800个稀疏矩阵基准上,对比经典AMG、单层ILUT及现有GNN预条件器,分析了多层级图神经预条件在收敛性和计算开销上的优劣。结果表明GMP可作为标准Krylov求解器的即插即用预条件器,但在某些场景下不及强单层基线。论文Graph Neural Multilevel PreconditionersGNNAMG推荐理由:想给稀疏矩阵求解提速的话,这篇论文把AMG层级和图神经网络结合了,在800多个矩阵上实测,可以看到它什么时候比AMG好、什么时候反而更慢。原文稍后读已读值得跟进有用关注 Graph Neural Multilevel Preconditioners