09:04官方账号arXiv cs.LG@Ian Hsieh, Soumya Snigdha Kundu, Tom Vercauteren, Reuben Dorent73°SinkSLOT解决了Sinkhorn-Knopp算法在大规模数据集上的计算瓶颈问题。该算法通过引入期望切片提升传输计划,将每次迭代复杂度从O(N²)降至O(LN)。实验表明,SinkSLOT在合成基准测试中显著优于现有密集和稀疏EOT方法。代码已在GitHub开源。论文SinkSLOT最优传输Sinkhorn推荐理由:研究人员提出SinkSLOT算法,大幅提升最优传输计算效率,适用于大规模数据集。原文稍后读已读值得跟进有用关注 SinkSLOT
12:28官方一手arXiv: DeepSeek@Masato Fujitake论文提出 MESH,一种用于 MoE 专家层的隐藏动量 Sinkhorn 更新。在 110M 参数 DeepSeek 风格 MoE 预训练中,SAGE/Sinkhorn 混合把优化器状态从 0.883GB 降到 0.331GB,但评估损失 3.8265,差于 AdamW 基线的 3.58-3.64。MESH 在梯度缓冲区生命周期内恢复一阶矩信号,且不将专家一阶矩存入优化器状态。两个额外种子中,MESH 和 MESH-B 相对 AdamW 减少 62.5% 优化器状态内存,峰值 CUDA 分配下降约 12.6%,评估损失差距较小。论文MESHSinkhorn混合专家模型推荐理由:MoE 训练显存吃紧?MESH 方法砍掉六成优化器内存,损失只差一点,做大规模训练的可以试试。原文稍后读已读值得跟进有用关注 MESH
11:59官方账号arXiv cs.LG@Xinyang Wen论文提出TemporalSinkhorn,一种并行时间执行器,批处理未来候选解并在不牺牲精度前提下进行修复。在4块A100 GPU上,n=2048的60次五种子网格测试中,遗忘引导里程碑相比逐次审计获得1.15x-1.47x加速。在Flow Matching小批量流上,时间执行相比顺序传递加速3.054x-3.632x,无容差违规。在RTX 4060笔记本GPU上固定核测试获得4.315x几何平均加速。论文TemporalSinkhornSinkhorn并行时间算法推荐理由:这篇论文提出了TemporalSinkhorn,用并行时间策略让Sinkhorn算法在动态最优传输中提速几倍,在Flow Matching上实测3倍以上,实用性很强。原文稍后读已读值得跟进有用关注 TemporalSinkhorn