AITOPAI热报
今日精选全部动态早读东盟 AIAgent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOPAI热报

LiteTopK

共 2 条相关 AI 资讯
7月16日
10:46
10:46官方一手arXiv: DeepSeek@Ziqi Yin, Jianyang Gao, Peiqi Yin, Jiangneng Li, Gao Cong
LiteTopK是一种针对长上下文稀疏注意力中Indexer-TopK操作的高效融合内核。它利用高维空间中向量距离集中在狭窄范围的特性,通过采样小部分数据估计查询-数据分数范围,并在线将候选结果分桶。该设计减少了全局内存流量和同步开销,同时保持精确Top-k正确性。实验在GLM 5.2的预填充阶段实现1.2倍加速,内存开销更低。
论文LiteTopKGLM 5.2稀疏注意力

推荐理由:这个新方法挺聪明,用高维空间特性优化注意力计算,在GLM 5.2上实测提速1.2倍还省内存。
原文
7月15日
09:14
09:14官方一手arXiv: DeepSeek@Ziqi Yin, Jianyang Gao, Peiqi Yin, Jiangneng Li, Gao Cong
本文针对长上下文稀疏注意力中的Indexer-TopK操作,指出现有GPU内核如DeepSeek Sparse Attention(DSA)存在全局内存开销大、同步成本高问题。作者利用高维空间中向量距离分布集中的特性,提出LiteTopK内核:通过采样小部分数据估计查询-数据分数范围,在线分桶,维持紧近似阈值并回写有潜力候选。实验在GLM 5.2的预填充阶段实现1.2倍加速,同时降低内存开销,且保持精确Top-k结果。
论文LiteTopKDeepSeek Sparse AttentionGLM 5.2

推荐理由:这论文用维度诅咒的视角,搞了个LiteTopK算子,比DeepSeek的DSA更快更省内存,GLM 5.2预填充直接快1.2倍。
原文
精选动态早读东盟登录