09:58官方账号arXiv cs.LG@Winfried van den dool, Patrick Forré, Amir Habibian, Yuki M. Asano, Max WellingAVQ-Attention 通过自适应向量量化将注意力复杂度从 O(N²) 降至 O(MN),其中 N 为 token 数,M 为码字数量。与固定码本的 VQ-Attention 不同,它根据注意力重要性动态分配码本容量,在高注意区域使用预学习的子码字进行细粒度量化,低注意区域维持粗粒度。方法基于自定义 Triton 内核,可在 Flash Attention 的平铺计算中完成重要性评分、子码字插入等操作,实现最小开销。实验表明 AVQ-Attention 在保持 O(MN) 复杂度的同时,相比固定码本 VQ-Attention 实现了更好的精度-效率权衡。AI模型AVQ-AttentionVQ-AttentionFlash Attention推荐理由:这篇论文提出了一个聪明的点子:让注意力机制像人一样,在关键地方用更多计算资源,其他地方粗略处理。复杂度降低但精度不降,做推理优化的同学可以关注。原文稍后读已读值得跟进有用关注 AVQ-Attention
08:10官方一手marktechpost@Sana Hassan精选本教程使用 TileGym 在 Colab 工作流中探索 NVIDIA 的 tile-based GPU 编程,覆盖 CUDA 环境检测、cuTile 后端及在缺乏 cuTile 栈时回退到 Triton。核心思想是操作整个数据块而非单线程,包括加载、计算和存储。实现了向量加法、融合 GELU、逐行 softmax、分块矩阵乘法和 Flash Attention,每个实现均与 PyTorch 对比验证。技巧cuTileTritonTileGym1 个信源在谈事件专题推荐理由:手把手教你用 TileGym 在 Colab 上跑 cuTile 和 Triton,从向量加法到 Flash Attention,每个步骤都和 PyTorch 对照,适合想深入 GPU 编程的人。原文稍后读已读值得跟进有用关注 cuTile