17:07官方一手pandaily@contact@pandaily.com (Pandaily)精选在HyperAI主办的Meet AI Compiler沙龙上,华为AscendNPU IR架构师Hai Lijuan介绍了开源的编译器基础。该IR基于MLIR提供tile级抽象,连接LLVM IR,支持Triton等前端语言。它已扩展到Ascend 950,覆盖SIMD与SIMT指令集。开源后开发者可直接使用这一层编写和优化昇腾算子。AI产品AscendNPU IR毕昇编译器Triton1 个信源在谈事件专题推荐理由:华为把毕昇编译器的核心AscendNPU IR开源了,支持Triton,能直接在Ascend 950上写算子,比之前好用多了。原文稍后读已读值得跟进有用关注 AscendNPU IR
08:10官方一手marktechpost@Sana Hassan精选本教程使用 TileGym 在 Colab 工作流中探索 NVIDIA 的 tile-based GPU 编程,覆盖 CUDA 环境检测、cuTile 后端及在缺乏 cuTile 栈时回退到 Triton。核心思想是操作整个数据块而非单线程,包括加载、计算和存储。实现了向量加法、融合 GELU、逐行 softmax、分块矩阵乘法和 Flash Attention,每个实现均与 PyTorch 对比验证。技巧cuTileTritonTileGym1 个信源在谈事件专题推荐理由:手把手教你用 TileGym 在 Colab 上跑 cuTile 和 Triton,从向量加法到 Flash Attention,每个步骤都和 PyTorch 对照,适合想深入 GPU 编程的人。原文稍后读已读值得跟进有用关注 cuTile
17:21官方一手marktechpost@Asif Razzaq精选Flash-KMeans是一个开源的、IO感知的精确K-Means实现,使用Triton GPU内核,不改变Lloyd算法数学或做近似。其FlashAssign组件消除了距离矩阵的物化,Sort-Inverse Update消除了原子竞争。在NVIDIA H200上,它实现了17.9倍端到端加速,比cuML快33倍,比FAISS快200倍以上。该算法在大规模聚类任务中显著降低内存开销和计算延迟。AI模型Flash-KMeansFAISScuML8 个信源在谈事件专题推荐理由:开源Flash-KMeans在H200上比FAISS快200多倍,做精确k-means不近似,适合大规模数据聚类。原文稍后读已读值得跟进有用关注 Flash-KMeans
11:11官方账号arXiv cs.LG@Ali Asaria, Tony Salomone, Deep Gandhi精选论文发现消费级Ampere GPU上扩散Transformer的INT8量化常因反量化回bf16而无法利用INT8张量核心。作者为Ideogram 4.0线性层设计了一个融合Triton INT8 GEMM内核,在Ampere张量核心上执行int8×int8→int32,并在epilogue中折叠逐token×逐通道反量化和偏置。该内核实现2.8-4.2倍于bf16的GEMM加速,并保持余弦相似度1.0且无NaN。端到端测试中,在单张RTX 3090上768px分辨率获得约9-10%提速,1024px生成耗时156.5秒,优于NF4(164.5秒)和FP8(172.9秒)基线,且PickScore/CLIPScore无质量损失。论文Ideogram 4.0RTX 3090INT82 个信源在谈事件专题推荐理由:INT8反超FP8,单卡RTX 3090跑1024px扩散模型原文稍后读已读值得跟进有用关注 Ideogram 4.0