8月5日
15:47
7月26日
02:15
02:15官方一手marktechpost@Sana Hassan
精选
TileLang是一种高级Python领域特定语言,用于简化高性能GPU内核设计。教程演示如何实现分块Tensor-Core GEMM、融合Softmax和FlashAttention等复杂工作负载。TileLang编译器自动处理线程映射、内存布局和底层CUDA指令生成。同时支持自动调优,帮助用户优化内核性能。
推荐理由:想写GPU内核但被CUDA细节劝退?TileLang用Python帮你搞定Tensor-Core GEMM和FlashAttention,自动处理线程映射和调优,省心。
7月12日
08:10
08:10官方一手marktechpost@Sana Hassan
精选
本教程使用 TileGym 在 Colab 工作流中探索 NVIDIA 的 tile-based GPU 编程,覆盖 CUDA 环境检测、cuTile 后端及在缺乏 cuTile 栈时回退到 Triton。核心思想是操作整个数据块而非单线程,包括加载、计算和存储。实现了向量加法、融合 GELU、逐行 softmax、分块矩阵乘法和 Flash Attention,每个实现均与 PyTorch 对比验证。
事件专题

推荐理由:手把手教你用 TileGym 在 Colab 上跑 cuTile 和 Triton,从向量加法到 Flash Attention,每个步骤都和 PyTorch 对照,适合想深入 GPU 编程的人。