06:01官方账号Simon Willison’s Weblog(博客/媒体)72°Mojo 编程语言在发布 1.0 版本后,于 2026 年 8 月 18 日正式开源,编译器与工具链采用 Apache 2 许可证。Mojo 最初计划成为 Python 的超集,但 2025 年 8 月后调整方向,不再强求完全兼容。目前 Mojo 定位为独立语言,专注于简化 GPU 编程,语法受 Python 启发。官方表示 AI 辅助编码工具已能帮助迁移 Python 代码至 Mojo。AI产品Mojo开源GPU编程推荐理由:Mojo 终于开源了,Apache 2 协议随便用,GPU 编程比 Python 顺手,想玩高性能计算的可以试试。原文稍后读已读值得跟进有用关注 Mojo
15:47量子位@听雨英伟达用了20年构建的CUDA生态,被AI用10小时撕开缺口。这一技术绕过了CUDA专有壁垒,将代码迁移到其他GPU平台的难度大幅降低。CUDA作为英伟达核心护城河的地位因此遭到动摇。AI模型CUDA英伟达GPU编程推荐理由:老黄攒了20年的CUDA家底,被一个AI用10小时挖穿了。以后换显卡跑模型,不用再手动改代码。原文稍后读已读值得跟进有用关注 CUDA
02:15官方一手marktechpost@Sana Hassan精选TileLang是一种高级Python领域特定语言,用于简化高性能GPU内核设计。教程演示如何实现分块Tensor-Core GEMM、融合Softmax和FlashAttention等复杂工作负载。TileLang编译器自动处理线程映射、内存布局和底层CUDA指令生成。同时支持自动调优,帮助用户优化内核性能。技巧TileLangGPU编程FlashAttention推荐理由:想写GPU内核但被CUDA细节劝退?TileLang用Python帮你搞定Tensor-Core GEMM和FlashAttention,自动处理线程映射和调优,省心。原文稍后读已读值得跟进有用关注 TileLang
08:10官方一手marktechpost@Sana Hassan精选本教程使用 TileGym 在 Colab 工作流中探索 NVIDIA 的 tile-based GPU 编程,覆盖 CUDA 环境检测、cuTile 后端及在缺乏 cuTile 栈时回退到 Triton。核心思想是操作整个数据块而非单线程,包括加载、计算和存储。实现了向量加法、融合 GELU、逐行 softmax、分块矩阵乘法和 Flash Attention,每个实现均与 PyTorch 对比验证。技巧cuTileTritonTileGym1 个信源在谈事件专题推荐理由:手把手教你用 TileGym 在 Colab 上跑 cuTile 和 Triton,从向量加法到 Flash Attention,每个步骤都和 PyTorch 对照,适合想深入 GPU 编程的人。原文稍后读已读值得跟进有用关注 cuTile