AMD 在 PyTorchCon 分享 MI355X 上 MXFP8 大规模预训练实践
AMD 的工程师讲怎么在 1000 多张 MI355X 上跑 MXFP8 预训练,TorchAO 加 TorchTitan 的完整方案,做训练的可以听听
AMD 的 Liz Li 和 Shekhar Pandey 将在 PyTorchCon North America 2026 上介绍在 1K+ 张 AMD Instinct MI355X GPU 上进行 MXFP8 预训练的工作。演讲内容包括 TorchAO 中 MXFP8 关键算子的优化,以及这些 kernel 如何与 TorchTitan 集成,构建端到端的 PyTorch 上游训练栈。两人还会讲解 Triton 和 FlyDSL 实现,以及在数值验证、收敛性和性能调优方面的经验。会议于 10 月 20-21 日在圣何塞举行。
At #PyTorchCon North America 2026, Liz Li (AI Architect, @AMD) and Shekhar Pandey (Member Of Technical Staff, @AMD) will discuss their work enabling scalable MXFP8 pretraining on MI355X GPUs.
Liz and Shekhar will cover optimization of key MXFP8 operators in TorchAO and how those kernels were integrated with TorchTitan to build an end-to-end upstream PyTorch training stack for large language models.
Their session, “Scaling MXFP8 Pretraining on 1K+ AMD Instinct MI355X: TorchAO Kernels and TorchTitan Training,” will also cover Triton and FlyDSL implementations and lessons from numerical validation, convergence, and performance tuning.
Join us in San Jose on October 20-21. Register today: https://t.co/jBApW8nESi