技巧官方一手

亚马逊EKS上使用NVRx实现容错分布式训练

Fault tolerant distributed training on Amazon EKS using NVRx

精选理由

亚马逊的NVRx工具能帮你解决分布式训练中的GPU故障问题,让训练更稳定,恢复速度更快。

亚马逊将NVIDIA Resiliency Extension (NVRx)集成到PyTorch FSDP训练中,实现检查点I/O与训练重叠,并在H100上2到8节点测试中达到99%+的训练效率,GPU故障恢复时间缩短至秒级。

图片来源 · AWS Machine Learning Blog
原文 · AWS Machine Learning Blog

Fault tolerant distributed training on Amazon EKS using NVRx

Integrate NVIDIA Resiliency Extension (NVRx) into PyTorch FSDP training on Amazon EKS to overlap checkpoint I/O with training and recover from GPU faults in seconds. This post covers async checkpointing, in-process restart, and ft_launcher in-job restart, with H100 benchmarks at 2 to 8 nodes showing 99%+ training efficiency and second-scale recovery.