新闻 · AWS Machine Learning Blog
在Amazon EKS上使用NVRx进行容错分布式训练
将NVIDIA Resiliency Extension(NVRx)集成到Amazon EKS上的PyTorch FSDP训练中,使检查点I/O与训练重叠,并在数秒内从GPU故障中恢复。本文涵盖异步检查点、进程内重启以及ft_launcher作业内重启,并附有2至8个节点的H100基准测试,显示训练效率达99%以上,恢复时间为秒级。
en
新闻 · AWS Machine Learning Blog
将NVIDIA Resiliency Extension(NVRx)集成到Amazon EKS上的PyTorch FSDP训练中,使检查点I/O与训练重叠,并在数秒内从GPU故障中恢复。本文涵盖异步检查点、进程内重启以及ft_launcher作业内重启,并附有2至8个节点的H100基准测试,显示训练效率达99%以上,恢复时间为秒级。
英文原标题:Fault tolerant distributed training on Amazon EKS using NVRx
本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗
为什么值得看:本文提供了在 Amazon EKS 上使用 NVRx 实现容错分布式训练的完整方案,包括异步检查点和多层重启机制,可显著减少 GPU 空闲时间并提升大规模训练效率。