分布式训练实战:DDP、FSDP、ZeRO 与大规模训练工程
大模型训练离不开多卡分布式,本文系统讲解 DDP 数据并行原理与 AllReduce、混合精度训练(FP16/BF16)、梯度累积与梯度裁剪、ZeRO 分片(ZeRO-1/2/3)、FSDP 全分片数据并行、张量并行与流水线并行、checkpoint 与断点续训、以及分布式训练排错(NCCL 超时/OOM/收敛异常)的完整工程方法论。
tag
大模型训练离不开多卡分布式,本文系统讲解 DDP 数据并行原理与 AllReduce、混合精度训练(FP16/BF16)、梯度累积与梯度裁剪、ZeRO 分片(ZeRO-1/2/3)、FSDP 全分片数据并行、张量并行与流水线并行、checkpoint 与断点续训、以及分布式训练排错(NCCL 超时/OOM/收敛异常)的完整工程方法论。
多卡推理的吞吐天花板往往不在算力,而在 GPU 之间的通信。NCCL 是 NVIDIA 的集合通信库:AllReduce/AllGather/Reduce-Scatter 原语、Ring 与 Tree 算法、NVLink/RDMA 互连、拓扑感知与超节点。本文把 NCCL 讲透:通信原语怎么选、算法怎么收敛、拓扑怎么感知,以及多卡推理(张量并行)的通信优化实战。