<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>分布式训练 on PlumePHP</title><link>https://plumephp.com/tags/%E5%88%86%E5%B8%83%E5%BC%8F%E8%AE%AD%E7%BB%83/</link><description>Recent content in 分布式训练 on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Wed, 30 Sep 2026 11:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/tags/%E5%88%86%E5%B8%83%E5%BC%8F%E8%AE%AD%E7%BB%83/index.xml" rel="self" type="application/rss+xml"/><item><title>分布式训练实战：DDP、FSDP、ZeRO 与大规模训练工程</title><link>https://plumephp.com/ai-ml-distributed-training/</link><pubDate>Tue, 29 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-ml-distributed-training/</guid><description>分布式训练：DDP、混合精度、ZeRO、FSDP、张量/流水线并行、断点续训与排错。</description></item><item><title>HPC 与 AI 融合：超算跑大模型训练</title><link>https://plumephp.com/hpc-ai-hpc-convergence/</link><pubDate>Wed, 30 Sep 2026 11:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-ai-hpc-convergence/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;超算正在成为大模型训练的算力底座，AI 也在反过来改造科学计算——&lt;strong&gt;HPC 与 AI 融合&lt;/strong&gt;是当前计算领域最重要的趋势。一方面，大模型训练需要 HPC 级的高速网络与大规模并行；另一方面，科学模拟开始引入神经网络（科学 ML），HPC 作业与 AI 作业在同一张 GPU 集群上共存。&lt;/p&gt;</description></item><item><title>NCCL 集合通信：AllReduce 原理与多卡训练网络优化</title><link>https://plumephp.com/hpc-nccl-collectives/</link><pubDate>Wed, 30 Sep 2026 09:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-nccl-collectives/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;单卡装不下的模型要分到多卡，多卡就要&lt;strong&gt;同步梯度&lt;/strong&gt;；梯度同步的本质是一堆&lt;strong&gt;集合通信&lt;/strong&gt;。MPI 为 CPU 集群设计了广播/归约原语，而 GPU 时代 NVIDIA 用 &lt;strong&gt;NCCL（NVIDIA Collective Communications Library）&lt;/strong&gt; 把这套思想重新实现——针对 NVLink、PCIe、InfiniBand 的拓扑做了极致优化，成为 PyTorch DDP、Megatron、DeepSpeed 背后事实上的通信标准。&lt;/p&gt;</description></item></channel></rss>