<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>张量并行 on PlumePHP</title><link>https://plumephp.com/tags/%E5%BC%A0%E9%87%8F%E5%B9%B6%E8%A1%8C/</link><description>Recent content in 张量并行 on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Tue, 29 Sep 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/tags/%E5%BC%A0%E9%87%8F%E5%B9%B6%E8%A1%8C/index.xml" rel="self" type="application/rss+xml"/><item><title>分布式训练实战：DDP、FSDP、ZeRO 与大规模训练工程</title><link>https://plumephp.com/ai-ml-distributed-training/</link><pubDate>Tue, 29 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-ml-distributed-training/</guid><description>分布式训练：DDP、混合精度、ZeRO、FSDP、张量/流水线并行、断点续训与排错。</description></item><item><title>NCCL 集合通信：AllReduce、Ring 算法与多卡推理的通信优化</title><link>https://plumephp.com/ai-collective-communication-nccl/</link><pubDate>Mon, 28 Sep 2026 15:00:00 +0800</pubDate><guid>https://plumephp.com/ai-collective-communication-nccl/</guid><description>&lt;p&gt;张量并行把 70B 模型拆到 8 张卡，但「拆」带来的通信开销可能把提速全吃掉——&lt;strong&gt;每层 forward 都要跨卡同步&lt;/strong&gt;。NCCL（NVIDIA Collective Communications Library）就是这场跨卡通信的引擎：AllReduce 归约梯度、AllGather 广播权重、Ring 算法摊平带宽、NVLink/RDMA 打通互连。本文把 NCCL 讲透：有哪些原语、算法怎么收敛、拓扑怎么感知、多卡推理怎么优化通信，以及「通信到底花多少钱、值不值」。&lt;/p&gt;</description></item></channel></rss>