<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>高性能计算专题：从 MPI 到 GPU 集群的并行编程实践 on PlumePHP</title><link>https://plumephp.com/posts/hpc/</link><description>Recent content in 高性能计算专题：从 MPI 到 GPU 集群的并行编程实践 on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Thu, 10 Sep 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/posts/hpc/index.xml" rel="self" type="application/rss+xml"/><item><title>CUDA + MPI 异构并行：多 GPU 分布式编程实战</title><link>https://plumephp.com/hpc-cuda-mpi-hybrid/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-cuda-mpi-hybrid/</guid><description>&lt;p&gt;现代超算系统已经从纯 CPU 集群演进为 GPU 加速卡主导的异构架构。&lt;/p&gt;
&lt;h2 id="多-gpu-编程模型"&gt;多 GPU 编程模型&lt;/h2&gt;
&lt;p&gt;每块 GPU 拥有独立的显存空间，线程块、网格、流的概念构建三层并行体系：&lt;/p&gt;
&lt;pre tabindex="0"&gt;&lt;code&gt;┌─────────────────────────────────────────────────────┐
│ Device (GPU) │
│ ┌────────┐ ┌────────┐ ┌────────┐ ┌────────┐ │
│ │Grid 0 │ │Grid 1 │ │Grid 2 │ │Grid 3 │ │
│ │ │ │ │ │ │ │ │ │
│ │Block 0 │ │Block 0 │ │Block 0 │ │Block 0 │ │
│ │Block 1 │ │Block 1 │ │Block 1 │ │Block 1 │ │
│ │ ... │ │ ... │ │ ... │ │ ... │ │
│ │────────│ │────────│ │────────│ │────────│ │
│ │Stream 0│ │Stream 1│ │Stream 2│ │Stream 3│ │
│ └────────┘ └────────┘ └────────┘ └────────┘ │
│ Global Memory │
└─────────────────────────────────────────────────────┘
 ↑ PCIe / NVLink / NVSwitch ↑
 ┌────┴────────────────────────────┴────┐
 │ CUDA Context │
 └──────────────────────────────────────┘
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;单个 MPI 进程通常对应一块 GPU。通过 &lt;code&gt;cudaSetDevice(rank % num_gpus_per_node)&lt;/code&gt; 实现进程与 GPU 的一一映射。&lt;/p&gt;</description></item><item><title>HBM、GDDR 与 NUMA：HPC 内存层次优化实战</title><link>https://plumephp.com/hpc-memory-hierarchy/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-memory-hierarchy/</guid><description>&lt;p&gt;现代高性能计算系统中，计算性能的 scaling 瓶颈早已从 CPU 主频转向了内存子系统。理解内存层次结构、掌握 NUMA（Non-Uniform Memory Access）架构下的编程优化，是 HPC 开发者榨干硬件潜能的关键一步。&lt;/p&gt;</description></item><item><title>HPC 并行算法设计模式</title><link>https://plumephp.com/hpc-parallel-algorithms/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-parallel-algorithms/</guid><description>&lt;h2 id="1-主从模式-master-worker"&gt;1. 主从模式 (Master-Worker)&lt;/h2&gt;
&lt;p&gt;主从模式是最直观的并行范式：一个 Master 负责任务分发与结果归并，多个 Worker 执行实际计算。该模式适合任务独立、粒度过细的场景，如蒙特卡洛模拟、参数扫描。&lt;/p&gt;</description></item><item><title>InfiniBand 与 RDMA 网络深度解析</title><link>https://plumephp.com/hpc-infini-band/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-infini-band/</guid><description>&lt;h2 id="1-infiniband-架构概览"&gt;1. InfiniBand 架构概览&lt;/h2&gt;
&lt;p&gt;InfiniBand (IB) 是为 HPC 和数据中心设计的高性能互连技术，核心优势在于低延迟（亚微秒级）、高带宽（当前 NDR 达 400Gb/s）以及内核旁路（Kernel Bypass）。其基本拓扑单元由三类设备构成：&lt;/p&gt;</description></item><item><title>Lustre 并行文件系统调优实战</title><link>https://plumephp.com/hpc-lustre-filesystem/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-lustre-filesystem/</guid><description>&lt;p&gt;Lustre 是目前超算中心部署最广泛的并行文件系统，专为大规模 MPI 并行 I/O 场景设计。理解其 MDS-OSS-Client 架构、条带化机制与 Linux 内核参数调优，是释放大规模 HPC 集群 I/O 性能的关键。&lt;/p&gt;</description></item><item><title>MPI 并行编程入门：从点到点通信到非阻塞</title><link>https://plumephp.com/hpc-mpi-basics/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-mpi-basics/</guid><description>&lt;p&gt;MPI（Message Passing Interface）是分布式内存系统中最主流的并行编程标准。无论节点间通过 InfiniBand 还是以太网互联，MPI 提供了统一的通信原语。理解 MPI 通信模型是编写可扩展并行程序的基础。&lt;/p&gt;</description></item><item><title>OpenFOAM 流体模拟入门</title><link>https://plumephp.com/hpc-openfoam-cfd/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-openfoam-cfd/</guid><description>&lt;p&gt;OpenFOAM 是业界最广泛使用的开源计算流体力学（CFD）框架，基于 C++ 编写，采用有限体积法（Finite Volume Method）求解 Navier-Stokes 方程。本文从工程实践角度拆解其框架、网格、求解器配置与并行策略。&lt;/p&gt;</description></item><item><title>OpenMP 共享内存并行编程：从循环到任务</title><link>https://plumephp.com/hpc-openmp/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-openmp/</guid><description>&lt;p&gt;OpenMP 是最简便的共享内存多线程并行接口。区别于 MPI 的显式消息传递，OpenMP 通过编译器指令在串行代码基础上标记可并行区域。对于 NUMA 架构的多核 CPU，正确使用 OpenMP 可以充分释放硬件并行潜力。&lt;/p&gt;</description></item><item><title>PETSc 科学计算库实战指南</title><link>https://plumephp.com/hpc-petsc-solver/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-petsc-solver/</guid><description>&lt;h2 id="1-petsc-体系结构"&gt;1. PETSc 体系结构&lt;/h2&gt;
&lt;p&gt;PETSc（Portable, Extensible Toolkit for Scientific Computation）是 Argonne 国家实验室开发的大规模并行科学计算库，以 C 编写，提供 C/C++/Fortran/Python 绑定。其核心分层如下：&lt;/p&gt;</description></item><item><title>ROCm HIP GPU 编程实战</title><link>https://plumephp.com/hpc-amd-rocm/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-amd-rocm/</guid><description>&lt;p&gt;AMD ROCm 是 AMD 推出的开源 GPU 计算软件栈，旨在与 NVIDIA CUDA 生态直接竞争。HIP（Heterogeneous-computing Interface for Portability）作为其编程抽象层，允许开发者以接近 CUDA 的语法编写跨平台 GPU 代码。本文从架构到代码，拆解 ROCm/HIP 的完整实践路径。&lt;/p&gt;</description></item><item><title>Roofline 性能模型：判定性能瓶颈与优化方向</title><link>https://plumephp.com/hpc-roofline-model/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-roofline-model/</guid><description>&lt;p&gt;Roofline 模型由 Samuel Williams 等人于 2009 年提出，是 HPC 性能分析领域最经典、最直观的可视化工具之一。它以单一图表将程序的&amp;quot;性能天花板&amp;quot;与&amp;quot;实际表现&amp;quot;进行映射，帮助开发者快速判定瓶颈到底出在内存带宽还是计算峰值上。&lt;/p&gt;</description></item><item><title>Slurm 集群调度系统深度解析与实战</title><link>https://plumephp.com/hpc-slurm-scheduling/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-slurm-scheduling/</guid><description>&lt;p&gt;Slurm（Simple Linux Utility for Resource Management）是当今 HPC 领域最主流的集群资源调度与作业管理系统。它管理着全球 Top500 超算中超过半数以上的系统资源，从几节点的小型实验室集群到数万个节点的大型超算中心，Slurm 都提供了稳定、可扩展的调度能力。&lt;/p&gt;</description></item><item><title>Dell R650 vs HPE DL360 Gen11 企业级服务器深度评测</title><link>https://plumephp.com/dell-r650-vs-hpe-dl360-gen11/</link><pubDate>Thu, 06 Nov 2025 13:00:00 +0800</pubDate><guid>https://plumephp.com/dell-r650-vs-hpe-dl360-gen11/</guid><description>&lt;h2 id="前言"&gt;前言&lt;/h2&gt;
&lt;p&gt;在企业级2U双路机架服务器市场，Dell PowerEdge R650和HPE ProLiant DL360 Gen11是两款旗舰级产品，代表着各自厂商在通用计算领域的最高水平。本文将对这两款服务器进行全方位深度对比，为企业IT采购决策提供详实的参考依据。&lt;/p&gt;</description></item></channel></rss>