HPC 性能剖析与调优工具链:perf/gprof/VTune/Nsight
系统讲解 HPC 性能剖析方法学,深入 perf 与火焰图、gprof、Intel VTune、AMD uProf、NVIDIA Nsight 及 MPI 通信剖析工具 mpiP/TAU 的使用与热点瓶颈分级。
category
系统讲解 HPC 性能剖析方法学,深入 perf 与火焰图、gprof、Intel VTune、AMD uProf、NVIDIA Nsight 及 MPI 通信剖析工具 mpiP/TAU 的使用与热点瓶颈分级。
解析大规模系统故障特征与容错架构,深入 Checkpoint/Restart 的周期/增量/分层策略、SCR/DMTCP 检查点库、ULFM 消息传递容错与异步复制恢复的生产实践。
解析 HPC 场景下容器技术的选型逻辑,深入 Singularity/Apptainer 的 SIF 镜像格式、无特权运行机制、Docker 镜像转换、MPI 与 Conda 集成以及可复现性保障。
深入 GPU 内核调优的四大维度:占用率计算、访存合并与共享内存、指令级并行与 warp 分歧消除,并覆盖 cuBLAS/cuDNN 调优参数、NCCL 通信优化与基准对比方法论。
HPC 高性能计算专题导航:涵盖 MPI 并行编程、OpenMP 共享内存、CUDA + MPI 异构并行、Slurm 集群调度、内存层次优化、Roofline 性能模型、并行算法模式、InfiniBand RDMA、PETSc/PyTorch 科学计算、OpenFOAM 流体模拟、AMD ROCm GPU 编程、Lustre 并行文件系统,以及 Singularity 容器、Nextflow/Snakemake 工作流、性能剖析工具链、GPU 内核优化、容错与检查点、集群运维;并进阶覆盖 Python 分布式计算(Dask/Ray)、Kubernetes 调度 HPC 作业、并行 I/O(MPI-IO/HDF5/NetCDF)、分子动力学仿真(GROMACS/LAMMPS)、云上弹性 HPC(AWS ParallelCluster)与 HPL/TOP500 基准测试。
深入剖析 Slurm 集群调度架构、作业提交、分区配置与调度策略,提供配置示例和常用命令速查表。
深入讲解 Roofline 模型的计算强度、内存带宽天花板与计算天花板,结合工具与案例分析判定 memory-bound 与 compute-bound。
ROCm 平台架构、HIP 编程模型、hipify 迁移工具及与 CUDA 深度对比,覆盖性能调优、容器化部署与多 GPU 分布式训练
系统讲解 PETSc 体系结构与核心 API,涵盖稀疏矩阵格式、线性求解器选择、非线性求解、并行组装及性能剖析,附完整 C 代码示例。
深入解析 OpenMP 并行构造、调度策略、同步原语与任务并行,配合 C 代码示例与性能实验对比。
OpenFOAM 框架结构、网格生成、边界条件与并行运行实战指南
系统讲解 MPI 并行编程核心概念,涵盖初始化、点对点通信、集合通信与非阻塞通信,配合完整 C 代码示例。
Lustre 架构解析、条带化策略、元数据优化与 POSIX/MPI-IO 性能对比
深入讲解 InfiniBand 网络架构、RDMA 操作类型、RoCEv2 与原生 IB 对比、性能调优及 MPI over RDMA 实践。
系统梳理 HPC 领域主流并行算法设计模式,涵盖主从模式、分治并行、流水线、SPMD、数据并行、任务窃取、并行前缀和与并行排序,配有伪代码与复杂度分析。
深入解析现代 HPC 内存架构、NUMA 感知编程与内存带宽优化,涵盖 STREAM benchmark 与 numactl 实战。
深入讲解 CUDA 与 MPI 混合并行编程模型,涵盖 GPUDirect RDMA、NCCL 通信库与大规模 GPU 集群实践,配合完整代码示例。
Dell PowerEdge R650和HPE ProLiant DL360 Gen11是两款旗舰级企业级服务器,本文对其进行深度对比,为企业IT采购决策提供参考。