<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>AI 推理加速与系统专题：从 CUDA 到生产级推理引擎 on PlumePHP</title><link>https://plumephp.com/posts/ai/</link><description>Recent content in AI 推理加速与系统专题：从 CUDA 到生产级推理引擎 on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Thu, 10 Sep 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/posts/ai/index.xml" rel="self" type="application/rss+xml"/><item><title>cuBLAS / cuDNN / cuFFT：NVIDIA 加速库实战</title><link>https://plumephp.com/ai-cuda-libraries/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-cuda-libraries/</guid><description>&lt;p&gt;在 CUDA C++ 应用开发中，开发者很少从零编写核函数。NVIDIA 官方提供了一套经过深度优化的加速库，覆盖线性代数、深度学习、信号处理、并行算法等核心场景。这套库不仅性能卓越，而且经过大量生产环境验证。本文将系统梳理 cuBLAS、cuDNN、cuFFT、Thrust 以及 Cutlass 的用法与工程实践。&lt;/p&gt;</description></item><item><title>CUDA 内存管理与性能优化：Bank Conflict 与合并访问</title><link>https://plumephp.com/ai-cuda-memory-optimization/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-cuda-memory-optimization/</guid><description>&lt;p&gt;在现代 GPU 计算中，内存访问模式往往是决定内核性能的首要因素。算法复杂度相同的两个 CUDA Kernel，仅仅因为访问显存的方式不同，执行时间可能相差数倍甚至一个数量级。本文将系统梳理 CUDA 编程中各类内存的访问特性，深入讲解合并访问（Coalesced Access）与 Bank Conflict 的核心原理，并给出配套的代码示例与优化实践。&lt;/p&gt;</description></item><item><title>CUDA 编程入门：从 Hello GPU 到线程网格模型</title><link>https://plumephp.com/ai-cuda-basics/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-cuda-basics/</guid><description>&lt;blockquote&gt;
&lt;p&gt;在大模型推理与训练日益普及的今天，GPU 已不再是游戏玩家的专属硬件，而是 AI 基础设施的核心。理解 CUDA 编程，是每一位希望深入 AI 系统优化的工程师必经之路。本文从零开始，带你掌握 GPU 并行计算的核心概念与实战代码。&lt;/p&gt;</description></item><item><title>GPTQ / AWQ / W4A16：大语言模型权重量化实战</title><link>https://plumephp.com/ai-llm-quantization/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-llm-quantization/</guid><description>&lt;p&gt;使用 70 GB 显存才能跑一次的 Llama-2-70B，量化后可以塞进 24 GB 的消费级显卡。这不是魔法，而是大语言模型（LLM）权重量化带来的实际收益。本文将深入讲解 GPTQ、AWQ、SmoothQuant、W4A16 等主流量化方案的原理与实战，帮助你在生产环境中实现 4 倍模型压缩而不显著牺牲精度。&lt;/p&gt;</description></item><item><title>KV Cache 优化与注意力机制加速：FlashAttention / PagedAttention</title><link>https://plumephp.com/ai-attention-optimization/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-attention-optimization/</guid><description>&lt;p&gt;大型语言模型（LLM）的推理性能已经成为生产环境部署中的核心挑战。在 Transformer 架构中，自注意力机制（Self-Attention）虽然在建模长距离依赖方面表现出色，但其计算和内存开销随序列长度呈平方增长。当上下文窗口扩展到 128K 甚至 1M token 时，传统的注意力实现会迅速触及 GPU 硬件瓶颈。本文将深入探讨三项关键技术——FlashAttention、PagedAttention 与 KV Cache 优化——它们分别从计算效率和内存管理两个维度重塑了 LLM 推理的工程实践。&lt;/p&gt;</description></item><item><title>LLM 推理服务架构设计：从单机到分布式集群</title><link>https://plumephp.com/ai-llm-inference-architecture/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-llm-inference-architecture/</guid><description>&lt;p&gt;随着大型语言模型（LLM）从实验室走向生产环境，构建一个高吞吐、低延迟、可弹性伸缩的推理服务架构，已成为 AI 工程团队的核心命题。与传统的请求-响应式服务不同，LLM 推理具有内存占用高、计算密集、延迟不可预测等特点，这要求我们在架构设计时必须引入一套全新的技术范式。本文将从单机部署出发，逐步推演到分布式集群方案，系统梳理 LLM 推理服务的关键设计考量。&lt;/p&gt;</description></item><item><title>NVIDIA Triton Inference Server 生产部署</title><link>https://plumephp.com/ai-triton-server/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-triton-server/</guid><description>&lt;p&gt;在 AI 模型落地的最后一公里，推理服务的稳定性、吞吐量和延迟直接决定了用户体验。NVIDIA Triton Inference Server（以下简称 Triton）作为企业级推理框架的代表，已经成为大型生产系统的标配组件。本文将从架构原理、配置调优到生产部署实践，系统梳理 Triton 的完整使用路径。&lt;/p&gt;</description></item><item><title>ONNX Runtime 跨平台推理优化</title><link>https://plumephp.com/ai-onnx-runtime/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-onnx-runtime/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;随着深度学习模型越来越多地部署到边缘设备与多样化硬件之上，模型格式与推理引擎的统一化已成为工程落地的关键瓶颈。PyTorch 和 TensorFlow 各自拥有庞大的生态系统，但训练后时将模型转换为一个与框架无关的中间表示，才能真正实现&amp;quot;一次导出、到处运行&amp;quot;。ONNX（Open Neural Network Exchange）正是为此而生，而 ONNX Runtime 作为其官方高性能推理引擎，已经成为跨平台模型部署的事实标准之一。&lt;/p&gt;</description></item><item><title>TensorRT 深度实践：从 ONNX 到高性能推理引擎</title><link>https://plumephp.com/ai-tensorrt/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-tensorrt/</guid><description>&lt;h2 id="1-tensorrt-简介"&gt;1. TensorRT 简介&lt;/h2&gt;
&lt;p&gt;TensorRT 是 NVIDIA 推出的高性能深度学习推理 SDK，核心目标是将训练好的模型转化为能够在 NVIDIA GPU 上高效执行的推理引擎。与基于 PyTorch、TensorFlow 的原生推理相比，TensorRT 通过层融合（Layer Fusion）、精度校准（Precision Calibration）和张量内存优化等手段，通常能带来 &lt;strong&gt;2~10 倍&lt;/strong&gt; 的推理加速，同时显著降低延迟和显存占用。&lt;/p&gt;</description></item><item><title>TensorRT-LLM：大语言模型的高效推理部署</title><link>https://plumephp.com/ai-tensorrt-llm/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-tensorrt-llm/</guid><description>&lt;p&gt;大语言模型（LLM）的推理部署是 AI 基础设施的核心挑战之一。随着模型参数量从数十亿增长到数千亿，如何在保证低延迟和高吞吐的前提下高效运行这些模型，成为生产环境的必答题。NVIDIA 推出的 &lt;strong&gt;TensorRT-LLM&lt;/strong&gt; 正是为了解决这一痛点而诞生的专用推理框架。本文将系统性地介绍 TensorRT-LLM 的核心机制、优化手段和落地实践。&lt;/p&gt;</description></item><item><title>vLLM 深度解析：连续批处理与内存高效推理</title><link>https://plumephp.com/ai-vllm-system/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-vllm-system/</guid><description>&lt;p&gt;大语言模型（LLM）推理服务的扩展性瓶颈，往往不在计算吞吐量，而在 GPU 显存。传统推理框架将 KV Cache 以连续张量形式预分配，造成大量内存浪费，导致 batch size 被严重限制。vLLM 通过引入操作系统虚拟内存机制启发的 PagedAttention，将显存利用效率推向新高度，成为当前开源 LLM 推理引擎的事实标准之一。&lt;/p&gt;</description></item><item><title>推理引擎终极对比：TensorRT vs ONNX Runtime vs OpenVINO</title><link>https://plumephp.com/ai-inference-engine-comparison/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-inference-engine-comparison/</guid><description>&lt;p&gt;模型训练完成后，真正的挑战才刚刚开始：如何让模型在生产环境中跑得又快又稳？选择一个合适的推理引擎，往往比换一块更贵的显卡带来的收益更大。本文将深入对比业界三大主流推理引擎 —— TensorRT、ONNX Runtime 和 OpenVINO，从延迟、吞吐、硬件兼容性到量化策略逐一拆解，并给出可直接落地的选型决策树与混合部署方案。&lt;/p&gt;</description></item><item><title>模型剪枝与知识蒸馏：从压缩到加速全链路</title><link>https://plumephp.com/ai-model-compression/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-model-compression/</guid><description>&lt;h2 id="引言为什么需要模型压缩"&gt;引言：为什么需要模型压缩&lt;/h2&gt;
&lt;p&gt;深度学习模型的参数量正在以指数级增长。从 AlexNet 的 6000 万参数，到 GPT-4 的万亿级参数，模型能力的提升往往伴随着体积的膨胀。然而，在生产环境中部署这些庞大模型时，我们面临着严峻的现实约束：&lt;/p&gt;</description></item><item><title>模型量化技术详解：INT8、FP16 与混合精度推理</title><link>https://plumephp.com/ai-quantization/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-quantization/</guid><description>&lt;p&gt;在深度学习落地过程中，模型体积与推理延迟往往是最大的拦路虎。一个经过充分训练的 ResNet-50 FP32 模型约有 98 MB，而大型语言模型的参数规模更是以 GB 甚至 TB 计。模型量化（Model Quantization）通过降低数值精度，在几乎不损失精度的前提下，将模型压缩数倍并显著加速推理。本文将系统梳理从 FP16 到 INT8 的量化原理、PTQ 与 QAT 两大技术路线，并结合 TensorRT 与 ONNX Runtime 给出可落地的工程实践。&lt;/p&gt;</description></item></channel></rss>