<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>NVIDIA on PlumePHP</title><link>https://plumephp.com/tags/nvidia/</link><description>Recent content in NVIDIA on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Thu, 10 Sep 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/tags/nvidia/index.xml" rel="self" type="application/rss+xml"/><item><title>cuBLAS / cuDNN / cuFFT：NVIDIA 加速库实战</title><link>https://plumephp.com/ai-cuda-libraries/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-cuda-libraries/</guid><description>&lt;p&gt;在 CUDA C++ 应用开发中，开发者很少从零编写核函数。NVIDIA 官方提供了一套经过深度优化的加速库，覆盖线性代数、深度学习、信号处理、并行算法等核心场景。这套库不仅性能卓越，而且经过大量生产环境验证。本文将系统梳理 cuBLAS、cuDNN、cuFFT、Thrust 以及 Cutlass 的用法与工程实践。&lt;/p&gt;</description></item><item><title>CUDA 编程入门：从 Hello GPU 到线程网格模型</title><link>https://plumephp.com/ai-cuda-basics/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-cuda-basics/</guid><description>&lt;blockquote&gt;
&lt;p&gt;在大模型推理与训练日益普及的今天，GPU 已不再是游戏玩家的专属硬件，而是 AI 基础设施的核心。理解 CUDA 编程，是每一位希望深入 AI 系统优化的工程师必经之路。本文从零开始，带你掌握 GPU 并行计算的核心概念与实战代码。&lt;/p&gt;</description></item><item><title>NVIDIA Triton Inference Server 生产部署</title><link>https://plumephp.com/ai-triton-server/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-triton-server/</guid><description>&lt;p&gt;在 AI 模型落地的最后一公里，推理服务的稳定性、吞吐量和延迟直接决定了用户体验。NVIDIA Triton Inference Server（以下简称 Triton）作为企业级推理框架的代表，已经成为大型生产系统的标配组件。本文将从架构原理、配置调优到生产部署实践，系统梳理 Triton 的完整使用路径。&lt;/p&gt;</description></item><item><title>TensorRT 深度实践：从 ONNX 到高性能推理引擎</title><link>https://plumephp.com/ai-tensorrt/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-tensorrt/</guid><description>&lt;h2 id="1-tensorrt-简介"&gt;1. TensorRT 简介&lt;/h2&gt;
&lt;p&gt;TensorRT 是 NVIDIA 推出的高性能深度学习推理 SDK，核心目标是将训练好的模型转化为能够在 NVIDIA GPU 上高效执行的推理引擎。与基于 PyTorch、TensorFlow 的原生推理相比，TensorRT 通过层融合（Layer Fusion）、精度校准（Precision Calibration）和张量内存优化等手段，通常能带来 &lt;strong&gt;2~10 倍&lt;/strong&gt; 的推理加速，同时显著降低延迟和显存占用。&lt;/p&gt;</description></item><item><title>TensorRT-LLM：大语言模型的高效推理部署</title><link>https://plumephp.com/ai-tensorrt-llm/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-tensorrt-llm/</guid><description>&lt;p&gt;大语言模型（LLM）的推理部署是 AI 基础设施的核心挑战之一。随着模型参数量从数十亿增长到数千亿，如何在保证低延迟和高吞吐的前提下高效运行这些模型，成为生产环境的必答题。NVIDIA 推出的 &lt;strong&gt;TensorRT-LLM&lt;/strong&gt; 正是为了解决这一痛点而诞生的专用推理框架。本文将系统性地介绍 TensorRT-LLM 的核心机制、优化手段和落地实践。&lt;/p&gt;</description></item></channel></rss>