<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>推理引擎 on PlumePHP</title><link>https://plumephp.com/tags/%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/</link><description>Recent content in 推理引擎 on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Thu, 10 Sep 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/tags/%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/index.xml" rel="self" type="application/rss+xml"/><item><title>NVIDIA Triton Inference Server 生产部署</title><link>https://plumephp.com/ai-triton-server/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-triton-server/</guid><description>&lt;p&gt;在 AI 模型落地的最后一公里，推理服务的稳定性、吞吐量和延迟直接决定了用户体验。NVIDIA Triton Inference Server（以下简称 Triton）作为企业级推理框架的代表，已经成为大型生产系统的标配组件。本文将从架构原理、配置调优到生产部署实践，系统梳理 Triton 的完整使用路径。&lt;/p&gt;</description></item><item><title>ONNX Runtime 跨平台推理优化</title><link>https://plumephp.com/ai-onnx-runtime/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-onnx-runtime/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;随着深度学习模型越来越多地部署到边缘设备与多样化硬件之上，模型格式与推理引擎的统一化已成为工程落地的关键瓶颈。PyTorch 和 TensorFlow 各自拥有庞大的生态系统，但训练后时将模型转换为一个与框架无关的中间表示，才能真正实现&amp;quot;一次导出、到处运行&amp;quot;。ONNX（Open Neural Network Exchange）正是为此而生，而 ONNX Runtime 作为其官方高性能推理引擎，已经成为跨平台模型部署的事实标准之一。&lt;/p&gt;</description></item><item><title>TensorRT 深度实践：从 ONNX 到高性能推理引擎</title><link>https://plumephp.com/ai-tensorrt/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-tensorrt/</guid><description>&lt;h2 id="1-tensorrt-简介"&gt;1. TensorRT 简介&lt;/h2&gt;
&lt;p&gt;TensorRT 是 NVIDIA 推出的高性能深度学习推理 SDK，核心目标是将训练好的模型转化为能够在 NVIDIA GPU 上高效执行的推理引擎。与基于 PyTorch、TensorFlow 的原生推理相比，TensorRT 通过层融合（Layer Fusion）、精度校准（Precision Calibration）和张量内存优化等手段，通常能带来 &lt;strong&gt;2~10 倍&lt;/strong&gt; 的推理加速，同时显著降低延迟和显存占用。&lt;/p&gt;</description></item><item><title>TensorRT-LLM：大语言模型的高效推理部署</title><link>https://plumephp.com/ai-tensorrt-llm/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-tensorrt-llm/</guid><description>&lt;p&gt;大语言模型（LLM）的推理部署是 AI 基础设施的核心挑战之一。随着模型参数量从数十亿增长到数千亿，如何在保证低延迟和高吞吐的前提下高效运行这些模型，成为生产环境的必答题。NVIDIA 推出的 &lt;strong&gt;TensorRT-LLM&lt;/strong&gt; 正是为了解决这一痛点而诞生的专用推理框架。本文将系统性地介绍 TensorRT-LLM 的核心机制、优化手段和落地实践。&lt;/p&gt;</description></item><item><title>推理引擎终极对比：TensorRT vs ONNX Runtime vs OpenVINO</title><link>https://plumephp.com/ai-inference-engine-comparison/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-inference-engine-comparison/</guid><description>&lt;p&gt;模型训练完成后，真正的挑战才刚刚开始：如何让模型在生产环境中跑得又快又稳？选择一个合适的推理引擎，往往比换一块更贵的显卡带来的收益更大。本文将深入对比业界三大主流推理引擎 —— TensorRT、ONNX Runtime 和 OpenVINO，从延迟、吞吐、硬件兼容性到量化策略逐一拆解，并给出可直接落地的选型决策树与混合部署方案。&lt;/p&gt;</description></item></channel></rss>