posts

AI 推理加速与系统专题:从 CUDA 到生产级推理引擎

AI 推理系统完整专题:CUDA GPU 并行编程、cuBLAS/cuDNN 加速库、TensorRT 推理优化、ONNX Runtime 跨平台部署、vLLM 高吞吐服务、模型量化与压缩(INT8/FP16/GPTQ)、Triton Inference Server 生产部署,覆盖从 GPU 编程到推理工程化全栈实践。
全部文章 Game Golang Saas Rust 游戏开发 客户端开发 GameDev Lua 写作 小说
ai

推理引擎终极对比:TensorRT vs ONNX Runtime vs OpenVINO

模型训练完成后,真正的挑战才刚刚开始:如何让模型在生产环境中跑得又快又稳?选择一个合适的推理引擎,往往比换一块更贵的显卡带来的收益更大。本文将深入对比业界三大主流推理引擎 —— TensorRT、ONNX Runtime 和 OpenVINO,从延迟、吞吐、硬件兼容性到量化策略逐一拆解,并给出可直接

11 分钟阅读
推理引擎 对比 选型