category

Ai

共 63 篇文章。
全部文章GameGolangSaasRust游戏开发客户端开发GameDevProductsLua写作小说IndieFrontendPrd
ai

分布式推理与 GPU 集群调度:张量并行、流水并行与调度器实战

当单卡放不下一个 70B 模型,或单卡无法满足线上吞吐时,分布式推理就从『可选优化』变成『必选项』。本文系统讲解张量并行、流水线并行与专家并行三大策略的通信代价与适用场景,介绍连续批处理在集群中的落地,并深入 KServe 与 Ray Serve 两类 GPU 调度器的架构与配置。一、为什么需要分布式推理

10 分钟阅读
分布式推理 GPU 并行计算
ai

多模态推理实战:从图像 Token 化到视觉语言模型联合推理

大语言模型的文本能力已经被充分挖掘,而让模型『看懂图』的多模态推理,正在成为企业级应用的新战场:文档解析、商品识别、自动驾驶、智能客服。本文从图像如何变成 Token 讲起,深入视觉语言模型(VLM)的联合推理机制、多模态 KV Cache 显存管理,再到生产级多模态推理服务部署。一、从单模态到多模态:VLM 推理的挑战

9 分钟阅读
多模态 VLM 推理加速
ai

推理引擎终极对比:TensorRT vs ONNX Runtime vs OpenVINO

模型训练完成后,真正的挑战才刚刚开始:如何让模型在生产环境中跑得又快又稳?选择一个合适的推理引擎,往往比换一块更贵的显卡带来的收益更大。本文将深入对比业界三大主流推理引擎 —— TensorRT、ONNX Runtime 和 OpenVINO,从延迟、吞吐、硬件兼容性到量化策略逐一拆解,并给出可直接

11 分钟阅读
推理引擎 对比 选型
ai

AI 推理加速与系统专题:从 CUDA 到生产级推理引擎

AI 推理系统完整专题:CUDA GPU 并行编程、cuBLAS/cuDNN 加速库、算子融合与 CUDA Graph、TensorRT 推理优化、ONNX Runtime 跨平台部署、vLLM 高吞吐服务、模型量化与压缩(INT8/FP16/GPTQ/QAT/FP8)、投机采样(Speculative Decoding)、AI 编译器(TVM/MLIR/torch.compile)、Serverless 推理平台、性能调优检查清单、NCCL 集合通信与多卡推理、分布式推理与 GPU 集群调度、推理基准与压测、FlashAttention 与注意力内核、KV Cache 与 PagedAttention、MoE 稀疏专家推理、Prefill/Decode 分离与连续批处理、LLM 服务可观测性、推理安全防护、多模态推理与边缘端推理部署,覆盖从 GPU 编程到推理工程化全栈实践。

14 分钟阅读
AI 推理 GPU CUDA
ai

AI 工程化基础设施:特征平台、模型注册中心与推理流水线

AI 工程化的竞争已从算法创新转向基础设施效率。特征平台解决了训练-服务一致性问题,模型注册中心管控版本与审批,推理流水线实现从数据到预测的全链路自动化。本文深入讲解特征平台(Feast/Tecton)的设计原理、MLflow 模型注册与治理、以及 Kubeflow Pipelines 推理流水线的编排实践,帮助企业构建工业级 ML 基础设施。

8 分钟阅读
MLOps 特征平台 Feast
ai

多模态模型优化与部署:CLIP、Stable Diffusion 与视觉语言模型工程化

多模态 AI 正在重塑内容生成、视觉搜索和智能交互的边界。本文系统讲解多模态模型的核心架构(CLIP 对比学习、Diffusion 去噪、ViT 视觉编码),以及工程化部署中的关键挑战:跨模态对齐优化、扩散模型的 U-Net 加速、图像生成的分页缓存、批处理动态尺寸、以及从 PyTorch 到 TensorRT ONNX 的生产级转换实战。

8 分钟阅读
多模态 CLIP Stable Diffusion