posts

LLMOps 大模型服务化与推理优化

把大模型从 Demo 推到生产,难点不在调用 API,而在吞吐、延迟、显存与成本之间的取舍。本专题覆盖 LLMOps 的完整工程链路:LLMOps 全景与生产化挑战、vLLM / TensorRT-LLM / SGLang 推理引擎对比、连续批处理与 PagedAttention 显存管理原理、GPTQ/AWQ/FP8 量化与显存优化、KV Cache 与前缀缓存复用、Kubernetes 上的推理服务部署与弹性伸缩、模型网关与多模型路由、Prompt 版本管理与 A/B 实验、RAG 检索服务工程化、Agent 服务的可观测性与链路追踪、Token 成本核算与 FinOps,以及模型评测与灰度发布。后续补充的 6 篇进阶内容进一步覆盖 LoRA 与 QLoRA 微调流水线、向量数据库与检索索引选型、提示注入防护与护栏、多智能体编排、结构化输出与函数调用,以及语义缓存与 Prompt 缓存。

把大模型从 Demo 推到生产,难点不在调用 API,而在吞吐、延迟、显存与成本之间的取舍。本专题覆盖 LLMOps 的完整工程链路:LLMOps 全景与生产化挑战、vLLM / TensorRT-LLM / SGLang 推理引擎对比、连续批处理与 PagedAttention 显存管理原理、GPTQ/AWQ/FP8 量化与显存优化、KV Cache 与前缀缓存复用、Kubernetes 上的推理服务部署与弹性伸缩、模型网关与多模型路由、Prompt 版本管理与 A/B 实验、RAG 检索服务工程化、Agent 服务的可观测性与链路追踪、Token 成本核算与 FinOps,以及模型评测与灰度发布。


📚 专题导览

本专题共 18 篇,前 12 篇按「概览 → 引擎 → 优化 → 部署 → 网关 → 实验 → 应用 → 可观测 → 成本 → 质量」的顺序组织,后 6 篇为补充进阶内容(微调 → 检索 → 安全 → 编排 → 结构化 → 缓存),建议按表序通读:

阶段文章技术要点
概览LLMOps 全景与生产化挑战LLMOps 与 MLOps 的差异、生产化五大挑战、能力矩阵与技术选型
引擎大模型推理引擎对比 vLLM / TensorRT-LLM / SGLangvLLM / TensorRT-LLM / SGLang 架构对比、吞吐与延迟基准、选型决策
引擎连续批处理与 PagedAttention 原理Continuous Batching 调度、PagedAttention 分页显存与碎片治理
优化模型量化与显存优化GPTQ/AWQ/FP8 量化原理、精度与显存权衡、量化后评测
优化KV Cache 管理与前缀缓存KV Cache 显存占用估算、Prefix Caching 与多轮对话复用
部署推理服务的 Kubernetes 部署与弹性伸缩GPU 节点池、HPA/KEDA 指标扩缩、就绪探针与冷启动治理
网关模型网关与多模型路由LiteLLM 类网关、多模型路由与降级、限流配额与密钥托管
实验Prompt 版本管理与 A/B 实验Prompt 版本管理、实验分流与统计显著性、回归防护
应用RAG 检索服务的工程化切分与嵌入、召回与重排、索引更新与检索质量评估
可观测Agent 服务的可观测性与链路追踪OpenTelemetry 链路追踪、Token 与工具调用埋点、失败归因
成本推理成本核算与 FinOpsToken 成本核算、缓存与批处理降本、预算告警与容量规划
质量模型评测与灰度发布离线评测集与 LLM-as-judge、灰度发布、回滚与线上监控
微调大模型微调流水线:LoRA 与 QLoRALoRA 低秩分解与秩/alpha 选择、QLoRA 4bit、训练框架、显存估算与权重合并
检索向量数据库与检索索引选型HNSW/IVF-PQ 索引权衡、向量库选型、分块与元数据过滤、混合检索与重排
安全LLM 护栏与提示注入防护直接与间接提示注入、输入输出审查、越狱检测、PII 脱敏与多层防御
编排多智能体编排与工作流引擎多 Agent 取舍、图式编排与检查点、子 Agent 委派、共享记忆与人机协同
结构化结构化输出与函数调用JSON Schema 严格模式、约束解码、并行工具调用、校验重试与幂等集成
缓存语义缓存与 Prompt 缓存语义缓存阈值与误命中、Prompt 前缀缓存机制、缓存键与失效、成本测算

阅读建议

全部文章 Game Golang Saas Rust 游戏开发 客户端开发 GameDev TypeScript Lua Products
LLMOps

语义缓存与 Prompt 缓存

缓存是少数能同时降成本与降延迟的手段,但它也是最容易「省了钱却丢了用户」的优化。本文区分精确缓存与语义缓存、讲清嵌入相似度阈值的设定与误命中防护,深入 Prompt Caching 与 KV Cache 前缀复用的计费与命中机制,给出缓存键设计、失效策略、多租户隔离与命中率成本测算,附可运行的阈值调参与命中率统计代码。

14 分钟阅读
缓存 语义缓存 前缀缓存
LLMOps

多智能体编排与工作流引擎

多智能体不是把多个 Agent 拼起来就完事,编排结构决定了系统的可控性、成本与可调试性。本文对比单体 Agent 与多 Agent 的取舍,拆解 ReAct、Plan-Execute、Reflexion 三种范式,深入 LangGraph 的状态、检查点与图式编排,给出子 Agent 委派、共享记忆、失败重试、人机协同与成本控制的工程方案,附可运行的状态图代码。

13 分钟阅读
agent 编排 LangGraph
LLMOps

LLM 护栏与提示注入防护

提示注入是 LLM 应用唯一无法靠模型自身根治的漏洞,因为它攻击的是模型的指令遵循能力本身。本文给出可落地的纵深防御:直接与间接注入的攻击面拆解、输入分隔与检测、系统提示词泄露的 canary 方案、输出审查与 PII 脱敏、工具调用白名单与参数校验、越狱分类器,以及红队测试用例设计与护栏的性能成本核算。

14 分钟阅读
安全 提示注入 护栏
LLMOps

模型评测与灰度发布

本文解决模型、提示、推理引擎三类变更缺乏统一发布流程的问题:建立离线评测(golden set、LLM-as-Judge、回归门禁)与在线评测(A/B、shadow、canary)闭环,给出 shadow 到 1%、5%、25%、50%、100% 的六阶段灰度流程,明确每阶段流量比例、观测时长、门禁指标与回滚阈值,并给出可运行的 Python 门禁判定脚本、canary YAML 与自动回滚条件。

14 分钟阅读
evaluation canary rollout
LLMOps

推理成本核算与 FinOps

本文解决 LLM 服务账单不可解释的问题:拆解 GPU 小时、token、存储、网络、向量库五类成本的计费口径与占比,给出自建与 API 的盈亏平衡计算方法与真实价格表,建立每千次请求成本、每用户成本、毛利率等单位经济指标。文中给出按团队、应用、租户打标签的归因方案,梳理量化、批处理、前缀缓存、路由、right-sizing 五类降本手段的降幅与风险,附可运行的 Python 核算脚本与常见坑。

15 分钟阅读
finops cost gpu
LLMOps

Agent 服务的可观测性与链路追踪

本文解决 Agent 上线后黑盒不可诊断的问题:讲清 Agent 与单次 LLM 调用在多步循环、工具调用上的可观测差异,给出 OpenTelemetry GenAI 语义约定的 span 层级与属性清单,并落地 Langfuse 与 OpenLLMetry 接入代码。文中给出每会话步数、工具成功率、P95 延迟等指标口径与阈值,并列出把 span 打爆、敏感内容入库、异步丢 trace 等坑。

12 分钟阅读
agent observability opentelemetry
LLMOps

RAG 检索服务的工程化

RAG 的演示版本几十行代码就能跑通,生产版本却要在召回率、延迟与成本之间反复权衡。本文把 RAG 当作检索服务来工程化:拆解切分、embedding、向量检索、混合检索、reranker 精排、上下文拼装与生成七个环节,给出分块参数、embedding 维度选型、HNSW 参数调优与 bge-reranker-v2-m3 的延迟收益量化,附可运行的混合检索加精排 Python 代码与常见坑清单。

13 分钟阅读
RAG 检索增强 向量检索
LLMOps

Prompt 版本管理与 A/B 实验

当 Prompt 还以字符串形式散落在业务代码里时,改一句话就可能悄无声息地毁掉线上效果。本文把 Prompt 当作一等工程资产:给出 prompt registry 的模板与变量 schema 设计、按 user_id 稳定哈希的 A/B 分桶方案、p 值与置信区间驱动的显著性判定、最小可检测效应与样本量估算,以及灰度发布与自动回滚机制,并附可直接运行的 Python 代码与常见坑清单。

12 分钟阅读
Prompt 工程 A/B 实验 版本管理
LLMOps

模型网关与多模型路由

当业务从调用单一模型演进到同时使用十余个模型时,散落在各服务里的 API Key、限流与重试逻辑会迅速失控。本文以 LiteLLM Proxy 为核心给出模型网关落地方案:统一 OpenAI 兼容接口、密钥托管、限流配额与审计,详解成本优先、延迟优先、质量优先、加权路由与 fallback 熔断五类策略,并给出语义路由与 token 预算的可运行代码,最后量化路由带来的成本与延迟收益并总结常见坑。

11 分钟阅读
LLM 网关 模型路由 LiteLLM
LLMOps

连续批处理与 PagedAttention 原理

本文深入讲解大模型推理的两项核心优化。先讲清静态批处理、动态批处理到连续批处理的演进与显存吞吐差异,再剖析 PagedAttention 如何把 KV Cache 切分为固定大小 block 并用 block table 建立逻辑到物理映射,使显存碎片从 60% 到 80% 的浪费降到 4% 以内。文中给出 vLLM 实测吞吐与一段可运行的连续批处理调度模拟代码。

13 分钟阅读
vLLM PagedAttention 连续批处理
LLMOps

LLMOps 全景与生产化挑战

本文系统梳理 LLMOps 全景与生产化落地难点。从与 MLOps 的本质差异(提示与模型漂移、非确定性输出、评测困难)讲起,拆解 LLM 应用从数据提示、评测、部署、监控到反馈闭环的生命周期,归纳成本、延迟、质量、安全、可观测五大挑战,给出 L1 到 L4 成熟度模型与工具栈全景表,并提供一段可运行的 LLMOps 健康度检查脚本。

14 分钟阅读
LLMOps MLOps vLLM