把大模型从 Demo 推到生产,难点不在调用 API,而在吞吐、延迟、显存与成本之间的取舍。本专题覆盖 LLMOps 的完整工程链路:LLMOps 全景与生产化挑战、vLLM / TensorRT-LLM / SGLang 推理引擎对比、连续批处理与 PagedAttention 显存管理原理、GPTQ/AWQ/FP8 量化与显存优化、KV Cache 与前缀缓存复用、Kubernetes 上的推理服务部署与弹性伸缩、模型网关与多模型路由、Prompt 版本管理与 A/B 实验、RAG 检索服务工程化、Agent 服务的可观测性与链路追踪、Token 成本核算与 FinOps,以及模型评测与灰度发布。
📚 专题导览
本专题共 18 篇,前 12 篇按「概览 → 引擎 → 优化 → 部署 → 网关 → 实验 → 应用 → 可观测 → 成本 → 质量」的顺序组织,后 6 篇为补充进阶内容(微调 → 检索 → 安全 → 编排 → 结构化 → 缓存),建议按表序通读:
| 阶段 | 文章 | 技术要点 |
|---|---|---|
| 概览 | LLMOps 全景与生产化挑战 | LLMOps 与 MLOps 的差异、生产化五大挑战、能力矩阵与技术选型 |
| 引擎 | 大模型推理引擎对比 vLLM / TensorRT-LLM / SGLang | vLLM / TensorRT-LLM / SGLang 架构对比、吞吐与延迟基准、选型决策 |
| 引擎 | 连续批处理与 PagedAttention 原理 | Continuous Batching 调度、PagedAttention 分页显存与碎片治理 |
| 优化 | 模型量化与显存优化 | GPTQ/AWQ/FP8 量化原理、精度与显存权衡、量化后评测 |
| 优化 | KV Cache 管理与前缀缓存 | KV Cache 显存占用估算、Prefix Caching 与多轮对话复用 |
| 部署 | 推理服务的 Kubernetes 部署与弹性伸缩 | GPU 节点池、HPA/KEDA 指标扩缩、就绪探针与冷启动治理 |
| 网关 | 模型网关与多模型路由 | LiteLLM 类网关、多模型路由与降级、限流配额与密钥托管 |
| 实验 | Prompt 版本管理与 A/B 实验 | Prompt 版本管理、实验分流与统计显著性、回归防护 |
| 应用 | RAG 检索服务的工程化 | 切分与嵌入、召回与重排、索引更新与检索质量评估 |
| 可观测 | Agent 服务的可观测性与链路追踪 | OpenTelemetry 链路追踪、Token 与工具调用埋点、失败归因 |
| 成本 | 推理成本核算与 FinOps | Token 成本核算、缓存与批处理降本、预算告警与容量规划 |
| 质量 | 模型评测与灰度发布 | 离线评测集与 LLM-as-judge、灰度发布、回滚与线上监控 |
| 微调 | 大模型微调流水线:LoRA 与 QLoRA | LoRA 低秩分解与秩/alpha 选择、QLoRA 4bit、训练框架、显存估算与权重合并 |
| 检索 | 向量数据库与检索索引选型 | HNSW/IVF-PQ 索引权衡、向量库选型、分块与元数据过滤、混合检索与重排 |
| 安全 | LLM 护栏与提示注入防护 | 直接与间接提示注入、输入输出审查、越狱检测、PII 脱敏与多层防御 |
| 编排 | 多智能体编排与工作流引擎 | 多 Agent 取舍、图式编排与检查点、子 Agent 委派、共享记忆与人机协同 |
| 结构化 | 结构化输出与函数调用 | JSON Schema 严格模式、约束解码、并行工具调用、校验重试与幂等集成 |
| 缓存 | 语义缓存与 Prompt 缓存 | 语义缓存阈值与误命中、Prompt 前缀缓存机制、缓存键与失效、成本测算 |