category

LLMOps

共 19 篇文章。
全部文章GameGolangSaasRust游戏开发客户端开发GameDevTypeScriptLuaProducts写作小说IndieDatabase
LLMOps

语义缓存与 Prompt 缓存

缓存是少数能同时降成本与降延迟的手段,但它也是最容易「省了钱却丢了用户」的优化。本文区分精确缓存与语义缓存、讲清嵌入相似度阈值的设定与误命中防护,深入 Prompt Caching 与 KV Cache 前缀复用的计费与命中机制,给出缓存键设计、失效策略、多租户隔离与命中率成本测算,附可运行的阈值调参与命中率统计代码。

14 分钟阅读
缓存 语义缓存 前缀缓存
LLMOps

多智能体编排与工作流引擎

多智能体不是把多个 Agent 拼起来就完事,编排结构决定了系统的可控性、成本与可调试性。本文对比单体 Agent 与多 Agent 的取舍,拆解 ReAct、Plan-Execute、Reflexion 三种范式,深入 LangGraph 的状态、检查点与图式编排,给出子 Agent 委派、共享记忆、失败重试、人机协同与成本控制的工程方案,附可运行的状态图代码。

13 分钟阅读
agent 编排 LangGraph
LLMOps

LLM 护栏与提示注入防护

提示注入是 LLM 应用唯一无法靠模型自身根治的漏洞,因为它攻击的是模型的指令遵循能力本身。本文给出可落地的纵深防御:直接与间接注入的攻击面拆解、输入分隔与检测、系统提示词泄露的 canary 方案、输出审查与 PII 脱敏、工具调用白名单与参数校验、越狱分类器,以及红队测试用例设计与护栏的性能成本核算。

14 分钟阅读
安全 提示注入 护栏
LLMOps

模型评测与灰度发布

本文解决模型、提示、推理引擎三类变更缺乏统一发布流程的问题:建立离线评测(golden set、LLM-as-Judge、回归门禁)与在线评测(A/B、shadow、canary)闭环,给出 shadow 到 1%、5%、25%、50%、100% 的六阶段灰度流程,明确每阶段流量比例、观测时长、门禁指标与回滚阈值,并给出可运行的 Python 门禁判定脚本、canary YAML 与自动回滚条件。

14 分钟阅读
evaluation canary rollout
LLMOps

推理成本核算与 FinOps

本文解决 LLM 服务账单不可解释的问题:拆解 GPU 小时、token、存储、网络、向量库五类成本的计费口径与占比,给出自建与 API 的盈亏平衡计算方法与真实价格表,建立每千次请求成本、每用户成本、毛利率等单位经济指标。文中给出按团队、应用、租户打标签的归因方案,梳理量化、批处理、前缀缓存、路由、right-sizing 五类降本手段的降幅与风险,附可运行的 Python 核算脚本与常见坑。

15 分钟阅读
finops cost gpu
LLMOps

Agent 服务的可观测性与链路追踪

本文解决 Agent 上线后黑盒不可诊断的问题:讲清 Agent 与单次 LLM 调用在多步循环、工具调用上的可观测差异,给出 OpenTelemetry GenAI 语义约定的 span 层级与属性清单,并落地 Langfuse 与 OpenLLMetry 接入代码。文中给出每会话步数、工具成功率、P95 延迟等指标口径与阈值,并列出把 span 打爆、敏感内容入库、异步丢 trace 等坑。

12 分钟阅读
agent observability opentelemetry
LLMOps

RAG 检索服务的工程化

RAG 的演示版本几十行代码就能跑通,生产版本却要在召回率、延迟与成本之间反复权衡。本文把 RAG 当作检索服务来工程化:拆解切分、embedding、向量检索、混合检索、reranker 精排、上下文拼装与生成七个环节,给出分块参数、embedding 维度选型、HNSW 参数调优与 bge-reranker-v2-m3 的延迟收益量化,附可运行的混合检索加精排 Python 代码与常见坑清单。

13 分钟阅读
RAG 检索增强 向量检索
LLMOps

Prompt 版本管理与 A/B 实验

当 Prompt 还以字符串形式散落在业务代码里时,改一句话就可能悄无声息地毁掉线上效果。本文把 Prompt 当作一等工程资产:给出 prompt registry 的模板与变量 schema 设计、按 user_id 稳定哈希的 A/B 分桶方案、p 值与置信区间驱动的显著性判定、最小可检测效应与样本量估算,以及灰度发布与自动回滚机制,并附可直接运行的 Python 代码与常见坑清单。

12 分钟阅读
Prompt 工程 A/B 实验 版本管理
LLMOps

模型网关与多模型路由

当业务从调用单一模型演进到同时使用十余个模型时,散落在各服务里的 API Key、限流与重试逻辑会迅速失控。本文以 LiteLLM Proxy 为核心给出模型网关落地方案:统一 OpenAI 兼容接口、密钥托管、限流配额与审计,详解成本优先、延迟优先、质量优先、加权路由与 fallback 熔断五类策略,并给出语义路由与 token 预算的可运行代码,最后量化路由带来的成本与延迟收益并总结常见坑。

11 分钟阅读
LLM 网关 模型路由 LiteLLM
LLMOps

连续批处理与 PagedAttention 原理

本文深入讲解大模型推理的两项核心优化。先讲清静态批处理、动态批处理到连续批处理的演进与显存吞吐差异,再剖析 PagedAttention 如何把 KV Cache 切分为固定大小 block 并用 block table 建立逻辑到物理映射,使显存碎片从 60% 到 80% 的浪费降到 4% 以内。文中给出 vLLM 实测吞吐与一段可运行的连续批处理调度模拟代码。

13 分钟阅读
vLLM PagedAttention 连续批处理
LLMOps

LLMOps 全景与生产化挑战

本文系统梳理 LLMOps 全景与生产化落地难点。从与 MLOps 的本质差异(提示与模型漂移、非确定性输出、评测困难)讲起,拆解 LLM 应用从数据提示、评测、部署、监控到反馈闭环的生命周期,归纳成本、延迟、质量、安全、可观测五大挑战,给出 L1 到 L4 成熟度模型与工具栈全景表,并提供一段可运行的 LLMOps 健康度检查脚本。

14 分钟阅读
LLMOps MLOps vLLM
LLMOps

LLMOps 大模型服务化与推理优化

把大模型从 Demo 推到生产,难点不在调用 API,而在吞吐、延迟、显存与成本之间的取舍。本专题覆盖 LLMOps 的完整工程链路:LLMOps 全景与生产化挑战、vLLM / TensorRT-LLM / SGLang 推理引擎对比、连续批处理与 PagedAttention 显存管理原理、GPTQ/AWQ/FP8 量化与显存优化、KV Cache 与前缀缓存复用、Kubernetes 上的推理服务部署与弹性伸缩、模型网关与多模型路由、Prompt 版本管理与 A/B 实验、RAG 检索服务工程化、Agent 服务的可观测性与链路追踪、Token 成本核算与 FinOps,以及模型评测与灰度发布。后续补充的 6 篇进阶内容进一步覆盖 LoRA 与 QLoRA 微调流水线、向量数据库与检索索引选型、提示注入防护与护栏、多智能体编排、结构化输出与函数调用,以及语义缓存与 Prompt 缓存。

3 分钟阅读
LLMOps 大模型 推理优化