category

Ai

共 63 篇文章。
全部文章GameGolangSaasRust游戏开发客户端开发GameDevProductsLua写作小说IndieFrontendPrd
ai

MLOps 治理与可复现:模型注册、漂移监控与合规

模型上线不是终点,本文系统讲解模型注册表(版本/元数据/审批/回滚)、实验跟踪与可复现(数据集-代码-超参锁定)、数据漂移与概念漂移检测(PSI/KS/统计检验/无监督检测)、模型漂移监控与告警、金丝雀发布与灰度回滚、以及 AI 合规治理(模型卡/审计/偏见评估)的完整工程方法论。

6 分钟阅读
MLOps 模型注册 模型漂移
ai

数据工程进阶:标注体系、合成数据与数据飞轮

模型上限由数据决定,本文系统讲解标注任务设计(分类/抽取/对齐/评测)、标注质量保障(一致性/争议裁决/抽样复核)、主动学习与弱监督、合成数据生成(LLM 蒸馏/自我修正/场景合成)、数据飞轮的闭环设计(线上反馈回流/困难样本挖掘)、以及数据治理与合规的完整工程方法论。

5 分钟阅读
数据标注 合成数据 数据飞轮
ai

LLM 推理优化全栈指南:从 KV Cache 到投机解码

大模型部署的成本与延迟由推理优化决定,本文系统讲解自回归生成的内存瓶颈、KV Cache 原理与显存计算公式、PagedAttention 与连续批处理、GPTQ/AWQ/INT8 权重量化、投机解码与并行生成、前缀缓存与 Prompt 优化、TTFT/TPOT/ITL 指标,以及 vLLM/TensorRT-LLM/llama.cpp 框架选型与生产容量规划的完整方法论。

8 分钟阅读
LLM推理 KV Cache PagedAttention
ai

NCCL 集合通信:AllReduce、Ring 算法与多卡推理的通信优化

多卡推理的吞吐天花板往往不在算力,而在 GPU 之间的通信。NCCL 是 NVIDIA 的集合通信库:AllReduce/AllGather/Reduce-Scatter 原语、Ring 与 Tree 算法、NVLink/RDMA 互连、拓扑感知与超节点。本文把 NCCL 讲透:通信原语怎么选、算法怎么收敛、拓扑怎么感知,以及多卡推理(张量并行)的通信优化实战。

12 分钟阅读
NCCL AllReduce Ring
ai

LLM 推理性能调优实战:从瓶颈定位到端到端优化的检查清单

LLM 推理的性能问题往往不是单一原因,而是一连串「小瓶颈」叠加。本文给出一份实战调优检查清单:先量化目标(吞吐/延迟/成本),再逐层定位瓶颈(显存/计算/带宽/调度),然后按优先级实施优化(解码策略/前缀缓存/融合/量化/批调度),最后用基准测试验证——从定位到优化的完整闭环。

11 分钟阅读
性能调优 瓶颈定位 吞吐
ai

Serverless 推理:无服务器 LLM 推理、冷启动优化与 GPU 弹性

Serverless 推理把「模型部署」变成「按调用计费的 API」:无 GPU 预置、按需拉起、闲置自动回收。本文系统讲解 Serverless 推理的架构、冷启动的瓶颈与优化(模型缓存/容器预热/两阶段拉起)、GPU 弹性的调度(实例池/水位线/碎片整理)、与常驻推理的选型,以及生产落地的成本账与稳定性。

11 分钟阅读
Serverless 冷启动 GPU 弹性
ai

时序预测实战:从 ARIMA 到时序基础模型

时序预测是销量、流量、运维与金融风控的核心能力,方法栈从经典统计到深度学习不断演进。本文系统讲解时序预测实战全链路:经典统计方法(ARIMA/ETS)、分解与平稳性检验、机器学习方法(LightGBM/XGBoost 特征工程)、深度方法(LSTM/TCN/Transformer/时序基础模型)、多步与滚动预测策略、评估指标(MSE/MAPE/Pinball),以及在线推理与生产部署的完整案例。

12 分钟阅读
时序预测 ARIMA ETS
ai

模型压缩:量化、剪枝、蒸馏与部署优化实战

模型压缩让大模型在有限显存与延迟预算下可用,是边缘部署与降本增效的关键。本文系统讲解模型压缩四大技术:量化(PTQ/QAT/INT8/INT4/FP16)、剪枝(结构化/非结构化)、知识蒸馏(logits/特征/教师学生)、低秩分解,并结合 ONNX/TensorRT/TVM 部署优化、显存与吞吐权衡、精度保持评估方法,以及 LLM 量化与边缘部署的实战案例。

11 分钟阅读
模型压缩 量化 INT8
ai

量化感知训练(QAT)与量化微调:伪量化、STE 与 QLoRA 实战

训练后量化(PTQ)在精度敏感场景常常失手,量化感知训练(QAT)则让模型在训练阶段就『学会』适应量化噪声,是工业界把 INT8 精度损失压到 1% 以内的关键手段。本文从伪量化算子与直通估计器(STE)讲起,给出 QAT 完整流程,讲解蒸馏+量化组合,并深入 LoRA 量化微调(QLoRA)与工业实践。一、QAT 背景与动机

8 分钟阅读
QAT 量化 模型压缩
ai

模型评估与基准:从分类指标到 LLM-as-Judge

模型评估是机器学习工程中最容易被低估的环节,指标选错会让整个迭代方向出错。本文系统讲解评估体系:分类指标(准确率/精确率/召回/F1/AUC-ROC)、回归与概率校准(Brier/ECE)、生成式评估(BLEU/ROUGE/人工/LLM-as-Judge)、评测集构建(Golden set/对抗样本)、离线与在线评估(A/B 测试/影子部署)、模型卡与基准报告,以及持续评估流程中的常见陷阱。

10 分钟阅读
模型评估 指标 AUC
ai

边缘端推理部署:TFLite、ONNX Mobile 与 NPU 异构加速实践

当推理发生在手机、摄像头、车载设备上,约束从『算得快』变成『在有限功耗和内存内算得好』。本文聚焦边缘端推理:对比 TFLite / ONNX Runtime Mobile / ExecuTorch / OpenVINO 等移动框架,讲解 Qualcomm 与 Apple NPU 的异构调度,给出端侧量化与模型压缩的组合拳,并拆解目标检测、端侧 LLM、语音助手三类典型应用。一、边缘推理的约束

9 分钟阅读
边缘推理 移动端 NPU
ai

向量数据库选型与检索优化:从 ANN 索引到生产运维

向量数据库是 RAG、语义搜索与推荐系统的核心基础设施,选型与调优直接决定召回率、延迟与成本。本文系统讲解向量检索原理与 ANN 算法(HNSW/IVF/PQ)、Milvus/Qdrant/Pinecone/pgvector/Weaviate 等主流方案对比、索引与量化参数调优、标量向量混合过滤、Embedding 模型选型、召回率与延迟权衡、容量规划与生产运维的完整方法论。

9 分钟阅读
向量数据库 向量检索 HNSW
ai

推理基准与压测:TTFT、ITL、TPOT 指标与容量规划实战

『我的推理服务到底能扛多大流量?』『加一张卡值不值?』『P99 为什么这么差?』这些问题都需要一套科学的基准测试方法。本文讲解 LLM 推理的核心性能指标 TTFT / ITL / TPOT,分析延迟与吞吐曲线,演示 LLM Perf 与 Locust 两类压测工具,最后给出容量规划与成本建模的完整方法。一、推理性能指标体系

8 分钟阅读
基准测试 压测 LLM
ai

大模型高效微调:从全参微调到 LoRA/QLoRA 与 DPO

全参数微调大语言模型在显存、数据与工程成本上都不现实,参数高效微调(PEFT)成为主流选择。本文系统讲解微调技术全景:全参微调的局限、LoRA 低秩分解原理与实现、QLoRA 的 4bit 量化与嵌套量化、Adapter 与 Prefix Tuning、微调数据构造与合成、训练超参配置、评测与过拟合防护,以及 SFT 与 DPO 两条对齐路线的工程实践对比。

10 分钟阅读
微调 LoRA QLoRA
ai

算子融合与 Kernel 优化:从 CUDA Graph 到 FlashAttention 的极致性能

在 GPU 推理中,最贵的往往不是计算,而是数据搬运:每一个算子都要把中间结果写回显存、再读出来,内存带宽成为瓶颈。算子融合就是把多个算子合并成一个 kernel,减少显存往返,是 TensorRT、vLLM、PyTorch 编译器都在做的事。本文从融合原理讲起,拆解 FlashAttention 类融合,再到 CUDA Graph 与自定义 kernel 开发流程。一、为什么需要算子融合

8 分钟阅读
Kernel 优化 CUDA 算子融合
ai

RAG 架构全景:从检索增强生成到 Agentic RAG 的生产实践

RAG(检索增强生成)已成为大语言模型接入私有知识库的主流范式,但朴素 RAG 在召回率、相关性排序与评估层面存在系统性短板。本文系统讲解 RAG 架构全景:文档切分与索引策略、查询路由与改写、混合检索(稀疏+密集+BM25)、Cross-Encoder Reranker 重排序、生成阶段上下文组装,以及基于 RAGAS 的评估体系与 Agentic RAG 的生产调优。

11 分钟阅读
RAG LLM 检索增强生成