GPU 共享与调度:MPS、MIG 与多租户隔离
GPU 昂贵且常常利用率不足,共享是必然选择。MPS 做进程级并发、MIG 做硬件级切分、时间片做抢占式复用,三者隔离强度与利用率各不相同。本文讲透 MPS、MIG 与时间片共享的原理差异、多租户隔离的边界,以及 Kubernetes 上的 GPU 调度实践与生产选型。
category
GPU 昂贵且常常利用率不足,共享是必然选择。MPS 做进程级并发、MIG 做硬件级切分、时间片做抢占式复用,三者隔离强度与利用率各不相同。本文讲透 MPS、MIG 与时间片共享的原理差异、多租户隔离的边界,以及 Kubernetes 上的 GPU 调度实践与生产选型。
GPU 供应紧张与成本压力让异构推理成为刚需:AMD ROCm、Intel Gaudi、国产 NPU 各有软件栈与适配路径。本文对比各家硬件与软件生态,讲透 CUDA 到 HIP 的迁移、oneAPI 与 CANN 的算子适配、推理框架的多后端支持,以及跨平台落地的真实踩坑经验。
系统提示词、few-shot 示例、RAG 上下文在每次请求里重复出现,prefill 一遍遍重算。前缀缓存复用 KV、语义缓存按语义命中答案,两者把重复计算压到接近零。本文讲透 RadixAttention 的块哈希复用、语义缓存的相似度匹配与正确性风险,以及分层缓存架构与命中率优化。
从 8K 到 128K 甚至百万级上下文,模型要跨越的远不止显存。RoPE 频率外推、位置插值(PI/NTK/YaRN)、Ring Attention 序列并行、KV Cache 显存三者缺一不可。本文讲透长上下文推理的位置编码扩展原理、注意力分块与序列并行,以及生产落地的显存与性能权衡。
一个基座模型要同时服务成百上千个微调变体,这是多租户 LLM 服务的核心挑战。S-LoRA 与 Punica 让不同适配器共享同一次批处理,把显存与吞吐同时优化。本文讲透 LoRA 推理的等效权重、多 LoRA 批处理内核、适配器动态切换与生产调度策略。
单卡放不下大模型时,训练必须走向多卡并行。DDP 解决吞吐、FSDP 与 ZeRO 解决显存,两者组合才能把千亿参数模型真正训起来。本文从显存账本讲起,拆解 DDP 的 AllReduce、ZeRO 三级切分、FSDP 的分片与通信重叠,并给出混合并行拓扑与生产调优清单。
预测模型回答会发生什么,因果推断回答改变什么会导致什么,本文系统讲解潜在结果框架与 ATE/ATT 的定义、混淆变量与碰撞点的识别、有向无环图 DAG 的建模与后门准则、随机对照试验与 A/B 测试的统计基础、倾向得分匹配与逆概率加权、双重稳健估计与双机器学习、工具变量与断点回归、双重差分与合成控制、因果森林与异质处理效应估计,以及因果方法在推荐系统与风控反欺诈中的落地与生产踩坑清单。
没有实验追踪的机器学习项目最终会退化成手工表格与凭记忆复现,本文系统讲解实验追踪的数据模型(Run/参数/指标/产物)、MLflow 的 Tracking 与 Model Registry 架构、W&B 的实时可视化与协作能力、指标与产物管理的工程规范、Optuna/Ray Tune 超参搜索与早停策略、模型注册的版本与阶段流转、可复现性的代码数据环境三要素、实验对比与统计显著性判断,以及与 CI/CD 流水线的集成与生产踩坑清单。
提示工程早已从拼凑咒语演化为系统化的上下文工程,本文系统讲解指令结构的角色任务约束三要素、few-shot 示例选择与格式一致性、思维链与自洽性投票、结构化输出与函数调用的约束解码、上下文工程的信息组织与位置效应、上下文压缩与提示缓存的经济性、检索增强中的提示设计、离线评测集与提示版本管理、提示注入防护与安全边界,以及生产落地中的常见踩坑清单。
强化学习让智能体在试错中学习决策,本文系统讲解马尔可夫决策过程与贝尔曼方程、价值迭代与策略迭代、时序差分与 Q-Learning、DQN 的神经网络近似与经验回放、策略梯度与 REINFORCE、Actor-Critic 与优势函数、PPO 的裁剪目标与信赖域思想、连续动作空间的 DDPG/SAC、奖励设计与稀疏奖励的解法,以及 RLHF 与 RLVR 在大模型对齐中的强化学习应用与训练稳定性工程实践。
语音是时序信号的典型代表,本文系统讲解语音信号的采样与分帧、梅尔频谱与 MFCC 声学特征、CTC 与注意力两种 ASR 建模范式、Conformer 架构与流式识别的分块机制、Whisper 的弱监督大规模预训练与多语言能力、TTS 的 Tacotron/FastSpeech 与神经声码器、说话人识别与语音克隆、WER/MOS/RTF 评测指标、以及流式管线的工程部署与生产踩坑清单。
图神经网络把深度学习从规则网格推广到任意拓扑结构,本文系统讲解消息传递范式的三个阶段与数学形式、GCN 的对称归一化传播推导、GraphSAGE 的邻居采样与归纳学习、GAT 的注意力加权聚合、过平滑的成因与残差跳跃缓解、大图训练的邻居采样与 GraphSAINT/Cluster-GCN、节点边图三类任务与图级读出、与 Neo4j 等图数据库的特征协同,以及生产落地中的数据泄漏与邻居爆炸踩坑。
LLM 推理服务的安全攻击面远超传统 API:提示注入、越狱、权重泄露与滥用。本文从攻击面出发,讲透输入输出过滤、鉴权配额、模型权重保护、沙箱降级与合规审计的纵深防御体系。
LLM 推理服务没有可观测性就像盲人开车:TTFT、TPOT、吞吐、token 计量、GPU 利用率、链路追踪与成本核算缺一不可。本文给出从指标定义到看板、压测、告警的完整方法论。
标准注意力的瓶颈不是算力而是显存 IO:中间矩阵 S、P 的写入读出把 HBM 带宽吃满。FlashAttention 用分块 + 重算 + online softmax 把 IO 从 O(N²) 降到 O(N),成为长上下文推理的基础设施。
MoE(混合专家)用稀疏激活换参数容量:推理时每个 token 只经过 Top-K 个专家。本文讲透 MoE 的推理特性——路由、负载均衡、专家并行、激活内存与显存策略,以及多机推理的性能与成本权衡。
Prefill 计算密集、Decode 带宽受限,两种阶段在同一个 GPU 上互相拖累。连续批处理与 Chunked Prefill 让请求动态进出批次,再进一步把 Prefill 与 Decode 物理分离,是吞吐与延迟平衡的完整方法论。
KV Cache 是自回归推理最大的显存开销来源,PagedAttention 用操作系统页式管理思想把显存复用做到极致,配合 KV 量化、剪枝与前缀共享,共同支撑长上下文推理。
欺诈、故障、医疗等场景天然类别极度不平衡,本文系统讲解类别不平衡的本质与度量(Imbalance Ratio/混淆矩阵/PR-AUC)、重采样方法(SMOTE 及变体/欠采样/集成采样)、代价敏感学习与 Focal Loss、异常检测的统计方法(Z-score/隔离森林/单类 SVM/深度方法)、半监督与标签稀缺、以及生产评估(Precision-Recall 优先、阈值调优、误报成本)的完整方法论。
Embedding 是语义检索与 RAG 的地基,本文系统讲解对比学习原理(正负样本/InfoNCE 损失/温度系数)、双塔模型与 Sentence-Transformer 架构、Embedding 训练数据构造(难负样本/硬负样本挖掘/蒸馏)、相似度计算与归一化(余弦/点积/内积+缩放)、向量索引与量化、维度与多模态对齐、以及生产调优(批次内负样本/温度/距离度量)的完整方法论。