检测与分割的评估指标
本文系统讲解检测与分割的评估指标,回答 mAP 到底怎么算、COCO 与 VOC 口径差在哪、mIoU 为什么会被少数类拖垮等实战问题。覆盖 IoU 与匹配规则、PR 曲线与插值方式、AP50 与 AP75 与 mAP@[.5:.95]、分割的 mIoU 与 Dice 与像素准确率、类别不平衡下的指标选择、阈值与 NMS 的影响、以及离线指标与线上效果的差距,并给出两段可运行指标代码。
category
本文系统讲解检测与分割的评估指标,回答 mAP 到底怎么算、COCO 与 VOC 口径差在哪、mIoU 为什么会被少数类拖垮等实战问题。覆盖 IoU 与匹配规则、PR 曲线与插值方式、AP50 与 AP75 与 mAP@[.5:.95]、分割的 mIoU 与 Dice 与像素准确率、类别不平衡下的指标选择、阈值与 NMS 的影响、以及离线指标与线上效果的差距,并给出两段可运行指标代码。
本文系统讲解多模态视觉语言模型的工程落地,回答 CLIP 与 VLM 怎么分工、视觉 token 怎么压缩、多模态 RAG 怎么搭等实战问题。覆盖视觉编码器与投影层结构、对比学习对齐、指令微调数据构造、视觉问答、多模态检索增强、幻觉成因与缓解、评估基准、以及显存与吞吐估算,并给出 CLIP 检索与显存估算两段可运行代码。
本文系统讲解 3D 视觉中的点云与深度估计,回答单目与双目深度怎么选、点云怎么体素化、ICP 配准为什么不收敛等实战问题。覆盖单目与双目与结构光与 ToF 原理、点云数据结构与体素化、PointNet 与 3D 检测、ICP 与特征配准、NeRF 与 3D Gaussian Splatting 概览、坐标系约定与自动驾驶多传感器融合,并给出深度转点云与 ICP 两段可运行代码。
本文系统讲解视频理解与多目标跟踪,回答 SORT 与 ByteTrack 怎么选、遮挡下 ID Switch 怎么降、视频动作识别怎么建模等实战问题。覆盖检测跟踪范式、卡尔曼滤波与数据关联、匈牙利算法、ByteTrack 低分框利用、3D CNN 与时序 Transformer 动作识别、采样策略、MOTA 与 IDF1 指标,并给出卡尔曼加匈牙利匹配与跟踪评估两段可运行代码。
本文系统讲解人脸识别与活体检测,回答 ArcFace 与 CosFace 怎么选、比对阈值怎么定、RGB 与红外活体如何分工等实战问题。覆盖人脸检测与关键点对齐、度量学习与嵌入归一化、误识率与阈值标定、人脸库向量索引、打印与屏幕翻拍等攻击类型、模型偏见与隐私合规,并给出余弦比对与质量评估两段可运行代码。
本文系统讲解 OCR 与文档理解,回答检测与识别怎么串、PaddleOCR 与 Tesseract 怎么选、版面与表格怎么结构化等实战问题。覆盖 DBNet 可微二值化、CRNN 与 CTC 解码、倾斜矫正与低质量增强、中文多语言难点、表格识别、评估指标与后处理纠错,并给出 PaddleOCR 推理与 CTC 解码两段可运行代码。
本文系统讲解视觉模型的服务化与推理加速,回答 Triton 与 TorchServe 与 FastAPI 怎么选、动态批处理怎么配、吞吐与延迟如何权衡等实战问题。覆盖动态批处理、并发实例、CUDA stream、TensorRT 与 ONNX Runtime 加速、P50 与 P99 压测方法,并给出 FastAPI 批处理服务与并发压测两段可运行代码,附方案对比表、加速收益表、权衡与常见坑。
本文系统讲解视觉模型压缩与端侧部署,回答 PTQ 与 QAT 怎么选、剪枝后要不要重训、蒸馏怎么落地、ONNX Runtime 与 TensorRT 与 NCNN 各自适合什么设备等实战问题。覆盖 int8 量化与校准、结构化与非结构化剪枝、logit 与特征蒸馏、主流端侧运行时,并给出 ONNX Runtime 量化对比与动态量化两段可运行代码,附框架对比表、精度与延迟影响表、权衡与常见坑。
本文系统讲解视觉模型训练与迁移学习,回答冻结多少层、学习率怎么设、数据增强用哪些、混合精度怎么开等实战问题。覆盖损失函数、SGD 与 AdamW、余弦退火与 warmup、RandAugment 与 MixUp、特征提取与逐层解冻、AMP 与梯度累积、过拟合诊断与正则,并给出微调 ResNet18 与分层学习率两段可运行 PyTorch 代码,附策略对比表、权衡与常见坑。
本文系统讲解数据标注与数据集工程,回答 VOC、COCO、YOLO 三种标注格式怎么选、标注一致性如何度量、数据泄漏如何避免、半自动标注怎么落地等实战问题。覆盖主流数据集规模、标注工具、标注类型、一致性计算、数据划分与防泄漏、SAM 预标注与主动学习、合成数据与域差距,并给出 COCO 统计与 VOC 转 COCO 两段可运行代码,附格式对比表、权衡与常见坑。
本文系统讲解视觉 Transformer 与多模态模型,回答 ViT 为什么需要大数据预训练、Swin 的窗口注意力解决什么、CLIP 的零样本分类怎么用等实战问题。覆盖自注意力复杂度、patch embedding、位置编码、DeiT、Swin、ConvNeXt 与图文多模态,并给出 timm 推理与 CLIP 零样本分类两段可运行代码,附模型对比表、权衡与常见坑。
本文系统讲解姿态估计与关键点检测,回答自顶向下与自底向上怎么选、热图回归与坐标回归有何差别、HRNet 与 MediaPipe 各自适合什么场景等实战问题。覆盖人体、手、人脸关键点,PAF 与 Associative Embedding、OKS 与 PCK 指标、2D 与 3D 姿态,并给出 MediaPipe 姿态估计与热图峰值提取两段可运行代码,附模型对比表、权衡与常见坑。
本文系统讲解图像分割与实例分割,回答语义、实例、全景分割有什么区别、U-Net 与 DeepLabv3+ 怎么选、Mask R-CNN 的 ROIAlign 解决什么问题、SAM 何时值得用等实战问题。覆盖 FCN、U-Net 跳连、空洞卷积与 ASPP、ROIAlign、SOLO 与 SAM,并给出 DeepLabv3 推理与 IoU/Dice 计算两段可运行代码,附模型对比表、权衡与常见坑。
本文系统讲解目标检测与 YOLO 系列的工程落地,回答 anchor 与 anchor-free 怎么选、NMS 与置信度阈值怎么调、mAP 指标怎么读等实战问题。覆盖两阶段与单阶段范式、IoU 与 CIoU 损失、NMS 与 Soft-NMS、PR 曲线与 mAP@0.5:0.95,并给出 YOLOv8 推理与手写 NMS 两段可运行代码,附模型对比表、权衡与常见坑。
本文梳理卷积网络的核心概念与经典骨干架构,回答卷积核与感受野怎么算、参数量与 FLOPs 如何评估、ResNet 到 ConvNeXt 该怎么选等工程问题。覆盖输出尺寸公式、深度可分离卷积、残差连接、复合缩放、归一化与激活,并给出加载骨干统计参数量与手算 FLOPs 两段可运行 PyTorch 代码,附各骨干参数量与 ImageNet 指标对比表及权衡与常见坑。
本文系统讲解传统特征提取与图像匹配,回答 SIFT、ORB、AKAZE 该怎么选、BFMatcher 与 FLANN 怎么配、ratio test 与 RANSAC 如何剔除误匹配等实战问题。覆盖 Harris 角点、ORB 二进制描述子、KNN 匹配与 Lowe 比值检验、单应矩阵与图像拼接,并给出 ORB 与 SIFT 两段可运行匹配代码,最后对比深度学习特征方案并总结权衡与常见坑。
本文系统讲解 OpenCV 4.x 的图像基础与预处理,回答图像在内存中怎么表示、色彩空间怎么选、几何变换用哪种插值、直方图与 CLAHE 如何提升对比度等实战问题。覆盖 BGR/RGB 陷阱、resize 插值方法、仿射与透视变换、滤波去噪、Canny 边缘与形态学,并给出完整预处理管线、直方图可视化与 PyTorch 张量衔接三个可运行示例,最后总结权衡与常见坑。
本文梳理计算机视觉的任务全景与端到端工程链路,回答从需求到上线该选什么任务、用什么指标、按什么顺序搭管线。覆盖分类、检测、分割、姿态、检索、OCR、跟踪等任务的输入输出与评估指标(Top-1、mAP、mIoU、PCK、FPS),并给出数据采集、标注、训练、导出 ONNX、服务化、监控回流的完整流程与两个可运行的 torchvision 示例,最后总结选型权衡与常见坑。
计算机视觉从传统图像处理走到深度学习与大模型,工程落地的关键是把任务定义、数据、模型与部署串成闭环。本专题覆盖 CV 工程的完整链路:CV 任务全景与工程链路、OpenCV 图像基础与预处理、SIFT/ORB 特征提取与图像匹配、ResNet/EfficientNet 等卷积骨干、YOLO 系列目标检测与 mAP 评估、U-Net 与 Mask R-CNN 图像分割、姿态估计与关键点检测、ViT/Swin/CLIP 视觉 Transformer 与多模态、数据标注与数据集工程、迁移学习与训练调优、量化剪枝蒸馏与端侧部署,以及 Triton 服务化与推理加速。后续补充的 6 篇进阶内容进一步覆盖 OCR 与文档理解、人脸识别与活体检测、视频理解与多目标跟踪、点云与深度估计、多模态视觉语言模型,以及检测分割的评估指标。