量化感知训练(QAT)与量化微调:伪量化、STE 与 QLoRA 实战
训练后量化(PTQ)在精度敏感场景常常失手,量化感知训练(QAT)则让模型在训练阶段就『学会』适应量化噪声,是工业界把 INT8 精度损失压到 1% 以内的关键手段。本文从伪量化算子与直通估计器(STE)讲起,给出 QAT 完整流程,讲解蒸馏+量化组合,并深入 LoRA 量化微调(QLoRA)与工业实践。一、QAT 背景与动机
tag
训练后量化(PTQ)在精度敏感场景常常失手,量化感知训练(QAT)则让模型在训练阶段就『学会』适应量化噪声,是工业界把 INT8 精度损失压到 1% 以内的关键手段。本文从伪量化算子与直通估计器(STE)讲起,给出 QAT 完整流程,讲解蒸馏+量化组合,并深入 LoRA 量化微调(QLoRA)与工业实践。一、QAT 背景与动机
全参数微调大语言模型在显存、数据与工程成本上都不现实,参数高效微调(PEFT)成为主流选择。本文系统讲解微调技术全景:全参微调的局限、LoRA 低秩分解原理与实现、QLoRA 的 4bit 量化与嵌套量化、Adapter 与 Prefix Tuning、微调数据构造与合成、训练超参配置、评测与过拟合防护,以及 SFT 与 DPO 两条对齐路线的工程实践对比。