tag

INT4

共 1 篇文章。
全部文章GoGolangGodotTutorialRustSaaSRust TutorsLuaPrd游戏客户端Long Term Novel Writing ExperienceSpore Trilogy Creative Writing Notes孢子三部曲孢子三部曲创作手记回顾
ai

模型压缩:量化、剪枝、蒸馏与部署优化实战

模型压缩让大模型在有限显存与延迟预算下可用,是边缘部署与降本增效的关键。本文系统讲解模型压缩四大技术:量化(PTQ/QAT/INT8/INT4/FP16)、剪枝(结构化/非结构化)、知识蒸馏(logits/特征/教师学生)、低秩分解,并结合 ONNX/TensorRT/TVM 部署优化、显存与吞吐权衡、精度保持评估方法,以及 LLM 量化与边缘部署的实战案例。

11 分钟阅读
模型压缩 量化 INT8