📖
量化
应用概念
一句话概括
将模型权重从高精度浮点压缩到低精度整数,降低显存和计算成本的优化技术。
详细解析
量化(Quantization)是将模型权重从FP16/BF16高精度浮点压缩到INT8、INT4等低精度整数表示的技术。它能显著降低模型显存占用和推理成本,是开源模型本地部署的关键使能技术。
量化分为训练后量化(PTQ,如GPTQ、AWQ、GGUF)和量化感知训练(QAT)。PTQ在训练后直接转换,简单但可能有精度损失;QAT在训练中模拟量化,精度更好但成本高。GGUF格式专为CPU/GPU混合量化部署设计,被llama.cpp广泛使用。
量化的权衡是"精度损失换成本降低":INT4量化可能损失1-3%精度,但显存降至1/4。在显存受限场景(消费级GPU、手机、边缘设备),量化让大模型本地运行成为可能,推动了开源模型生态的繁荣。