应用概念/术语条目
量化
将模型权重从高精度浮点压缩到低精度整数,降低显存和计算成本的优化技术。
大白话:将模型权重从高精度浮点压缩到低精度整数,降低显存和计算成本的优化技术
换成大白话
量化(Quantization)是将模型权重从FP16/BF16高精度浮点压缩到INT8、INT4等低精度整数表示的技术。它能显著降低模型显存占用和推理成本,是开源模型本地部署的关键使能技术。 量化分为训练后量化(PTQ,如GPTQ、AWQ、GGUF)和量化感知训练(QAT)。PTQ在训练后直接转换,简单但可能有精度损失;QAT在训练中模拟量化,精度更好但成本高。GGUF格式专为CPU/GPU混合量化部署设计,被llama.cpp广泛使用。 量化的权衡是"精度损失换成本降低":INT4量化可能损失1-3%精度,但显存降至1/4。在显存受限场景(消费级GPU、手机、边缘设备),量化让大模型本地运行成为可能,推动了开源模型生态的繁荣。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“量化”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“量化”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。