量化压缩比

🗜️ Quantization Compression Ratio Estimator

Estimate the parameter and memory compression ratio when quantizing a model, for example from FP32 down to INT8, to plan deployment.

📐 计算公式 / 原理
压缩比 = 原位数 / 目标位数;模型大小(MB) ≈ 参数量 × 位数 / 8 / 1024²
量化通过降低权重数值精度(FP32→INT8 即 4:1)直接缩小体积与带宽需求,算力受限场景收益明显。但精度损失会体现在指标上,对异常值敏感的模型需做量化感知训练或逐通道校准。

📐 计算公式与说明

压缩比 = 原字节/量化字节

FP32→INT8 约 4× 压缩,需校准保精度。

📚 深度解析:量化压缩比

💡 常见使用场景

FP32→INT8
7B 模型 FP16 权重≈14GB,量化 INT8≈3.5GB(约 4× 压缩),可在消费级显卡部署;若进一步 INT4≈1.75GB 但精度损失更明显,需实测可接受度。

❓ 常见问题(FAQ)

量化一定会掉精度吗?
会损失一定精度,但 PTQ+校准或 QAT 可把损失压到很小;小模型/低比特(INT4)损失更大,需以下游任务指标验证。
压缩比和推理速度是一回事?
相关但不等价。低比特省显存、提升访存带宽利用率,常提速;但是否真正加速还取决于硬件对低比特算子与反量化的支持。