量化基础
PTQ vs QAT
INT8量化
SmoothQuant
FP8量化
H100支持
GPTQ/AWQ/GGUF
实战对比
| 格式 | 位宽 | 范围 | 精度 | 适用场景 |
|---|---|---|---|---|
| FP32 | 32-bit | ±3.4×10³⁸ | 高 | 训练默认 |
| FP16/BF16 | 16-bit | ±65504/±3.4×10³⁸ | 中 | 混合精度训练 |
| TF32 | 19-bit | 同FP32 | 中 | A100+ |
| FP8 (E4M3) | 8-bit | ±448 | 低 | H100推理 |
| INT8 | 8-bit | -128~127 | 低 | 推理量化 |
| INT4 | 4-bit | -8~7 | 极低 | 极致压缩 |
| 方法 | 速度 | 内存 | 精度 | 易用性 |
|---|---|---|---|---|
| FP16 | 1x | 1x | ★★★★★ | ★★★★★ |
| INT8 (SmoothQuant) | 1.5x | 0.5x | ★★★★☆ | ★★★★☆ |
| INT4 (GPTQ) | 2x | 0.25x | ★★★☆☆ | ★★★☆☆ |
| INT4 (AWQ) | 2x | 0.25x | ★★★★☆ | ★★★★☆ |