量化与精度

阶段3 | 第29-32周

📅 4周学习计划

第29周

量化基础
PTQ vs QAT

第30周

INT8量化
SmoothQuant

第31周

FP8量化
H100支持

第32周

GPTQ/AWQ/GGUF
实战对比

1. 精度格式对比

格式位宽范围精度适用场景
FP3232-bit±3.4×10³⁸训练默认
FP16/BF1616-bit±65504/±3.4×10³⁸混合精度训练
TF3219-bit同FP32A100+
FP8 (E4M3)8-bit±448H100推理
INT88-bit-128~127推理量化
INT44-bit-8~7极低极致压缩

2. 量化方法

PTQ (Post-Training Quantization)

QAT (Quantization-Aware Training)

3. 量化技术

SmoothQuant

GPTQ

AWQ (Activation-aware Weight Quantization)

GGUF

4. 实战对比

方法速度内存精度易用性
FP161x1x★★★★★★★★★★
INT8 (SmoothQuant)1.5x0.5x★★★★☆★★★★☆
INT4 (GPTQ)2x0.25x★★★☆☆★★★☆☆
INT4 (AWQ)2x0.25x★★★★☆★★★★☆

📚 学习资源

🛠️ 实践项目