量化(Quantization)是把模型权重和激活值从高精度(FP16/BF16)降到低精度(FP8/INT8/INT4/FP4)的技术——直接效果是显存占用和计算吞吐双双优化:INT4 量化让 70B 模型从 140GB 降到约 35GB——一张 48GB 卡就能装下。
对采购方的意义:量化决定了「同样的预算能跑多大的模型」——显存规格选型时必须考虑目标模型是否能量化、量化到什么精度、精度损失是否可接受。FP8/FP4 是 NVIDIA 最近的精度路线(Hopper→Blackwell),AMD 的 MXFP4/FP6 同步跟进。
| 项目 | 数值 / 口径 |
|---|---|
| 常见精度阶梯 | FP32 → BF16/FP16 → FP8/INT8 → INT4/FP4 |
| 70B FP16 显存 | 约 140GB |
| 70B INT4 显存 | 约 35GB |
| 量化工具 | GPTQ / AWQ / TensorRT-LLM / bitsandbytes |
B300 原生支持 FP4/FP6 精度——推理场景可以量化到 FP4 把算力拉满;训练场景建议 FP8/BF16(精度损失可控)。量化后的精度损失是否可接受取决于模型和任务——分类/检索容忍度高,生成式任务容忍度低。