混合精度训练是「低精度算、高精度存」的方法:前向反向用 FP16/BF16/FP8 做矩阵乘,优化器侧保留 FP32 主权重,配损失缩放防梯度下溢——方法由 NVIDIA 等 2017 年论文(ICLR 2018)定型,显存占用可省近一半。BF16 由 Google 为 TPU 提出,指数位与 FP32 同宽(8 位),已成大模型训练默认档位(Google Cloud 官方博客)。
精度降一档,显存与带宽压力减半、Tensor Core 吞吐翻倍:A100 BF16 312 TFLOPS(稠密),H100 FP8 3958 TFLOPS(稀疏,NVIDIA 官方页);FP8 双格式 E4M3/E5M2 出自 NVIDIA、Arm、Intel 2022 论文,Transformer Engine 库自 Hopper 代把 FP8 训练工程化,训练配方按层自动切档。
| 项目 | 数值 / 口径 |
|---|---|
| 方法定型 | FP16 计算 + FP32 主权重 · 显存省近 2 倍(NVIDIA 等论文,ICLR 2018) |
| BF16 格式 | 8 位指数与 FP32 同宽 · 动态范围不打折(Google Cloud 官方博客 2019) |
| FP8 定标 | E4M3 前向 / E5M2 梯度 双格式(NVIDIA/Arm/Intel 2022 论文) |
| 吞吐台阶 | A100 BF16 312 → H100 FP8 3958 TFLOPS(稀疏)(NVIDIA 官方页) |
B300 这代把精度阶梯一路铺到 4 位:FP8 之外原生支持 FP6/FP4(NVFP4),DGX B300 八卡平台官方标 FP8 Tensor Core 72 PFLOPS、FP4 144 PFLOPS(NVIDIA 官方规格页)——训练配方选哪一档,直接决定同价机器能跑多大的模型、多快的迭代。
买家视角:机型标称算力必须按「精度档」对表——「1 PFLOPS」是 FP8 的还是 FP4 的、稀疏还是稠密,报价能差数倍;FP8 权重约等于参数量乘 1 字节,比 FP16 档显存减半,这是 B300 这类大显存机型吃满价值的前提(口径与本库 FP8 词条一致)。