算力百科COMPUTEPEDIA

算力百科 › 技术概念 › 混合精度训练

混合精度训练

MIXED PRECISION TRAINING · 技术概念词条

概述OVERVIEW

混合精度训练是「低精度算、高精度存」的方法:前向反向用 FP16/BF16/FP8 做矩阵乘,优化器侧保留 FP32 主权重,配损失缩放防梯度下溢——方法由 NVIDIA 等 2017 年论文(ICLR 2018)定型,显存占用可省近一半。BF16 由 Google 为 TPU 提出,指数位与 FP32 同宽(8 位),已成大模型训练默认档位(Google Cloud 官方博客)。

精度降一档,显存与带宽压力减半、Tensor Core 吞吐翻倍:A100 BF16 312 TFLOPS(稠密),H100 FP8 3958 TFLOPS(稀疏,NVIDIA 官方页);FP8 双格式 E4M3/E5M2 出自 NVIDIA、Arm、Intel 2022 论文,Transformer Engine 库自 Hopper 代把 FP8 训练工程化,训练配方按层自动切档。

关键数字KEY NUMBERS

项目数值 / 口径
方法定型FP16 计算 + FP32 主权重 · 显存省近 2 倍(NVIDIA 等论文,ICLR 2018)
BF16 格式8 位指数与 FP32 同宽 · 动态范围不打折(Google Cloud 官方博客 2019)
FP8 定标E4M3 前向 / E5M2 梯度 双格式(NVIDIA/Arm/Intel 2022 论文)
吞吐台阶A100 BF16 312 → H100 FP8 3958 TFLOPS(稀疏)(NVIDIA 官方页)

在 B300 上的意义ON B300

B300 这代把精度阶梯一路铺到 4 位:FP8 之外原生支持 FP6/FP4(NVFP4),DGX B300 八卡平台官方标 FP8 Tensor Core 72 PFLOPS、FP4 144 PFLOPS(NVIDIA 官方规格页)——训练配方选哪一档,直接决定同价机器能跑多大的模型、多快的迭代。

买家视角:机型标称算力必须按「精度档」对表——「1 PFLOPS」是 FP8 的还是 FP4 的、稀疏还是稠密,报价能差数倍;FP8 权重约等于参数量乘 1 字节,比 FP16 档显存减半,这是 B300 这类大显存机型吃满价值的前提(口径与本库 FP8 词条一致)。

边界与注意LIMITS

  • 低精度不是免费午餐:FP16 有上溢下溢风险(须损失缩放兜底),FP8/FP4 有精度损失,生成式任务与部分训练场景要逐模型验证;「无损」结论都有前提——开山论文原文即强调 FP32 主权重与损失缩放不可省(ICLR 2018 论文)。
  • 软件栈绑定深:FP8 训练依赖 Transformer Engine 等专用库与框架版本,Blackwell 的 FP4 还需配套软件栈支持;CUDA 生态之外的 FP8/BF16 工具链成熟度参差,选型时软件栈要随硬件一并核。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-11 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品