算力百科 › 技术概念 › FP4 / FP6 微缩浮点精度
FP4(4-bit 浮点)和 FP6(6-bit 浮点)是 NVIDIA Blackwell 架构引入的最新精度格式:比 FP8 再砍一半/三分之一的位宽——在几乎不掉模型精度的前提下把算力和显存密度再翻倍/提升。FP4 的算力口径是 NVIDIA 标称旗舰 GPU 性能的「主打数字」。
对采购方的解读:FP4 算力是厂商标称旗舰性能的「主打数字」——但实际可用性取决于模型量化技术(TensorRT-LLM / GPTQ / AWQ 等)的成熟度。FP4 推理已在部分场景验证可行,FP4 训练仍在研究中——采购时区分「推理用 FP4」和「训练用 FP8/BF16」的精度需求。
| 项目 | 数值 / 口径 |
|---|---|
| FP4 位宽 | 4-bit 浮点 |
| 对照 FP8 | FP4 = FP8 减半位宽 |
| B300 FP4 稠密 | 约 15 PFLOPS |
| B300 FP8 稠密 | 约 5 PFLOPS |
B300 的 FP4 算力是 NVIDIA 标称旗舰性能的主打数字——但采购方要注意:FP4 算力是稀疏/稠密口径中较高的那个,实际推理吞吐取决于模型量化后的精度保持。建议采购前用目标模型在 FP8 档跑基准(更成熟),FP4 档作为前瞻参考。