算力百科COMPUTEPEDIA

算力百科 › 技术概念 › FP4 / FP6 微缩浮点精度

FP4 / FP6 微缩浮点精度

FP4 / FP6 PRECISION · 技术概念词条

概述OVERVIEW

FP4(4-bit 浮点)和 FP6(6-bit 浮点)是 NVIDIA Blackwell 架构引入的最新精度格式:比 FP8 再砍一半/三分之一的位宽——在几乎不掉模型精度的前提下把算力和显存密度再翻倍/提升。FP4 的算力口径是 NVIDIA 标称旗舰 GPU 性能的「主打数字」。

对采购方的解读:FP4 算力是厂商标称旗舰性能的「主打数字」——但实际可用性取决于模型量化技术(TensorRT-LLM / GPTQ / AWQ 等)的成熟度。FP4 推理已在部分场景验证可行,FP4 训练仍在研究中——采购时区分「推理用 FP4」和「训练用 FP8/BF16」的精度需求。

关键数字KEY NUMBERS

项目数值 / 口径
FP4 位宽4-bit 浮点
对照 FP8FP4 = FP8 减半位宽
B300 FP4 稠密约 15 PFLOPS
B300 FP8 稠密约 5 PFLOPS

在 B300 上的意义ON B300

B300 的 FP4 算力是 NVIDIA 标称旗舰性能的主打数字——但采购方要注意:FP4 算力是稀疏/稠密口径中较高的那个,实际推理吞吐取决于模型量化后的精度保持。建议采购前用目标模型在 FP8 档跑基准(更成熟),FP4 档作为前瞻参考。

边界与注意LIMITS

  • FP4 量化的精度损失:并非所有模型都能量化到 FP4——大参数模型的 FP4 量化技术仍在研究中,精度损失可能不可接受。
  • 框架支持参差:FP4 推理需要 TensorRT-LLM / vLLM 等推理框架的最新版本——旧框架不支持 FP4。
  • 标称口径的稀疏/稠密差异:厂商标称的 FP4 算力通常是稀疏口径(稠密减半)——对比不同 GPU 时要统一口径。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品