算力百科COMPUTEPEDIA

算力百科 › 技术概念 › 模型量化

模型量化

MODEL QUANTIZATION · 技术概念词条

概述OVERVIEW

量化(Quantization)是把模型权重和激活值从高精度(FP16/BF16)降到低精度(FP8/INT8/INT4/FP4)的技术——直接效果是显存占用和计算吞吐双双优化:INT4 量化让 70B 模型从 140GB 降到约 35GB——一张 48GB 卡就能装下。

对采购方的意义:量化决定了「同样的预算能跑多大的模型」——显存规格选型时必须考虑目标模型是否能量化、量化到什么精度、精度损失是否可接受。FP8/FP4 是 NVIDIA 最近的精度路线(Hopper→Blackwell),AMD 的 MXFP4/FP6 同步跟进。

关键数字KEY NUMBERS

项目数值 / 口径
常见精度阶梯FP32 → BF16/FP16 → FP8/INT8 → INT4/FP4
70B FP16 显存约 140GB
70B INT4 显存约 35GB
量化工具GPTQ / AWQ / TensorRT-LLM / bitsandbytes

在 B300 上的意义ON B300

B300 原生支持 FP4/FP6 精度——推理场景可以量化到 FP4 把算力拉满;训练场景建议 FP8/BF16(精度损失可控)。量化后的精度损失是否可接受取决于模型和任务——分类/检索容忍度高,生成式任务容忍度低。

边界与注意LIMITS

  • 量化可能掉精度:INT4/FP4 量化对生成式任务(创意写作/代码生成)的精度损失可能不可接受——逐模型评估。
  • 量化工具链碎片化:GPTQ/AWQ/bitsandbytes/TensorRT 等工具各有优劣——没有一站式方案,需要逐模型适配。
  • KV Cache 量化更敏感:KV cache 的量化对推理精度的影响比权重量化更大——慎用。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品