
H200 NVL是 NVIDIA H200 的 PCIe 双槽风冷形态:141GB HBM3e 单卡显存、FP8 3,341 TFLOPS、FP64 Tensor 60 TFLOPS,功耗可配置至 600W,2/4-way NVLink 桥接 900GB/s——机密计算(Confidential Computing)支持是它的企业级名片(官方规格快照口径[1])。
它和 HGX H200 基板版(SXM)的关系:同芯不同形态——NVL 版是 PCIe 双槽风冷插卡(机架/塔式服务器直插),HGX 基板版是 SXM 液冷/风冷整机(4/8 卡 NVLink 全互联)。对采购方:PCIe 部署门槛低一档——不需要基板整机,标准 x86 服务器直插即用(官方规格快照口径[1])。
与 H100 NVL 对照:显存 141GB 对 94GB(+50%)、带宽 4.8TB/s 对 3.9TB/s、FP8 同为 3,341 TFLOPS——H200 NVL 是 H100 NVL 的显存直系升级,推理场景的性价比之选(官方对照口径[1])。本词条不带行情带——价格以货主实际报价为准。
萬安指数(0–100):本库按公开规格加权估算——显存 40% + 互联 30% + 生态 30%。
2024 年,H200 NVL 发布:Hopper 世代的 PCIe 推理旗舰——H200 核心规格(141GB HBM3e/FP8 3,341)的 PCIe 双槽风冷形态,机密计算加持(官方规格快照口径[1])。
2024-2025 年,推理放量:大模型在线推理需求爆发——PCIe 即插即用+141GB 大显存让 H200 NVL 成为推理侧走量主力之一(本库整理口径)。
2025-2026 年,Blackwell 接棒:RTX PRO 6000 Blackwell/B300 系发布——H200 NVL 转入存量与并行流通(本库整理口径)。跨境流通政策仍在演进,本库表述为公开报道口径、不构成法律意见。
| 项目 | 规格(H200 NVL · 官方口径) |
|---|---|
| 架构 | NVIDIA Hopper |
| 单卡显存 | 141GB HBM3e |
| 显存带宽 | 4.8TB/s |
| FP8 / INT8 | 3,341 TFLOPS / 3,341 TOPS |
| FP16 | 1,671 TFLOPS |
| FP64 / FP64 Tensor | 30 / 60 TFLOPS |
| FP32 | 60 TFLOPS |
| 互联 | NVLink 桥接 2/4-way:900GB/s | PCIe Gen5:128GB/s |
| 机密计算 | 支持(Confidential Computing) |
| MIG | 最多 7 实例 @ 16.5GB |
| 编解码器 | 7 NVDEC | 7 JPEG |
| 功耗 | 最高 600W(可配置) |
| 形态 | PCIe 双槽风冷 |
规格以 NVIDIA 官方快照为准(2026-10 口径[1],与本库薄卡逐条对账一致)。
| 项目 | H200 NVL(PCIe) | H200 SXM(HGX 基板) |
|---|---|---|
| 显存 | 141GB HBM3e | 141GB HBM3e |
| 互联 | NVLink 桥接 900GB/s(2/4 卡) | NVLink 900GB/s(多卡全互联) |
| 部署 | 标准 x86 服务器直插 | HGX 基板整机 |
| 选型一句话 | 推理/单机直插 | 大规模训练集群 |
H200 家族按形态分档;NVL 版是 PCIe 推理旗舰:
H200 NVL 是 PCIe 双槽风冷插卡(最高 600W 可配置)——标准 x86 服务器直插即用,不需要 HGX 基板整机(官方规格快照口径[1])。部署三对表:供电(600W 档需够额的 PSU 与供电线)、PCIe Gen5 直连(x16 直连 CPU,过 switch 吃带宽)、风道(600W 满载的双槽卡风道压力大于 300W 段——进风温度控制)。
机密计算部署:Confidential Computing 需要在 BIOS/驱动/框架三层启用——金融/政务合规场景建议在验收时逐层实测(本库整理口径)。
| 模型 / 场景 | 显存需求(FP16 估算) | H200 NVL 部署口径 | 萬安指数 |
|---|---|---|---|
| 70B 级推理(FP16) | 约 140GB | 单卡 141GB 临界直装 + KV cache 精打——INT8/FP8 量化后余量充足 | 88 |
| 大模型推理(FP8) | FP8 权重约 70GB(70B) | 单卡余量充足 + MIG 切分多租户 | 90 |
| 长上下文推理 | KV cache 随长度线性 | 141GB 的 KV cache 空间——长上下文场景优于 80GB 档 | 86 |
| 大模型训练 | — | PCIe 互联受限——大规模训练看 HGX SXM 系 | 60 |

| 项目 | 要求 / 现状 |
|---|---|
| CUDA | Hopper 代(计算能力 9.0)——CUDA 11.8 起支持 |
| 框架 | PyTorch / TensorFlow / vLLM / TensorRT 全支持 |
| 机密计算 | Confidential Computing——框架层支持逐项验证(本库整理口径) |
| 驱动 | NVIDIA 数据中心驱动线(与 H100 共用) |
H200 NVL 采购的验货要点(三项):
H200 NVL 四步速查:
硬件级数据保护:GPU 显存中的数据在计算过程中加密——即使系统内存被攻破,GPU 显存中的模型与数据仍受保护。金融/政务/医疗等合规敏感行业的企业级卖点(官方规格快照口径)。
NVIDIA 产品里 NVL 后缀 = 带 NVLink 桥接的 PCIe 卡形态——H200 NVL 通过 2/4-way NVLink 桥接实现 900GB/s 卡间互联(非 SXM 基板全互联)。
单卡切多实例:H200 NVL 最多 7 实例(80GB 版 10GB/实例、94GB 版 12GB/实例、H200 NVL 16.5GB/实例)——多租户推理池化的硬件基础。
部署形态分界:PCIe 直插(标准 x86 服务器/塔式)选 NVL——HGX 基板整机(4/8 卡 NVLink 全互联)适合大规模训练集群。两者 141GB 显存同档。
显存直系升级:141GB 对 94GB(+50%)、带宽 4.8TB/s 对 3.9TB/s、FP8 算力同档——推理场景 H200 NVL 的单位显存成本更优。
GPU 显存计算过程加密——金融/政务/医疗合规要求强的场景是刚需,普通推理可不开(开启后有轻微性能开销,行业口径约 5% 内)。合规需求驱动选型。
四步:身份识别(nvidia-smi 141GB/ECC)→ 600W 档满载烤机(温度/零 ECC 报错)→ FP8 算力基准(≥80% 合格,推算口径)→ MIG 7 实例切分实测。
H200 已于 2025-12 获批对华(公开报道口径,同 H200 词条)——H200 NVL 的 PCIe 形态获批状态建议以最新政策与专业意见为准,本库不构成法律意见。