NVIDIA H100 SXM是基于Hopper架构的数据中心加速计算卡,为DGX与HGX H100系统的核心组件,也是当前大规模AI训练的事实标准硬件。它采用SXM5形态,配备80GB HBM3显存,通过第四代NVLink提供900GB/s的GPU间互联带宽,并原生支持PCIe Gen5。其Tensor Core覆盖FP64至FP8多种精度,支持MIG将单卡划分为最多七个实例。该卡广泛部署于大模型预训练、推理服务与高性能计算集群,同时在二手流通市场中因供应稀缺而具有较高的保值表现。
| 架构 | NVIDIA Hopper(GH100核心,TSMC 4N定制工艺,800亿晶体管,814mm²,Compute Capability 9.0) |
| 显存 | 80GB HBM3(SXM5口径,5颗HBM3堆栈);PCIe版为80GB HBM2e(5堆栈,2TB/s) |
| 显存位宽 | 5120bit(SXM5与PCIe版均为10个512bit内存控制器) |
| 显存带宽 | 3.35TB/s(SXM5);PCIe版2TB/s |
| 算力 | FP8 Tensor Core 3,958 TFLOPS(含稀疏,密集1,979);FP16/BF16 TC 1,979*;TF32 TC 989*;FP64 TC 67;FP32 67;FP64 34(SXM5口径,*=With sparsity) |
| 功耗 | SXM5最高700W(可配置);PCIe版350W |
| 互联 | NVLink 4.0 900GB/s(SXM5,18条链路)+PCIe Gen5 x16 128GB/s;PCIe版:PCIe Gen5 128GB/s,可选双卡NVLink桥接600GB/s |
| 发布年 | 2022(2022-03-22 GTC发布,SXM5 Q3 2022上市) |
| SM与CUDA核 | 132 SM / 16,896 FP32 CUDA核(SXM5);PCIe版114 SM / 14,592 |
| 加速频率 | SXM5:1830MHz(FP8/FP16/BF16/TF32 TC)/1980MHz(FP64 TC与FP32/FP64);PCIe版:1620/1755MHz |
| L2缓存 | 50MB |
| MIG切片 | 第二代Secure MIG,最多7实例@10GB |
| 编解码器 | 7 NVDEC + 7 NVJPG |
| 形态 | SXM5模组(液冷/风冷由整机定,配HGX/DGX H100 4或8卡);PCIe版双槽风冷 |
| 型号 | 显存 | 功耗 |
|---|
| NVIDIA T4 对比 | 16GB GDDR6 with ECC (默认开启) | 70W (Total board power, 默认) |
| NVIDIA A100 对比 | 40GB HBM2 / 80GB HBM2e 双版本(80GB 版 2020-11-16 SC20 增发),带 ECC | SXM4 400W(40GB/80GB 同);PCIe 版 40GB 250W / 80GB 300W |
| NVIDIA H20 对比 | 96GB HBM3(Flopper/VipraTech/腾讯新闻三源一致) | 400W TDP(Flopper/VipraTech规格表/腾讯新闻'热设计功耗400W'三源;VipraTech正文另有350W矛盾口径已弃) |
| NVIDIA GB300 对比 | 288GB HBM3e(单GPU封装;超级芯片576GB;HGX板级2.1TB/机柜20TB并存) | TGP 最高 1400W(单GPU,官方博客直证) |
| NVIDIA A30 对比 | 24 GB HBM2 | 165 W |
| NVIDIA GeForce RTX 4090 对比 | 24GB GDDR6X | 450W TGP (平均游戏315W, 建议系统电源850W) |