| 规格 | NVIDIA H200 SXM | NVIDIA A100 |
|---|
| 架构 | NVIDIA Hopper(GH100核心,TSMC 4N定制工艺,800亿晶体管,814mm²,与H100 SXM同颗GH100) | NVIDIA Ampere (GA100),第3代 Tensor Core |
| 显存 | 141GB HBM3e(6144bit总线/6.3Gbps引脚速率,官方称全球首款141GB HBM3e单卡) | 40GB HBM2 / 80GB HBM2e 双版本(80GB 版 2020-11-16 SC20 增发),带 ECC |
| 显存类型 | HBM3e | — |
| 显存位宽 | 6144bit | 5120bit |
| 显存带宽 | 4.8TB/s(官方页+Datasheet+新闻稿+Wikipedia四源一致) | 40GB 版 1,555 GB/s(PCIe/SXM 同);80GB SXM4 版 2,039 GB/s / 80GB PCIe 版 1,935 GB/s(官方 datasheet 四列分列口径) |
| 算力 | FP8 Tensor Core 3,958 TFLOPS(含稀疏,密集1,979);FP16/BF16 TC 1,979*;TF32 TC 989*;INT8 TC 3,958 TOPS*;FP64 TC 67;FP32 67;FP64 34(SXM口径,*=With sparsity) | FP32 19.5 / FP64 9.7 / FP64 Tensor 19.5 TFLOPS;TF32 156(312*) / BF16 312(624*) / FP16 312(624*) TFLOPS / INT8 624(1248*) TOPS——官方 datasheet 四形态(40G PCIe/80G PCIe/40G SXM/80G SXM)算力同口径,*为稀疏加速 |
| 功耗 | SXM最高700W(可配置);同座H100 SXM同为700W功耗档 | SXM4 400W(40GB/80GB 同);PCIe 版 40GB 250W / 80GB 300W |
| 互联 | NVLink 900GB/s+PCIe Gen5 128GB/s;经NVSwitch组HGX H200 4/8卡全互联(8卡FP8合计超32 PFLOPS,显存合计1.1TB) | SXM4 版:NVLink 3.0 12链路 600GB/s 双向 + PCIe Gen4 64GB/s;PCIe 版:NVLink Bridge 双卡互连 600GB/s + PCIe Gen4 64GB/s |
| 发布年 | 2024(2023-11-13 SC23宣布,官方口径2024 Q2起OEM交付;业界通行记载2024-06-04全面GA,旁证级) | 2020(40GB 版 2020-05-14 GTC 发布;80GB 版 2020-11-16 SC20 发布) |
| SM与CUDA核 | 132 SM / 16,896 FP32 CUDA核(GH100,与H100 SXM5同源;旁证Wikipedia Hopper表) | — |
| 加速频率 | 1,980MHz(旁证Wikipedia Hopper表,与H100 SXM行同列合并显示;NVIDIA官方未单列H200时钟,谨慎引用) | — |
| L2缓存 | 50MB(架构级,旁证Wikipedia) | — |
| MIG切片 | 最多7实例@18GB(每实例18GB,大于H200 NVL的16.5GB与H100的10GB) | — |
| 编解码器 | 7 NVDEC + 7 JPEG | — |
| 机密计算 | Confidential Computing Supported | — |
| 形态 | SXM模组(液冷/风冷由整机定,配HGX H200 4或8卡;AI Enterprise为Add-on另购) | SXM4 模组(HGX A100 4/8/16卡、DGX A100 8卡)/ PCIe 双槽 10.5英寸全长 |
| CUDA核心 | — | 6912 FP32 CUDA(108 SM)/ 第3代 Tensor Core |
| 工艺 | — | TSMC 7nm(N7 定制),54.2B 晶体管,826mm² |
| MIG | — | Multi-Instance GPU 最多 7 硬件隔离实例(40GB 版单实例最高 5GB / 80GB 版 10GB) |