| 规格 | NVIDIA Tesla V100 SXM3 32GB | NVIDIA A100 |
|---|
| 架构 | Volta (GV100) | NVIDIA Ampere (GA100),第3代 Tensor Core |
| 显存 | 32GB HBM2 (CoWoS) with ECC,4096bit(V100S 唯一容量;SXM3-32GB 为 DGX-2 专配同容量模组) | 40GB HBM2 / 80GB HBM2e 双版本(80GB 版 2020-11-16 SC20 增发),带 ECC |
| 显存带宽 | V100S(官方口径)1134 GB/s;SXM3-32GB 模组官方表未单列,独立源归 900GB/s 级(Wikipedia 并行 0.9TB/s / technical.city 897GB/s / videocardz 1.8Gbps)——1134 官方只归属 V100S PCIe 列 | 40GB 版 1,555 GB/s(PCIe/SXM 同);80GB SXM4 版 2,039 GB/s / 80GB PCIe 版 1,935 GB/s(官方 datasheet 四列分列口径) |
| 显存位宽 | 4096bit | 5120bit |
| 算力 | V100S 官方口径:FP32 16.4 / FP64 8.2 / Tensor 130 TFLOPS;SXM3-32GB 官方无单列表,Wikipedia 并入 SXM2 行(15.7/7.8/125),16.4/130 官方不适用于 SXM3 | FP32 19.5 / FP64 9.7 / FP64 Tensor 19.5 TFLOPS;TF32 156(312*) / BF16 312(624*) / FP16 312(624*) TFLOPS / INT8 624(1248*) TOPS——官方 datasheet 四形态(40G PCIe/80G PCIe/40G SXM/80G SXM)算力同口径,*为稀疏加速 |
| CUDA核心 | 5120 (80 SM) / Tensor Core 640 (初代) / FP64核心 2560 | 6912 FP32 CUDA(108 SM)/ 第3代 Tensor Core |
| 功耗 | SXM3 模组 350W(Wikipedia TDP 表 + videocardz/gpuresource 词条口径);V100S PCIe 250W(官方 datasheet 实抓) | SXM4 400W(40GB/80GB 同);PCIe 版 40GB 250W / 80GB 300W |
| 互联 | V100S:PCIe Gen3 x16 32GB/s,无 NVLink;SXM3-32GB:NVLink 2.0 ×12 链路经 NVSwitch 全互联(DGX-2/HGX-2 专配,SXM3 插座与 SXM2 载板不通用) | SXM4 版:NVLink 3.0 12链路 600GB/s 双向 + PCIe Gen4 64GB/s;PCIe 版:NVLink Bridge 双卡互连 600GB/s + PCIe Gen4 64GB/s |
| 发布年 | V100S:2019(2019-11-26 上市,发布时仅 PCIe 3 形态);SXM3-32GB 模组:2018-03-27 随 DGX-2 发布(早于 V100S) | 2020(40GB 版 2020-05-14 GTC 发布;80GB 版 2020-11-16 SC20 发布) |
| 工艺 | TSMC 12nm FFN,21.1B 晶体管,815mm² | TSMC 7nm(N7 定制),54.2B 晶体管,826mm² |
| 形态 | SXM3 mezzanine 模组(DGX-2 独占,16卡 NVSwitch 底板)/ V100S 为 PCIe 双槽全高全长被动散热 | SXM4 模组(HGX A100 4/8/16卡、DGX A100 8卡)/ PCIe 双槽 10.5英寸全长 |
| 特色 | V100 同芯提频 S 后缀高性能版:带宽 900→1134GB/s、Tensor 125→130、FP32 15.7→16.4(官方仅 PCIe 形态兑现);SXM3 32GB 模组是 DGX-2/NVSwitch 全互联时代的开场卡,nvidia-smi 识别名 Tesla-V100-SXM3-32GB | — |
| MIG | — | Multi-Instance GPU 最多 7 硬件隔离实例(40GB 版单实例最高 5GB / 80GB 版 10GB) |