| 规格 | NVIDIA Tesla P100 | NVIDIA A100 |
|---|
| 架构 | Pascal (GP100), Compute Capability 6.0;16nm FinFET、610mm²、153亿晶体管(GP100全配60 SM,P100用56 SM) | NVIDIA Ampere (GA100),第3代 Tensor Core |
| 显存 | 16GB CoWoS HBM2(四栈4-die,HBM2原生ECC无容量/带宽开销;PCIe版另有12GB@549GB/s变体) | 40GB HBM2 / 80GB HBM2e 双版本(80GB 版 2020-11-16 SC20 增发),带 ECC |
| 显存带宽 | 732 GB/s(官方datasheet口径;白皮书正文按栈180GB/s×4=720为粗算口径;12GB PCIe变体549 GB/s) | 40GB 版 1,555 GB/s(PCIe/SXM 同);80GB SXM4 版 2,039 GB/s / 80GB PCIe 版 1,935 GB/s(官方 datasheet 四列分列口径) |
| 显存位宽 | 4096bit(8×512-bit内存控制器,deviceQuery实机两版同) | 5120bit |
| 算力 | 双口径:SXM2版 FP32 10.6 / FP16 21.2 / FP64 5.3 TFLOPS;PCIe版 FP32 9.3 / FP16 18.7 / FP64 4.7 TFLOPS(Pascal一代无Tensor Core,FP16经GP100专用单元2:1吞吐) | FP32 19.5 / FP64 9.7 / FP64 Tensor 19.5 TFLOPS;TF32 156(312*) / BF16 312(624*) / FP16 312(624*) TFLOPS / INT8 624(1248*) TOPS——官方 datasheet 四形态(40G PCIe/80G PCIe/40G SXM/80G SXM)算力同口径,*为稀疏加速 |
| CUDA核心 | 3584(56 SM × 64,deviceQuery实机;FP64单元1792=32/SM) | 6912 FP32 CUDA(108 SM)/ 第3代 Tensor Core |
| 功耗 | SXM2 300W(nvidia-smi默认=最大,min 150W)/ PCIe 250W(默认=最大,min 125W) | SXM4 400W(40GB/80GB 同);PCIe 版 40GB 250W / 80GB 300W |
| 互联 | SXM2版NVLink 4 Link×40GB/s=160GB/s双向(全球首发)+PCIe Gen3;PCIe版无NVLink仅PCIe Gen3 x16 | SXM4 版:NVLink 3.0 12链路 600GB/s 双向 + PCIe Gen4 64GB/s;PCIe 版:NVLink Bridge 双卡互连 600GB/s + PCIe Gen4 64GB/s |
| 发布年 | 2016(2016-04-05 GTC圣何塞发布,官方dev blog落款;SXM2随DGX-1先行,PCIe版2016-09起出货) | 2020(40GB 版 2020-05-14 GTC 发布;80GB 版 2020-11-16 SC20 发布) |
| 形态 | SXM2底板mezzanine(140mm×78mm,300W,件号900-2H403-0000-000)/ PCIe全高全长双槽被动(250W),均无风扇 | SXM4 模组(HGX A100 4/8/16卡、DGX A100 8卡)/ PCIe 双槽 10.5英寸全长 |
| 频率 | SXM2:基础1328/Boost 1480 MHz(白皮书对比表);PCIe:应用1189/max 1328 MHz(nvidia-smi实测);显存715 MHz(等效1.43Gbps×2=732GB/s吻合) | — |
| 特色 | 史上第一块HBM2显存GPU+NVLink首发卡、Pascal数据中心旗舰;DGX-1八卡170 TFLOPS FP16的AI超算心脏;无Tensor Core时代深度学习过渡期主力,现存量大、二手流通活跃 | — |
| 工艺 | — | TSMC 7nm(N7 定制),54.2B 晶体管,826mm² |
| MIG | — | Multi-Instance GPU 最多 7 硬件隔离实例(40GB 版单实例最高 5GB / 80GB 版 10GB) |