| 规格 | NVIDIA Tesla P100 | NVIDIA H20 |
|---|
| 架构 | Pascal (GP100), Compute Capability 6.0;16nm FinFET、610mm²、153亿晶体管(GP100全配60 SM,P100用56 SM) | NVIDIA Hopper(H100同架构合规裁剪版;VipraTech与腾讯新闻双源实抓) |
| 显存 | 16GB CoWoS HBM2(四栈4-die,HBM2原生ECC无容量/带宽开销;PCIe版另有12GB@549GB/s变体) | 96GB HBM3(Flopper/VipraTech/腾讯新闻三源一致) |
| 显存带宽 | 732 GB/s(官方datasheet口径;白皮书正文按栈180GB/s×4=720为粗算口径;12GB PCIe变体549 GB/s) | 4.0TB/s(三源一致;显存位宽6144bit仅第三方数据库搜索摘要提及,未实抓双源,不录) |
| 显存位宽 | 4096bit(8×512-bit内存控制器,deviceQuery实机两版同) | — |
| 算力 | 双口径:SXM2版 FP32 10.6 / FP16 21.2 / FP64 5.3 TFLOPS;PCIe版 FP32 9.3 / FP16 18.7 / FP64 4.7 TFLOPS(Pascal一代无Tensor Core,FP16经GP100专用单元2:1吞吐) | FP8 Tensor Core 296 TFLOPS(密集)/592 TFLOPS(2:4稀疏,单源);FP16/BF16 Tensor Core 148 TFLOPS(密集,单源;稀疏口径未双源实抓);TF32 Tensor Core 74 TFLOPS;FP32 44 TFLOPS;FP64 1.0 TFLOPS(合规裁剪:H100 SXM同表FP8 3958/FP16 1979/FP64 34);INT8 296 TOPS/592 TOPS(单源) |
| CUDA核心 | 3584(56 SM × 64,deviceQuery实机;FP64单元1792=32/SM) | 14,592 FP32 CUDA核心(单源VipraTech) |
| 功耗 | SXM2 300W(nvidia-smi默认=最大,min 150W)/ PCIe 250W(默认=最大,min 125W) | 400W TDP(Flopper/VipraTech规格表/腾讯新闻'热设计功耗400W'三源;VipraTech正文另有350W矛盾口径已弃) |
| 互联 | SXM2版NVLink 4 Link×40GB/s=160GB/s双向(全球首发)+PCIe Gen3;PCIe版无NVLink仅PCIe Gen3 x16 | NVLink 900GB/s(VipraTech+腾讯新闻双源;第几代NVLink无实抓双源,不录代数)+PCIe Gen5 x16 128GB/s(VipraTech实抓,BurnCloud旁证Gen5) |
| 发布年 | 2016(2016-04-05 GTC圣何塞发布,官方dev blog落款;SXM2随DGX-1先行,PCIe版2016-09起出货) | 2024(Flopper实抓Launch Year 2024;腾讯新闻2023-11-10首发报道'即将推出';具体发布日未实抓双源,不录) |
| 形态 | SXM2底板mezzanine(140mm×78mm,300W,件号900-2H403-0000-000)/ PCIe全高全长双槽被动(250W),均无风扇 | HGX 8路SXM基板模组(Flopper'SXM'/VipraTech'8-way HGX'/腾讯新闻'HGX方案8路GPU配置+H20 SXM';同批L20/L2为PCIe形态) |
| 频率 | SXM2:基础1328/Boost 1480 MHz(白皮书对比表);PCIe:应用1189/max 1328 MHz(nvidia-smi实测);显存715 MHz(等效1.43Gbps×2=732GB/s吻合) | — |
| 特色 | 史上第一块HBM2显存GPU+NVLink首发卡、Pascal数据中心旗舰;DGX-1八卡170 TFLOPS FP16的AI超算心脏;无Tensor Core时代深度学习过渡期主力,现存量大、二手流通活跃 | — |
| L2缓存 | — | 60MB(单源VipraTech) |
| MIG切片 | — | 最多7实例(VipraTech+腾讯新闻'7路MIG'双源) |
| 编解码器 | — | 7 NVDEC + 7 NVJPEG(单源VipraTech) |
| 出口合规背景 | — | 2022-10美国出口管制后对华合规特供卡:算力密度较H100大幅裁剪(FP8约为H100 SXM的7.5%),以显存96GB+NVLink900GB/s保推理场景(QQ:综合算力约H100的20%) |