| 规格 | NVIDIA Tesla P4 | NVIDIA H20 |
|---|
| 架构 | Pascal (GP104-895-A1), Compute Capability 6.1;20 SM × 128 CUDA(4 GPC × 5 SM) | NVIDIA Hopper(H100同架构合规裁剪版;VipraTech与腾讯新闻双源实抓) |
| 显存 | 8GB GDDR5(8 pcs 256M×32颗粒),板载ECC且出厂默认启用(官方brief:ECC Supported Enabled by default) | 96GB HBM3(Flopper/VipraTech/腾讯新闻三源一致) |
| 显存带宽 | 192 GB/s(官方datasheet与brief同为'Up to 192 GBytes/s',全家族口径唯一无冲突) | 4.0TB/s(三源一致;显存位宽6144bit仅第三方数据库搜索摘要提及,未实抓双源,不录) |
| 显存位宽 | 256bit | — |
| 算力 | FP32 5.5 TFLOPS / INT8(DP4A) 22 TOPS(均标'* With Boost Clock Enabled';Pascal一代无Tensor Core;官方无INT4/FP64列,宁缺勿编) | FP8 Tensor Core 296 TFLOPS(密集)/592 TFLOPS(2:4稀疏,单源);FP16/BF16 Tensor Core 148 TFLOPS(密集,单源;稀疏口径未双源实抓);TF32 Tensor Core 74 TFLOPS;FP32 44 TFLOPS;FP64 1.0 TFLOPS(合规裁剪:H100 SXM同表FP8 3958/FP16 1979/FP64 34);INT8 296 TOPS/592 TOPS(单源) |
| CUDA核心 | 2560(20 SM × 128,官方brief与新闻稿一致) | 14,592 FP32 CUDA核心(单源VipraTech) |
| 功耗 | 75W(SKU 200,699-2G414-0200-100)/ 50W(SKU 201,699-2G414-0201-100);整卡全部由PCIe插槽供电,官方brief供电规格无任何外接辅助供电行(对照同场发布的P40用户指南明列CPU 8-pin) | 400W TDP(Flopper/VipraTech规格表/腾讯新闻'热设计功耗400W'三源;VipraTech正文另有350W矛盾口径已弃) |
| 互联 | PCIe Gen3 x16(brief:PCI Express 3.0 ×16,支持Lane and polarity reversal);无NVLink(官方brief/datasheet均无NVLink行;Pascal代NVLink为GP100/P100 SXM2专属) | NVLink 900GB/s(VipraTech+腾讯新闻双源;第几代NVLink无实抓双源,不录代数)+PCIe Gen5 x16 128GB/s(VipraTech实抓,BurnCloud旁证Gen5) |
| 发布年 | 2016(官方新闻稿dateline BEIJING 2016-09-12,P4与P40同稿发布,即GTC China场合;2016-11上市;datasheet Sep16版;brief v01 2017-02-15) | 2024(Flopper实抓Launch Year 2024;腾讯新闻2023-11-10首发报道'即将推出';具体发布日未实抓双源,不录) |
| 形态 | 单槽半高(Low-Profile)半长 6.6英寸被动卡:68.58mm(2.7in,高) × 167.64mm(6.6in,长),整卡240g(含螺丝挡板另计9.7g半高挡板/15.6g ATX挡板),被动散热需机箱风道(支持双向进风),无显示输出 | HGX 8路SXM基板模组(Flopper'SXM'/VipraTech'8-way HGX'/腾讯新闻'HGX方案8路GPU配置+H20 SXM';同批L20/L2为PCIe形态) |
| 时钟 | Base 885 MHz / Max Boost 1531 MHz(默认Boost 1113 MHz)/ Idle 405 MHz;显存时钟 Performance 2.8 GHz(brief Table 2原文) | — |
| 媒体引擎 | 1×解码引擎 + 2×编码引擎(datasheet:1x Decode Engine, 2x Encode Engine);官方口径35路HD(720p30) H.264实时转码+推理并发;官方15X低延迟vs上代M4/CPU、60X能效vs CPU(TensorRT+INT8场景) | — |
| 视频转码定位 | 史上部署量最大的视频转码/边缘推理卡:半高单槽75W使其可进1U/2U服务器与NAS机箱, hyperscale视频AI服务(DeepStream生态)与自建NAS转码双场景通吃 | — |
| 可靠性 | MTBF 1,677,428小时@35°C(非受控环境)/ 工作温度0-55°C / VBIOS 4Mbit EEPROM,UEFI Supported | — |
| L2缓存 | — | 60MB(单源VipraTech) |
| MIG切片 | — | 最多7实例(VipraTech+腾讯新闻'7路MIG'双源) |
| 编解码器 | — | 7 NVDEC + 7 NVJPEG(单源VipraTech) |
| 出口合规背景 | — | 2022-10美国出口管制后对华合规特供卡:算力密度较H100大幅裁剪(FP8约为H100 SXM的7.5%),以显存96GB+NVLink900GB/s保推理场景(QQ:综合算力约H100的20%) |