| 规格 | NVIDIA T4 | NVIDIA H200 NVL |
|---|
| 架构 | Turing (TU104-895) | NVIDIA Hopper |
| 显存 | 16GB GDDR6 with ECC (默认开启) | 141GB |
| 显存带宽 | 320GB/s (早期一页版datasheet口径300GB/s) | 4.8TB/s |
| 显存位宽 | 256bit | — |
| 算力 | FP32 8.1 TFLOPS / FP16·FP32混合精度 65 TFLOPS / INT8 130 TOPS / INT4 260 TOPS | — |
| CUDA核心 | 2,560 (40 SM) / Tensor Core 320 / RT Core 40 (白皮书口径) | — |
| 功耗 | 70W (Total board power, 默认) | — |
| 互联 | PCIe Gen3 x16 (支持x8运行, Interconnect BW 32GB/s) | 2- or 4-way NVIDIA NVLink bridge: 900GB/s per GPU | PCIe Gen5: 128GB/s |
| 发布年 | 2018 (Product Brief v01 2018-10-24初版, Dec18版datasheet © 2018 NVIDIA) | — |
| 形态 | 单槽半高半长 Low-Profile 6.6英寸(长169.53mm), 被动散热, 板重301g | PCIe Dual-slot air-cooled |
| 时钟 | Base 585MHz / Boost 1590MHz (Base为70W功耗墙下调校) | — |
| 媒体引擎 | 1080p30解码 H.264 32路 / HEVC 44路 / VP9 32路 (白皮书Table 2, 官方页称38路full-HD) | — |
| SR-IOV | Supported; 16 VF(支持) | — |
| 工艺 | 12nm FFN, 136亿晶体管, 545mm2 (白皮书TU104口径) | — |
| Compute APIs | CUDA, NVIDIA TensorRT, ONNX | — |
| 显存类型 | — | HBM3e |
| FP64算力 | — | 30 TFLOPS |
| FP64 Tensor Core | — | 60 TFLOPS |
| FP32算力 | — | 60 TFLOPS |
| FP8算力 | — | 3,341 TFLOPS |
| FP16算力 | — | 1,671 TFLOPS |
| INT8算力 | — | 3,341 TFLOPS |
| 功耗TDP | — | Up to 600W (configurable) |
| MIG切片 | — | Up to 7 MIGs @16.5GB each |
| 编解码器 | — | 7 NVDEC | 7 JPEG |
| 机密计算 | — | Supported |