史上部署量最大的推理卡之一: 70W插槽供电单槽半高被动卡, 任何服务器都能插, INT8 130 TOPS多精度推理+38路视频解码两用, 各大云厂商T4实例(如AWS G4dn 8卡机)规模化铺了海量存量, 是二手市场货源最充沛的入门推理卡
NVIDIA T4 是一款基于 Turing(图灵)架构的 PCIe 加速卡,采用 TU104 GPU,配备 320 个 Tensor Core 与 40 个 RT Core。显存为 16 GB GDDR6,位宽 256 bits,通过 x16 PCIe Gen3 接口与主机相连。其典型精度性能为单精度 8.1 TFLOPS、混合精度 65 TFLOPS、INT8 130 TOPS、INT4 260 TOPS。T4 采用单槽半高半长的被动散热设计,整机板卡功耗上限 70 W,无需外接供电,可适配高密度服务器。它同时支持深度学习推理与视频解码加速,是云端推理实例和边缘服务器中部署极为广泛的通用推理卡。
| 架构 | Turing (TU104-895) |
| 显存 | 16GB GDDR6 with ECC (默认开启) |
| 显存带宽 | 320GB/s (早期一页版datasheet口径300GB/s) |
| 显存位宽 | 256bit |
| 算力 | FP32 8.1 TFLOPS / FP16·FP32混合精度 65 TFLOPS / INT8 130 TOPS / INT4 260 TOPS |
| CUDA核心 | 2,560 (40 SM) / Tensor Core 320 / RT Core 40 (白皮书口径) |
| 功耗 | 70W (Total board power, 默认) |
| 互联 | PCIe Gen3 x16 (支持x8运行, Interconnect BW 32GB/s) |
| 发布年 | 2018 (Product Brief v01 2018-10-24初版, Dec18版datasheet © 2018 NVIDIA) |
| 形态 | 单槽半高半长 Low-Profile 6.6英寸(长169.53mm), 被动散热, 板重301g |
| 时钟 | Base 585MHz / Boost 1590MHz (Base为70W功耗墙下调校) |
| 媒体引擎 | 1080p30解码 H.264 32路 / HEVC 44路 / VP9 32路 (白皮书Table 2, 官方页称38路full-HD) |
| SR-IOV | Supported; 16 VF(支持) |
| 工艺 | 12nm FFN, 136亿晶体管, 545mm2 (白皮书TU104口径) |
| Compute APIs | CUDA, NVIDIA TensorRT, ONNX |