| 规格 | NVIDIA GH200 | NVIDIA A100 |
|---|
| 架构 | GH200 Grace Hopper超级芯片=NVIDIA第一代CPU+GPU单封装超级芯片:1颗Grace CPU+1颗Hopper GPU经NVLink-C2C一致性互联合封(datasheet直证'the groundbreaking performance of the NVIDIA Hopper GPU with the versatility of the NVIDIA Grace CPU in a single superchip');GPU本体datasheet文字口径为'Hopper H100 GPU'(第九代数据中心GPU,第四代Tensor Core+Transformer Engine+MIG),现行官方页营销口径称'H200 GPU'——同一颗Hopper GPU两代官方命名,如实并记;风冷/液冷双形态(datasheet直证) | NVIDIA Ampere (GA100),第3代 Tensor Core |
| 显存 | 96GB HBM3 或 144GB HBM3e(两代配置,4TB/s / 4.9TB/s) | 40GB HBM2 / 80GB HBM2e 双版本(80GB 版 2020-11-16 SC20 增发),带 ECC |
| 显存类型 | HBM3(一代)/HBM3e(二代,全球首款HBM3e处理器)+LPDDR5X ECC(CPU侧),datasheet直证 | — |
| 显存位宽 | 未收录(GH200 datasheet/白皮书/现行官方页均未单列GPU显存位宽,宁缺勿编) | 5120bit |
| 显存带宽 | 96GB HBM3版 Up to 4TB/s;144GB HBM3e版 Up to 4.9TB/s(datasheet全表直证;白皮书补充HBM3e'1.5X more bandwidth than an H100 80GB SXM';NVL2双芯片10TB/s=9.8TBs四舍五入,官方页口径) | 40GB 版 1,555 GB/s(PCIe/SXM 同);80GB SXM4 版 2,039 GB/s / 80GB PCIe 版 1,935 GB/s(官方 datasheet 四列分列口径) |
| 算力 | 单超级芯片口径(datasheet全表直证,*为With sparsity稀疏档):FP8 Tensor Core 3,958 TFLOPS*|1,979 TFLOPS稠密(官方页'4 petaFLOPS'即FP8稀疏档四舍五入);FP16 TC 1,979*|990;BF16 TC 1,979*|990;TF32 TC 989*|494;INT8 TC 3,958*|1,979 TOPS;FP64 34 TFLOPS/FP64 Tensor Core 67 TFLOPS/FP32 67 TFLOPS(HPC双修阵地);NVL2双芯片列:FP8 7,916*|3,958/FP64 68/FP64 TC 134(datasheet直证);DGX GH200系统级1 EFLOPS口径见厚词条 | FP32 19.5 / FP64 9.7 / FP64 Tensor 19.5 TFLOPS;TF32 156(312*) / BF16 312(624*) / FP16 312(624*) TFLOPS / INT8 624(1248*) TOPS——官方 datasheet 四形态(40G PCIe/80G PCIe/40G SXM/80G SXM)算力同口径,*为稀疏加速 |
| 功耗 | 可配置 450-1000W(Memory+CPU+GPU 合计) | SXM4 400W(40GB/80GB 同);PCIe 版 40GB 250W / 80GB 300W |
| 互联 | NVLink-C2C 900GB/s总带宽=450GB/s每方向(datasheet'900GB/s'+白皮书Table 1'900GB/s total, 450GB/s per direction'直证;官方页'7X faster than PCIe Gen5';Jülich独立直证450GB/s每方向互证);对PCIe Gen5带宽7x/功耗降5x口径见官方新闻稿与厚词条;PCIe扩展:最高4x PCIe x16 Gen5(64 lanes,datasheet直证);NVL2双芯片C2C 1800GB/s | SXM4 版:NVLink 3.0 12链路 600GB/s 双向 + PCIe Gen4 64GB/s;PCIe 版:NVLink Bridge 双卡互连 600GB/s + PCIe Gen4 64GB/s |
| 发布年 | 2022(2022-03-22 GTC官方新闻稿首发'Grace Hopper Superchip——an integrated module designed to serve giant-scale HPC and AI applications'直证);节奏:2023-05-28全面投产(官方稿,检索引文级)→2023-08-08 HBM3e版宣布(系统Q2 CY2024交付,官方稿直证)→2024-05-12 ISC 9台新超算/合计200 exaflops(官方稿直证)→现行官方页'GH200 is currently available' | 2020(40GB 版 2020-05-14 GTC 发布;80GB 版 2020-11-16 SC20 发布) |
| CPU部分 | Grace CPU:72核Arm Neoverse V2(datasheet直证);基频3.1GHz|全核SIMD 3.0GHz;L1 64KB i-cache+64KB d-cache/L2 1MB每核/L3 114MB(datasheet直证);LPDDR5X ECC最高480GB(另有120GB/240GB档,datasheet直证;JEDI/JUPITER实配120GB档,Jülich直证);CPU内存带宽datasheet表两档Up to 384GB/s|Up to 512GB/s并列,白皮书文字口径'up to 500GB/s'(档位映射官方未逐一标注,Jülich 120GB档标500GB/s) | — |
| SM与CUDA核 | 未收录(GH200 datasheet MAR25版/39页架构白皮书/现行官方页均未单列GPU SM数与CUDA核数,宁缺勿编;GPU为Hopper H100/H200同代die,按H100 SXM对表132SM/16896核仅为旁推,不作为本卡数值) | — |
| 快存合计 | 最高624GB(datasheet Key Features'Up to 624GB of fast-access memory'+官方页'up to 624GB of combined CPU and GPU fast memory'双直证;=480GB LPDDR5X+144GB HBM3e,datasheet配置直证;HBM3版为480+96=576GB,lambda等云上配置口径,推导注记);NVL2双芯片1.2TB(datasheet/官方页直证) | — |
| 机密计算 | 未收录(本次实抓datasheet/白皮书/官方页未见GH200保密计算条目,宁缺勿编) | — |
| 编解码器 | 未收录(官方现行信源未见GH200编解码器数量条目,宁缺勿编) | — |
| MIG切片 | 支持MIG(datasheet直证'Secure Multi-Instance GPU (MIG) partitions the GPU into isolated, right-size instances');实例数官方未单列,宁缺勿编 | — |
| 形态 | 单超级芯片模组(风冷/液冷,可上标准服务器,datasheet直证'GH200 can be easily deployed in standard servers');系统级形态:GH200 NVL2(2x超级芯片NVLink互联,datasheet全列直证)/DGX GH200(256x GH200 NVLink Switch System,厚词条已录)/MGX服务器变体超100种(2023-08-08官方稿直证)/JUPITER Booster 4芯片节点x5884(Jülich直证) | SXM4 模组(HGX A100 4/8/16卡、DGX A100 8卡)/ PCIe 双槽 10.5英寸全长 |
| 战绩 | Green500能效榜首JEDI(JUPITER开发机,TOP500口径,厚词条已录);ISC 2024全球9台新超算采用GH200合计200 exaflops能效AI算力(官方稿直证);JUPITER主体5884节点x4颗=23,536颗GH200,1 ExaFLOP/s FP64 HPL+大于70 ExaFLOP/s 8-bit稀疏(Jülich官方技术页直证) | — |
| CUDA核心 | — | 6912 FP32 CUDA(108 SM)/ 第3代 Tensor Core |
| 工艺 | — | TSMC 7nm(N7 定制),54.2B 晶体管,826mm² |
| MIG | — | Multi-Instance GPU 最多 7 硬件隔离实例(40GB 版单实例最高 5GB / 80GB 版 10GB) |