NVIDIA第一代CPU+GPU超级芯片:1颗72核Grace(480GB LPDDR5X ECC)+1颗Hopper GPU(96GB HBM3或144GB HBM3e全球首款HBM3e处理器)合封,NVLink-C2C 900GB/s一致性互联(7x PCIe Gen5),快存合计最高624GB;FP8 3,958 TFLOPS稀疏|1,979稠密与FP64 34/67 TFLOPS双修,HPC-AI融合战绩机型(ISC 2024九台新超算/200 exaflops,JUPITER主体23,536颗,Green500榜首JEDI);2022-03-22 GTC首发、2023-05全面投产、HBM3e版2024 Q2上市、官方页现行'currently available'——采购按两代显存(96/144GB)与LPDDR5X档位(120/240/480GB)分清配置,合同写明功耗档(450-1000W可配置)与C2C实测验收|口径:单超级芯片=1 Grace CPU+1 Hopper GPU,区别于GH200 NVL2(双芯片)与DGX GH200(256颗系统)|厚词条:/wiki/gh200.html(Green500/624GB快存/C4 datasheet全表)已上线,本卡为薄卡互链版,规格重抓独立核对一致
GH200是NVIDIA推出的第一代CPU+GPU超级芯片,将一颗72核Arm Neoverse V2架构的Grace CPU与一颗Hopper架构GPU通过NVLink-C2C一致性互联合封于单一模组。Grace侧配备LPDDR5X ECC内存(120GB、240GB、480GB多档),GPU侧提供96GB HBM3或144GB HBM3e两代显存配置,CPU与GPU快存合计最高可达624GB。CPU与GPU之间以900GB/s的一致性互联通信,官方口径为PCIe Gen5方案的多倍带宽。该芯片兼顾传统高性能计算与AI训练推理负载,在超级计算领域有规模化部署,典型用途包括大规模科学计算、大模型训练与图神经网络等场景。
| 架构 | GH200 Grace Hopper超级芯片=NVIDIA第一代CPU+GPU单封装超级芯片:1颗Grace CPU+1颗Hopper GPU经NVLink-C2C一致性互联合封(datasheet直证'the groundbreaking performance of the NVIDIA Hopper GPU with the versatility of the NVIDIA Grace CPU in a single superchip');GPU本体datasheet文字口径为'Hopper H100 GPU'(第九代数据中心GPU,第四代Tensor Core+Transformer Engine+MIG),现行官方页营销口径称'H200 GPU'——同一颗Hopper GPU两代官方命名,如实并记;风冷/液冷双形态(datasheet直证) |
| 显存 | 96GB HBM3 或 144GB HBM3e(两代配置,4TB/s / 4.9TB/s) |
| 显存类型 | HBM3(一代)/HBM3e(二代,全球首款HBM3e处理器)+LPDDR5X ECC(CPU侧),datasheet直证 |
| 显存位宽 | 未收录(GH200 datasheet/白皮书/现行官方页均未单列GPU显存位宽,宁缺勿编) |
| 显存带宽 | 96GB HBM3版 Up to 4TB/s;144GB HBM3e版 Up to 4.9TB/s(datasheet全表直证;白皮书补充HBM3e'1.5X more bandwidth than an H100 80GB SXM';NVL2双芯片10TB/s=9.8TBs四舍五入,官方页口径) |
| 算力 | 单超级芯片口径(datasheet全表直证,*为With sparsity稀疏档):FP8 Tensor Core 3,958 TFLOPS*|1,979 TFLOPS稠密(官方页'4 petaFLOPS'即FP8稀疏档四舍五入);FP16 TC 1,979*|990;BF16 TC 1,979*|990;TF32 TC 989*|494;INT8 TC 3,958*|1,979 TOPS;FP64 34 TFLOPS/FP64 Tensor Core 67 TFLOPS/FP32 67 TFLOPS(HPC双修阵地);NVL2双芯片列:FP8 7,916*|3,958/FP64 68/FP64 TC 134(datasheet直证);DGX GH200系统级1 EFLOPS口径见厚词条 |
| 功耗 | 可配置 450-1000W(Memory+CPU+GPU 合计) |
| 互联 | NVLink-C2C 900GB/s总带宽=450GB/s每方向(datasheet'900GB/s'+白皮书Table 1'900GB/s total, 450GB/s per direction'直证;官方页'7X faster than PCIe Gen5';Jülich独立直证450GB/s每方向互证);对PCIe Gen5带宽7x/功耗降5x口径见官方新闻稿与厚词条;PCIe扩展:最高4x PCIe x16 Gen5(64 lanes,datasheet直证);NVL2双芯片C2C 1800GB/s |
| 发布年 | 2022(2022-03-22 GTC官方新闻稿首发'Grace Hopper Superchip——an integrated module designed to serve giant-scale HPC and AI applications'直证);节奏:2023-05-28全面投产(官方稿,检索引文级)→2023-08-08 HBM3e版宣布(系统Q2 CY2024交付,官方稿直证)→2024-05-12 ISC 9台新超算/合计200 exaflops(官方稿直证)→现行官方页'GH200 is currently available' |
| CPU部分 | Grace CPU:72核Arm Neoverse V2(datasheet直证);基频3.1GHz|全核SIMD 3.0GHz;L1 64KB i-cache+64KB d-cache/L2 1MB每核/L3 114MB(datasheet直证);LPDDR5X ECC最高480GB(另有120GB/240GB档,datasheet直证;JEDI/JUPITER实配120GB档,Jülich直证);CPU内存带宽datasheet表两档Up to 384GB/s|Up to 512GB/s并列,白皮书文字口径'up to 500GB/s'(档位映射官方未逐一标注,Jülich 120GB档标500GB/s) |
| SM与CUDA核 | 未收录(GH200 datasheet MAR25版/39页架构白皮书/现行官方页均未单列GPU SM数与CUDA核数,宁缺勿编;GPU为Hopper H100/H200同代die,按H100 SXM对表132SM/16896核仅为旁推,不作为本卡数值) |
| 快存合计 | 最高624GB(datasheet Key Features'Up to 624GB of fast-access memory'+官方页'up to 624GB of combined CPU and GPU fast memory'双直证;=480GB LPDDR5X+144GB HBM3e,datasheet配置直证;HBM3版为480+96=576GB,lambda等云上配置口径,推导注记);NVL2双芯片1.2TB(datasheet/官方页直证) |
| 机密计算 | 未收录(本次实抓datasheet/白皮书/官方页未见GH200保密计算条目,宁缺勿编) |
| 编解码器 | 未收录(官方现行信源未见GH200编解码器数量条目,宁缺勿编) |
| MIG切片 | 支持MIG(datasheet直证'Secure Multi-Instance GPU (MIG) partitions the GPU into isolated, right-size instances');实例数官方未单列,宁缺勿编 |
| 形态 | 单超级芯片模组(风冷/液冷,可上标准服务器,datasheet直证'GH200 can be easily deployed in standard servers');系统级形态:GH200 NVL2(2x超级芯片NVLink互联,datasheet全列直证)/DGX GH200(256x GH200 NVLink Switch System,厚词条已录)/MGX服务器变体超100种(2023-08-08官方稿直证)/JUPITER Booster 4芯片节点x5884(Jülich直证) |
| 战绩 | Green500能效榜首JEDI(JUPITER开发机,TOP500口径,厚词条已录);ISC 2024全球9台新超算采用GH200合计200 exaflops能效AI算力(官方稿直证);JUPITER主体5884节点x4颗=23,536颗GH200,1 ExaFLOP/s FP64 HPL+大于70 ExaFLOP/s 8-bit稀疏(Jülich官方技术页直证) |
| 型号 | 显存 | 功耗 |
|---|
| NVIDIA T4 对比 | 16GB GDDR6 with ECC (默认开启) | 70W (Total board power, 默认) |
| NVIDIA A100 对比 | 40GB HBM2 / 80GB HBM2e 双版本(80GB 版 2020-11-16 SC20 增发),带 ECC | SXM4 400W(40GB/80GB 同);PCIe 版 40GB 250W / 80GB 300W |
| NVIDIA H20 对比 | 96GB HBM3(Flopper/VipraTech/腾讯新闻三源一致) | 400W TDP(Flopper/VipraTech规格表/腾讯新闻'热设计功耗400W'三源;VipraTech正文另有350W矛盾口径已弃) |
| NVIDIA GB300 对比 | 288GB HBM3e(单GPU封装;超级芯片576GB;HGX板级2.1TB/机柜20TB并存) | TGP 最高 1400W(单GPU,官方博客直证) |
| NVIDIA A30 对比 | 24 GB HBM2 | 165 W |
| NVIDIA GeForce RTX 4090 对比 | 24GB GDDR6X | 450W TGP (平均游戏315W, 建议系统电源850W) |