| 规格 | NVIDIA B200 (Blackwell 数据中心版, SXM单卡/OAM模组口径) | NVIDIA A100 |
|---|
| 架构 | NVIDIA Blackwell(GB100双die单封装:TSMC 4NP定制工艺,2080亿晶体管,双die经10TB/s NV-HBI片间互联合为单一GPU,官方新闻稿直证;CoWoS-L 2.5D封装为旁证Wikipedia口径) | NVIDIA Ampere (GA100),第3代 Tensor Core |
| 显存 | 三口径如实并存——发布口径192GB HBM3e(旁证Wikipedia产品行'B200 SXM 192GB'+厚词条datasheet口径);HGX B200现行版180GB(官方DGX页'1,440 GB total'÷8直推+Lenovo LP2226标题+Supermicro直证);GB200版186GB(官方GB200 NVL72页超级芯片'372GB'÷2直推)——采购合同按产品线(HGX/GB200)写明口径 | 40GB HBM2 / 80GB HBM2e 双版本(80GB 版 2020-11-16 SC20 增发),带 ECC |
| 显存类型 | HBM3e | — |
| 显存位宽 | 8192bit(旁证Wikipedia数据中心表) | 5120bit |
| 显存带宽 | 8TB/s(官方口径:GB200超级芯片16TB/s÷2直推+DGX B200页'64 TB/s'÷8直推,GB200版为官方直证);OEM现行规格档7.7TB/s(Lenovo LP2226)——8TB/s与7.7TB/s两口径并存,主值取官方8TB/s | 40GB 版 1,555 GB/s(PCIe/SXM 同);80GB SXM4 版 2,039 GB/s / 80GB PCIe 版 1,935 GB/s(官方 datasheet 四列分列口径) |
| 算力 | 单卡口径:FP4 TC 18 PFLOPS稀疏/9稠密(HGX B200 8卡板级144|72官方直证÷8);FP8/FP6 TC 9稀疏/4.5稠密(板级72稀疏官方直证,官方脚注Dense=½Sparse);FP16/BF16 TC 4.5稀疏/2.25稠密(Lenovo OEM单卡直证,板级36);TF32 TC 2.25稀疏(板级18);INT8 TC 9 POPS稀疏(板级72);FP32 75 TFLOPS(板级600);FP64/FP64 Tensor Core 37 TFLOPS(板级296,现行官方口径);除FP4与FP16有OEM单卡直证外,单卡数均为官方板级数÷8推导,稀疏口径Dense减半 | FP32 19.5 / FP64 9.7 / FP64 Tensor 19.5 TFLOPS;TF32 156(312*) / BF16 312(624*) / FP16 312(624*) TFLOPS / INT8 624(1248*) TOPS——官方 datasheet 四形态(40G PCIe/80G PCIe/40G SXM/80G SXM)算力同口径,*为稀疏加速 |
| 功耗 | 单卡最高1000W(官方DGX B200用户指南直证:nvidia-smi单卡功耗上限5PSU供电档1,000W,4-3PSU档800W;Lenovo标1000W TGP,Supermicro按8x1000W设计);GB200机柜版另有1200W可配置上限口径(厚词条/GB200 datasheet口径记录,本次NVL72官方页未见wattage) | SXM4 400W(40GB/80GB 同);PCIe 版 40GB 250W / 80GB 300W |
| 互联 | NVLink第5代 1.8TB/s双向/卡(官方新闻稿直证'1.8TB/s bidirectional throughput per GPU');HGX B200 8卡全互联NVLink合计14.4TB/s(官方页直证);PCIe Gen5(HGX/DGX整机口径;Wikipedia数据中心列标PCIe 6.0,存疑见裁决) | SXM4 版:NVLink 3.0 12链路 600GB/s 双向 + PCIe Gen4 64GB/s;PCIe 版:NVLink Bridge 双卡互连 600GB/s + PCIe Gen4 64GB/s |
| 发布年 | 2024(2024-03-18 GTC发布,官方新闻稿直证;官方称2024年内合作伙伴出货;Wikipedia记载2024Q4上市/产品化2024-12;2025年放量量产爬坡为厚词条财报口径旁证级) | 2020(40GB 版 2020-05-14 GTC 发布;80GB 版 2020-11-16 SC20 发布) |
| SM与CUDA核 | 18,432 FP32 CUDA核/576 Tensor Core(旁证Wikipedia数据中心表;按Blackwell每SM 128核折算约144 SM——推导值,官方未单列) | — |
| L2缓存 | 存疑不采信:Wikipedia数据中心表标60MB(疑单die口径),业界常引双die合计126MB(TechPowerUp系),官方未单列——如实记录冲突,本卡不定值 | — |
| 机密计算 | 支持(官方GTC 2024新闻稿直证'Advanced confidential computing capabilities protect AI models and customer data';另载RAS专用引擎) | — |
| 编解码器 | 未收录(现行官方页与新闻稿均未见B200编解码器数量条目,宁缺勿编) | — |
| MIG切片 | 未收录(本次实抓信源未见B200 MIG实例数官方条目,宁缺勿编) | — |
| 形态 | SXM模组(SXM6封装为旁证Wikipedia口径;部署形态:HGX B200 8卡基板风冷/液冷整机·DGX B200 10RU整机~14.3kW·GB200超级芯片机柜;OAM模组为国内整机厂常用形态口径) | SXM4 模组(HGX A100 4/8/16卡、DGX A100 8卡)/ PCIe 双槽 10.5英寸全长 |
| CUDA核心 | — | 6912 FP32 CUDA(108 SM)/ 第3代 Tensor Core |
| 工艺 | — | TSMC 7nm(N7 定制),54.2B 晶体管,826mm² |
| MIG | — | Multi-Instance GPU 最多 7 硬件隔离实例(40GB 版单实例最高 5GB / 80GB 版 10GB) |