单颗B300=Blackwell Ultra GPU本体,即HGX B300 NVL16 8卡板上的每一颗:288GB HBM3e单封装(B200的1.5x发布口径/1.6x HGX现行),单GPU满血档FP4 20稀疏|15稠密 PFLOPS(稠密对B200 +50%)、TGP 1400W、NVLink 1.8TB/s、PCIe Gen6;代价是INT8砍到1/24、FP64砍到1/30——纯AI推理工厂取向的单卡。2025-03-18 GTC发布、H2 2025出货,2026年现货流通世代,二手/现货询价按单卡288GB HBM3e口径对齐本卡;含Grace CPU的超级芯片口径归GB300卡,8卡板级整机归HGX B300 NVL16词条
NVIDIA B300是基于Blackwell Ultra架构的数据中心GPU,为单封装集成两颗芯片的设计,采用台积电4NP工艺,晶体管规模约208B,含160个SM、640个第五代Tensor Core。显存为288GB HBM3e,总位宽8192-bit,在满血配置下FP4算力为稀疏20、稠密15 PFLOPS,稠密口径较上代Blackwell提升约50%。互联采用NVLink,单向链路由18条链路组成,GPU间双向带宽达1.8TB/s,并支持PCIe Gen6。TGP最高1400W,定位于大规模FP4 AI推理与训练集群,是HGX B300 NVL16八卡板与GB300超级芯片中的核心计算单元。
| 架构 | NVIDIA Blackwell Ultra(Blackwell架构Ultra代,纯GPU本体不含Grace CPU)——单颗B300为TSMC 4NP工艺/2080亿晶体管/双die合体单GPU(官方博客直证'TSMC 4NP and features 208B transistors'+'Dies per GPU: 2');每GPU最高160个SM组织为8个GPC,640个第五代Tensor Core(博客直证);注意力引擎10.7 TeraExponentials/s,官方称对Blackwell'2x higher attention performance'(博客Table 2+NVL72页直证) |
| 显存 | 单封装288GB HBM3e(主值:官方博客Table 2'288 GB HBM3E'直证+DGX B300用户指南'8 x 288 GB = 2.3 TB total'直证);对B200两基准并存——对发布口径192GB为1.5x(博客Table 2并列'192 GB|288 GB'+NVL72页'1.5x larger HBM3E'直证),对HGX现行180GB为1.6x(Lenovo引文'288 GB...compared with 180 GB on the B200');HGX B300板级合计2.1TB(官方页直证,较DGX 2.3TB保守0.2TB);可用容量口径279GB(datasheet检索片段)/268GB(SemiAnalysis检索)旁证级注记 |
| 显存类型 | HBM3e(12-Hi堆栈;官方博客9/24/25修正注记'proper 12 HBM stacks instead of 8'——正文残留'Eight 12-Hi stacks'为已知不一致,按288GB=12x24GB/栈取修正后12栈) |
| 显存位宽 | 8,192bit(官方博客HBM配置原文'16 × 512-bit controllers (8,192-bit total width)'直证) |
| 显存带宽 | 8TB/s每GPU(官方博客直证'8 TB/s per GPU, 2.4x improvement over H100';机柜576TB/s÷72=8TB/s互证) |
| 算力 | 单GPU满血档口径(主值):FP4(NVFP4) TC 20 PFLOPS稀疏|15 PFLOPS稠密(官方博客Table 2'15 | 20 PetaFLOPS'直证+机柜1440|1080÷72互证;稠密对Blackwell 10为1.5x,稀疏20持平);FP8/FP6 TC 10稀疏|5稠密(博客'5 | 10 PetaFLOPS'直证);INT8 TC约375 TOPS稀疏(HGX板级3 POPS÷8,对B200单卡9000 TOPS为24倍代际砍);FP16/BF16 TC 4.5稀疏|2.25稠密(HGX 36÷8);TF32 TC 2.25稀疏(HGX 18÷8);FP32 75 TFLOPS(HGX 600÷8);FP64/FP64 TC 1.25 TFLOPS(HGX 10÷8,对B200 37为~30倍砍——Ultra把Tensor Core面积让位给FP4稠密)。HGX B300板级低功耗档每GPU:FP4 18|13.5(144|108÷8官方直证),不与满血档混写 |
| 功耗 | TGP最高1400W(官方博客Table 2直证'Max power (TGP): Up to 1,400W',对Blackwell 1200W/Hopper 700W);HGX B300为低功耗板级SKU另有约1100W部署档(IntuitionLabs/Lenovo SR680a V4检索引文级,非官方单卡直证,仅注记);DGX B300 8卡整机14.5kW(官方指南直证) |
| 互联 | NVLink第5代 1.8TB/s双向每GPU(官方博客直证'1.8 TB/s bidirectional (18 links x 100 GB/s)'+HGX页'GPU-to-GPU 1.8 TB/s'直证);HGX B300 8卡全互联合计14.4TB/s(官方页直证),双板桥接成NVL16域;PCIe Gen6 x16双向256GB/s(博客Table 1'256 (Gen 6)'直证,对Hopper Gen5 128GB/s翻倍);网络面HGX B300配1.6TB/s(官方页直证),DGX B300配ConnectX-8每GPU 800Gb/s |
| 发布年 | 2025(2025-03-18 GTC发布,官方新闻稿直证;'expected to be available from partners starting from the second half of 2025'出货车官方原文直证;官方HGX页脚注'shipping now'+NVL72页'Available Now'证实现货世代) |
| SM与CUDA核 | 最高160 SM/640个第五代Tensor Core(官方博客直证'160 Streaming Multiprocessors (SMs) across two dies, providing 640 fifth-generation Tensor Cores',脚注'up to 160 SMs');每SM 128 CUDA核+4 Tensor Core+256KB TMEM(博客直证);CUDA核合计20,480个(160x128乘积为推导);SM数对初代Blackwell 144为+11%,对Hopper 132为+21% |
| L2缓存 | 未收录(官方博客/页/新闻稿均未单列B300 L2容量,宁缺勿编) |
| 机密计算 | 未收录(本次实抓B300信源未及保密计算条目,宁缺勿编;Blackwell代际保密计算已在B200卡GTC 2024新闻稿直证,供厚词条另核) |
| 编解码器 | 未收录(官方现行信源未见B300编解码器数量条目,宁缺勿编) |
| MIG切片 | 未收录(本次实抓信源未见B300 MIG实例数官方条目,宁缺勿编) |
| 形态 | SXM模组(Blackwell Ultra SXM,官方HGX页Form Factor直证)——部署形态:HGX B300 NVL16 8卡板级(风冷/液冷,OEM整机厂出货形态;本卡所在位置)/DGX B300 8卡整机14.5kW(官方指南直证)/GB300 NVL72机柜72卡全液冷(纯GPU视角;含Grace CPU的超级芯片口径归GB300卡) |
| 型号 | 显存 | 功耗 |
|---|
| NVIDIA T4 对比 | 16GB GDDR6 with ECC (默认开启) | 70W (Total board power, 默认) |
| NVIDIA A100 对比 | 40GB HBM2 / 80GB HBM2e 双版本(80GB 版 2020-11-16 SC20 增发),带 ECC | SXM4 400W(40GB/80GB 同);PCIe 版 40GB 250W / 80GB 300W |
| NVIDIA H20 对比 | 96GB HBM3(Flopper/VipraTech/腾讯新闻三源一致) | 400W TDP(Flopper/VipraTech规格表/腾讯新闻'热设计功耗400W'三源;VipraTech正文另有350W矛盾口径已弃) |
| NVIDIA GB300 对比 | 288GB HBM3e(单GPU封装;超级芯片576GB;HGX板级2.1TB/机柜20TB并存) | TGP 最高 1400W(单GPU,官方博客直证) |
| NVIDIA A30 对比 | 24 GB HBM2 | 165 W |
| NVIDIA GeForce RTX 4090 对比 | 24GB GDDR6X | 450W TGP (平均游戏315W, 建议系统电源850W) |