
GB300 NVL72(全称 NVIDIA GB300 NVL72,Blackwell Ultra 平台旗舰形态)是 NVIDIA 于 2025 年 3 月 18 日在 GTC 发布的机柜级超节点:把 72 颗 Blackwell Ultra GPU 和 36 颗 Grace CPU 装进一个全液冷机柜,第五代 NVLink 全互联合计 130TB/s——整个机柜在软件眼里是一颗加速器[1][3]。
它是对话里「NVL72」三个字的载体:N=NVLink 域,72=一个域里的 GPU 数。官方口径对上代 GB200 NVL72 提速 1.5 倍,FP4 Tensor Core 官方规格 1,440 PFLOPS(dense)、GPU 显存合计 20TB HBM3e、供电 132kW 级——机柜级交付意味着买它之前先要有一个能放下它的机房[1][2][3]。
2026 年的现货市场,GB300 NVL72 是大规模训练与推理工厂的舰队旗舰:2025 年 8 月 CoreWeave 率先把它搬上公有云,2026 年 9 月 MLPerf Inference v6.1 首秀给出公开成绩,同轮下一代 Vera Rubin NVL72 也已亮相(最高 3.7× 于 GB300,公开口径[6])——旗舰的位置从不等人,但部署门槛与整机价格同样是一个量级的存在(见「散热与部署」与「行情带」)。
萬安指数(0–100):本库按公开规格加权估算——机柜显存规模 40% + 互联 30% + 生态 30%,按场景调权,机柜级估算口径(与单卡词条口径不可互比)。90+ 旗舰级 · 75+ 优秀 · 60+ 可用 · 60 以下不适用。方法透明可复核,不构成性能承诺。
2025 年 3 月 18 日,GTC keynote 发布 Blackwell Ultra 平台:官方口径 GB300 NVL72 对 GB200 NVL72 提速 1.5 倍,Cisco / Dell / HPE / Lenovo / Supermicro 等 16 家伙伴同年下半年起交付整柜,每 GPU 配 ConnectX-8 SuperNIC 800Gb/s[3]。
2025 年 7-9 月,首批系统落地:CoreWeave 7 月宣布首批 GB300 NVL72 到位,8 月 19 日全球首个 GB300 NVL72 云实例正式商用(Dell 交付),其三季报以「First to deploy NVIDIA GB300 NVL72 systems」入档;Quanta 9 月起出货[8]。
2026 年 9 月,MLPerf Inference v6.1:GB300 NVL72 完成 MLPerf 首秀,MoE 基准对上代最高 2.5 倍提升;同轮下一代 Vera Rubin NVL72 亦首秀,Qwen3-VL 交互场景最高 3.7 倍于 GB300(NVIDIA 官方博客口径)——公开基准里第一次同台出现「现役旗舰 vs 继任者」[6][7]。
对华口径(中性):GB300 属美国出口管制标的,未在对华获批清单(2026-10 公开口径;美方对顶尖芯片对华许可持「推定拒绝」政策,2026 年 1 月 BIS 新规框架延续);2026 年 7 月获批放量入华的是 H200,GB300 级未获批——现货流通以海外及自贸区渠道为主。本库仅记录公开报道口径,不构成法律意见[10]。
| 项目 | 规格(GB300 NVL72 机柜级 · 官方口径) |
|---|---|
| 配置 | 72× Blackwell Ultra GPU + 36× Grace CPU(2,592× Arm Neoverse V2 核心) |
| FP4 Tensor Core | 1,440 PFLOPS(dense)/ 10,802 PFLOPS(稀疏)——发布报道与伙伴目录另有「1.1 EFLOPS 级 FP4 推理」口径 |
| FP8 / FP6 Tensor Core | 720 PFLOPS |
| FP16 / BF16 · TF32 | 360 / 180 PFLOPS |
| FP64 | 100 TFLOPS |
| GPU 显存合计 | 20TB HBM3e(288GB/卡 × 72 = 20.7TB,推算口径),带宽最高 576TB/s |
| CPU 内存合计 | 17TB LPDDR5X(带宽 14TB/s);快速内存合计 37TB |
| 卡间互联 | NVLink 第五代 · 合计 130TB/s(每 GPU 1.8TB/s)+ 9× NVSwitch 托盘全互联 |
| 机柜结构 | 18× 计算托盘(每托 4 GPU + 2 Grace)+ 9× NVSwitch 托盘 + 8× 33kW 电源架 |
| 散热 | 全液冷(fully liquid-cooled);机内 CDU 250kW 级;托盘级 + 机柜级漏液检测 |
| 供电 | 132kW 配置级(8× 33kW 电源架);NVIDIA 参考架构满载最高 142kW |
| 外部网络 | 每 GPU 800Gb/s(ConnectX-8 SuperNIC ×4/托盘)+ BlueField-3 DPU;Quantum-X800 InfiniBand / Spectrum-X Ethernet 扩展 |
| 上代 / 下代 | GB200 NVL72(提速 1.5 倍之差)/ Vera Rubin NVL72(2026-09 首秀) |
规格以 NVIDIA 官方公开资料为准[1][2];FP4 dense 为官方规格页无稀疏口径,1.1 EFLOPS 为发布/伙伴目录口径,两档并存各注出处;Tensor 算力除注明外均为含稀疏口径;机柜配置因 OEM 与批次存在差异。
| 项目 | 单个计算托盘(×18) |
|---|---|
| GPU | 4× Blackwell Ultra(合计 1,152GB HBM3e) |
| CPU | 2× Grace(72 核 ×2,合计 1TB LPDDR5X) |
| 机内网络 | 4× ConnectX-8(800Gb/s 各)+ 1× BlueField-3 DPU |
| 互联界面 | 后部 NVLink 线缆托(cable cartridge)盲插对接 NVSwitch 托盘;液冷接口盲插对接机柜 manifold |
| 运维含义 | 计算托盘可单独抽换维护——托盘级序列号与固件报告是验货最小单元(见「采购与验货」) |
托盘级口径出 NVIDIA 参考架构文档[2]。
| 项目 | GB200 NVL72 | GB300 NVL72 |
|---|---|---|
| GPU | 72× Blackwell | 72× Blackwell Ultra |
| 单卡显存 | 192GB HBM3e | 288GB HBM3e |
| GPU 显存合计 | 13.8TB(推算口径) | 20.7TB(推算口径;官方页 20TB) |
| 官方相对性能 | 基准 | 1.5× AI performance(新闻稿口径) |
| 网络 | ConnectX-7 400G | ConnectX-8 800G |
GB200 列为公开口径对照,详见 NVIDIA 官方资料;两代均为全液冷、36× Grace 架构。
GB300 家族按形态分四支,本库在售以 GB300 NVL72 整柜与 DGX GB300 为主力(大陆语境的 B300 NVL8 风冷整机见 B300 词条):
GB300 NVL72 只有液冷一种形态:计算托盘与 NVSwitch 托盘全部冷板液冷,液冷界面为托盘后部盲插接头对接机柜 manifold,机内 CDU 250kW 级(超微口径,冗余电源)驱动二次侧回路;NVIDIA 参考架构要求托盘级 + 机柜级两级漏液检测[2][4]。部署它不是「买台服务器」,而是一个机房工程项目:


| 模型 / 场景 | 显存需求(FP8 估算) | GB300 NVL72 部署(单柜 20.7TB 推算口径) | 萬安指数 |
|---|---|---|---|
| DeepSeek R1 满血(671B)多副本推理 | 约 690GB / 副本 | 单柜可同驻 20+ 副本(权重口径推算,未含 KV cache)——高并发推理工厂的底气 | 96 |
| 万亿参数级 MoE 训练 | 权重+优化器状态 TB 级 | 72 卡 NVLink 域内张量/专家并行,梯度不出柜;多柜经 800G 扩展 | 95 |
| 长上下文(百万 token 级) | KV cache 随上下文线性膨胀 | 20TB 池化显存给 KV 留足余量,单柜即可支撑大规模并发长上下文 | 92 |
| 7B-14B 级小模型批量产线 | 约 8-30GB / 实例 | 能跑但「杀鸡用牛刀」——这类产线用 B300 NVL8 / H200 更划算(经济性口径) | 58 |
显存按 FP8 权重 ≈ 参数量 × 1 字节估算(推算口径,未含 KV cache 与激活余量);萬安指数为本库机柜级估算口径,随实测更新。集群扩展形态(DGX SuperPOD / 多柜 InfiniBand 互连)以 NVIDIA 参考设计为准。






实拍图随验货批次上架持续补充;官方渲染图不冒充实拍,AI 生成图不冒充实拍。
本片为 GB300 NVL72 专属机柜级部署视角(整柜就位 → 供电 → 液冷 → 网络 → 上电验收),参数与判例均为 GB300 NVL72 实锚,旁白与场景文本存档见仓库 _wiki_work_1006/gen_tts_gb300.py。
| 项目 | 要求 / 现状 |
|---|---|
| CUDA / 驱动 | 与 B300 同代同栈:Blackwell 世代支持线(CUDA 12.8 起完整支持),详见 B300 词条与 NVIDIA 官方文档 |
| 集合通信 | NCCL 对 NVLink5 / NVSwitch 全互联原生优化——机柜级验收以 nccl-tests 全机联测为准(见「如何验收」) |
| 集群管理 | NVIDIA Base Command / DGX SuperPOD 参考设计;第三方 Slurm / Kubernetes 生态通用(公开口径) |
| 推理引擎 | vLLM / SGLang / TensorRT-LLM 均支持 Blackwell Ultra(FP4 路径为世代新特性,以各引擎发布为准) |
| 网络配套 | Quantum-X800 InfiniBand / Spectrum-X Ethernet 800G 光互连(多柜扩展) |
| 运维监控 | DCGM / 托盘级带外管理(SN2201 带外交换机)——RAS 事件计数是机柜验收的硬指标 |
软件栈版本随时间演进,以 NVIDIA 官方发布为准;生态成熟度判断详见 B300 词条(同代共享)。
GB300 NVL72 采购的验货要点(三项,机柜级口径):
机柜级验收五项判例见本词条「如何验收」节。
机柜级验收五项口径(与单卡压测是两套体系,数值判例全部按 GB300 NVL72 实锚):上电自检 → 液冷标定 → 整机功耗 → NCCL 全机联测 → RAS 事件计数。
本节为机柜级验收口径,与单卡词条「如何压测」六项判例不通用;≥85% 等比例线为本库验收口径(推算),最终以 OEM 验收规范为准。
同一套 GB300 NVL72 参考架构,各家整柜差在交付、液冷配套与服务——选型先看区别(本库在售已覆盖超微 / Dell 口径):
| 整机厂 | 代表形态 | 差异点 | 适合谁 |
|---|---|---|---|
| Supermicro 超微 | SRS-GB300-NVL72(本库在售口径) | 机内 CDU 250kW 级、8× 33kW 电源架整柜交付,液冷配套自家闭环[4] | 现货采购 · 液冷配套一站式 |
| Dell 戴尔 | GB300 NVL72 整柜(本库在售口径;CoreWeave 首批交付方) | 全球一线服务网络,公有云大单交付经验[8] | 跨国部署 · 要服务 |
| NVIDIA 官方 | DGX GB300 / DGX SuperPOD | 官方一体交付 + 全栈软件(本库在售 31 处 USD 口径) | 要开箱即训 · 要原厂支持 |
| Lenovo / HPE / Cisco | GB300 NVL72 整柜 | 企业级服务网络(新闻稿伙伴名单口径[3]) | 企业客户渠道采购 |
| Wiwynn / 和碩 / Quanta 等 | ODM 整柜 / 代工 | 云厂商供应链后端(CoreWeave 等的交付形式之一) | 云厂商大单 · ODM 渠道 |
| 整机厂 | 安装简易 | 维护便利 | 性能密度 | 寿命预期 |
|---|---|---|---|---|
| Supermicro 超微 | 72 | 80 | 95 | 82 |
| Dell 戴尔 | 78 | 88 | 95 | 85 |
| NVIDIA 官方 | 82 | 85 | 94 | 85 |
| Lenovo / HPE / Cisco | 76 | 86 | 94 | 84 |
| ODM(Wiwynn/和碩/Quanta) | 68 | 72 | 95 | 80 |
整机厂信息来自各家官方发布与公开评测(如 ServeTheHome);萬安指数为本库机柜级估算口径(0–100,估分依据=整柜交付形态、液冷配套与服务网络差异;「安装简易」普遍低于风冷 8 卡整机,属机柜级部署的客观属性而非厂商短板),随实机验证更新,不构成采购承诺。具体型号以厂商官方发布为准。
N=NVLink 域,72=域内 GPU 数。72 颗 GPU 经 NVSwitch 全互联成一个 NVLink 域,对软件呈现为一颗「巨型加速器」——这是「超节点」的含义,也是机柜级产品与 8 卡整机的本质区别。
机柜的最小计算单元:每托 4× Blackwell Ultra(合计 1,152GB HBM3e)+ 2× Grace(合计 1TB LPDDR5X),共 18 托。托盘可单独抽换——托盘级序列号与固件报告是机柜验货的最小可信单元。
9 个交换托盘承接 72 卡的全互联:计算托盘经后部 NVLink 线缆托(cable cartridge)盲插对接交换托盘,构成非阻塞 P2P 矩阵——合计 130TB/s 的 NVLink5 带宽由此而来。
CDU(Coolant Distribution Unit,冷量分配单元)机内 250kW 级,驱动二次侧液冷回路;计算托盘与机柜 manifold 之间是盲插(blind-mate)接头——托盘推入即接通液路。托盘级+机柜级两级漏液检测是标配。
NVIDIA 的 Arm 架构 CPU(Neoverse V2,72 核),每柜 36 颗、每托 2 颗,配 LPDDR5X 内存(合计 17TB)。Grace 负责「喂饱」GPU:数据预处理、通信与调度,GPU↔CPU 经 NVLink-C2C 互连。
GB300 属美国对华出口管制标的、未在对华获批清单(2026-10 公开口径);现货流通以海外及自贸区渠道为主。批次与报关路径影响保修与保值,验货必查。本库表述均为公开报道口径,不构成法律意见。
| 日期 | 口径 | 区域 | 参考价带 | 说明 |
|---|---|---|---|---|
| 2026-10-09 | 大厅实时 | 美国(USD) | $323万 – 424万 | 28 处报价 ›(整柜要价口径) |
| 2026-10-09 | 大厅实时 | 中国大陆 | ¥4,088万 – 10,918万 | 24 处报价 ›(整柜要价口径 · 海外及自贸区渠道语境) |
| 2026-10-09 | 大厅实时 | 中东(AED) | AED 2,292万 – 2,814万 | 39 处报价(整柜要价口径) |
| 2026-10-09 | 大厅实时 | 欧洲(EUR) | €467万 – 572万 | 38 处报价(整柜要价口径) |
| 2026-10-09 | 大厅实时 | 新加坡(SGD) | S$943万 – 1,173万 | 31 处报价(整柜要价口径) |
| 2026-10-09 | 大厅实时 | 日本(JPY) | JPY 105,399万 – 130,125万 | 26 处报价(整柜要价口径) |
| 2025-12 | 渠道参考 | 全球 | 上代 GB200 NVL72 约 $300 万 / 柜 | 公开报道口径[9] · GB300 官方无标价 · 在售整柜 › |
| 2026-10-09 | 政策口径 | 中国大陆 | 未在对华获批清单 | GB300 属美国出口管制标的,现货流通以海外及自贸区渠道为主(公开报道口径,不构成法律意见) |
口径:不做推算带——GB300 NVL72 无公开价格史锚,曲线仅呈现本库快照实测:中国大陆锚定在售整柜报价(¥4,041.9-4,529.0 万 · 15 处,2026-10-08 起),北美/欧洲/新加坡/日本/中东按行情快照逐日积累(USD 344.4-422.9 万 · 25 处等,均为原币种口径、互不折算)。GB300 未在对华获批清单,大陆报价为海外及自贸区渠道语境(公开报道口径,不构成法律意见)。本库价格数据来源:萬安算交所(0 佣金撮合、不参与交易,不掌握亦不推测成交价,数据因此中立)。实际以货主报价为准。
NVIDIA 2025 年 3 月 GTC 发布的 Blackwell Ultra 超节点机柜:72 颗 Blackwell Ultra GPU + 36 颗 Grace CPU 装进一个全液冷机柜,NVLink5 全互联合计 130TB/s,对软件呈现为一颗加速器。FP4 Tensor Core 官方规格 1,440 PFLOPS(dense 口径),GPU 显存合计 20TB HBM3e。
看机房与规模:NVL72 需 132kW 级供电、CDU 液冷与承重改造,换来 20TB 显存一个 NVLink 域,是大规模训练与推理工厂形态;NVL8 单卡 288GB、整机 2.3TB,存量机房分批部署。有机房改造预算上 NVL72,没有就 NVL8 起步(本库在售两形态都有,见行情带)。
GB300 属美国出口管制标的,未在对华获批清单(2026-10 公开口径,2026 年 7 月获批放量入华的是 H200);现货流通以海外及自贸区渠道为主。本条为公开报道口径,不构成法律意见,采购前请以主管部门政策与专业合规意见为准。
NVIDIA 官方页口径 20TB HBM3e(288GB/卡 × 72 = 20.7TB,推算吻合;Red Hat 认证目录同口径);渠道早期资料有 18TB 写法(本库部分在售 config 串仍见)。以官方 20TB 为准,询价与合同按此核对,验收以托盘级固件报告实测为准。
不适用——机柜级是另一套验收体系:上电自检(18+9 托盘逐一报到位)、液冷标定(CDU 流量/温差/漏液检测零告警)、整机功耗(满载 132-142kW 级对齐)、NCCL 全机联测(72 卡 all_reduce 对 NVLink5 标称)、RAS 事件计数(无未纠正 ECC 与中断)。逐托序列号验真是机柜验货的最小可信单元(见「如何验收」)。