
H20(NVIDIA H20)是 NVIDIA 在美国出口管制政策要求下、专为中国市场开发的对华合规特供数据中心 GPU:Hopper 架构(GH100 衍生),2024 年上市出货,同批还有 L20/L2 等特供型号。它是 A800/H800 特供线在 2023-10 管制升级被纳入管制后的接棒者[2][7]。
它的设计逻辑是一次公开的「交换」:出口管制锁定算力指标,于是 H20 把 Tensor 算力降到 H100 同口径的约十分之一(媒体披露口径),保住了 96GB HBM3 大显存、4.0TB/s 带宽与同代 NVLink 900GB/s 互联——显存与带宽反而高于 H100。这是一张为推理而生的卡,不是为训练而生[1]。
命运几经反复:2025 年 1 月 DeepSeek 热潮引爆扫货(8 卡服务器一度涨至约 110 万元/台,公开报道口径[6]);2025 年 4 月美方一度要求许可、NVIDIA 计提约 55 亿美元;2025 年 7 月获批恢复;此后随政策与采购环境反复,2025 年 12 月 H200 获批对华接棒,H20 逐步退出供给舞台中央(公开报道综合[4][5])。2026 年的现货市场,H20 以早期存量流通为主。
萬安指数(0–100):本库按公开规格加权估算——显存 40% + 互联 30% + 生态 30%,按场景调权。90+ 旗舰级 · 75+ 优秀 · 60+ 可用 · 60 以下不适用。方法透明可复核,不构成性能承诺。
2023 年 10 月 17 日,美国出口管制升级,A800/H800 对华特供纳入许可管理;NVIDIA 转向开发新一轮合规特供——媒体于 2023 年 12 月报道其为中国开发新芯片(后定名 H20,同批含 L20/L2)[2][7]。
2024 年,H20 上市出货(当年出货批次主要为 HBM3 8-Hi 版,TrendForce 口径[3]),搭载 HGX H20 8 卡模组的整机由浪潮、新华三等厂商推向市场;NVIDIA 未开设官方产品页,规格以媒体与整机厂资料为准。上市初期出货遇冷——算力削减叠加国产替代竞争(公开报道口径)。
2025 年是大起大落的一年:1-2 月 DeepSeek 热潮引爆扫货,8 卡服务器从约 100 万涨至约 110 万元/台、大厂大量下单推理负载(财联社报道口径[6]);4 月美方要求对华出口需许可,NVIDIA 计提约 55 亿美元(其中约 25 亿美元 H20 无法出货[3]);7 月 15 日获批恢复销售(后续媒体报道附收入分成安排);8 月起采购环境转趋谨慎、产能收尾传闻与后继芯片曝光见诸报端[4]。
2025 年末至今:12 月 H200 获批对华接棒(HBM3E 显存仍受限,快科技报道口径[5]);2026 年媒体报道英伟达对华 AI 芯片实际销售停滞、本土厂商份额上升(CNBC 2026-02、洛杉矶时报 2026-06[4][8])。H20 的现货角色转为存量流通:早期抢购的整机仍在国内数据中心服役与转售。本库表述均为公开报道口径,不构成法律意见。
口径声明:NVIDIA 未开设 H20 官方产品页(对华特供未列入全球产品线),下表为媒体与整机厂披露口径(TechPowerUp / MIT Technology Review 中国 / TrendForce / 新华三官方文档等多源交叉),标注不一的字段取保守值;以到货固件报告与实测为准。
| 项目 | 规格(H20 · 媒体披露口径) |
|---|---|
| GPU 核心 | NVIDIA Hopper(GH100 对华合规特供衍生) |
| 单卡显存 | 96GB HBM3(升级版约148GB HBM3e · 报道口径) |
| 显存带宽 | 4.0TB/s / 卡(高于 H100 的 3.35TB/s) |
| FP16 / BF16 Tensor Core | 约 148 TFLOPS(稠密口径;稀疏约 296) |
| FP8 Tensor Core | 约 296 TFLOPS(媒体口径) |
| FP32 | 约 44 TFLOPS(媒体口径) |
| 卡间互联 | NVLink 第四代 · 900GB/s(HGX H20 8 卡模组口径) |
| 主机互联 | PCIe Gen5 x16 |
| 单卡功耗 | 约 400W TDP(媒体主流口径;个别渠道页标 350W) |
| CUDA 核心规模 | 较 H100 约少 41%(媒体口径) |
| 主流整机形态 | HGX H20 8 卡基板整机(浪潮 / 新华三 / 超微等)· PCIe 单卡 |
| 驱动 / CUDA | 535 系驱动起(新华三官方文档实机识别记录:NVIDIA-SMI 535.161.08 / CUDA 12.2) |
| 上一代 / 对位产品 | A800 / H800(已纳入管制)/ H100、H200 |
规格以媒体公开资料交叉为准[1];Tensor 算力口径以到货固件报告与实测复核,出厂数据无官方页背书是 H20 特有的选型风险(见「局限与争议」)。
| 项目 | H100 80GB | H20 96GB | H200 141GB |
|---|---|---|---|
| 单卡显存 | 80GB HBM3 | 96GB HBM3 | 141GB HBM3e |
| 显存带宽 | 3.35TB/s | 4.0TB/s | 4.8TB/s |
| FP16/BF16 Tensor(稀疏) | 1,979 TFLOPS | 约 296 TFLOPS(媒体口径) | 1,979 TFLOPS |
| FP8 Tensor(稀疏) | 3,958 TFLOPS | 约 296 TFLOPS(媒体口径) | 3,958 TFLOPS |
| 卡间互联 | NVLink 4 · 900GB/s | NVLink 4 · 900GB/s | NVLink 4 · 900GB/s |
| 单卡功耗 | 最高 700W | 约 400W | 最高 700W |
| 对华渠道 | 未获批公开销售 | 合规特供 · 政策反复(中性口径) | 2025-12 获批对华 |
| 选型一句话 | 满血算力 · 生态最大 | 砍算力换准入 · 大显存推理 | 显存翻倍 · 走量主力 |
H100/H200 列为官方页口径,H20 列为媒体披露口径;对华渠道状态为公开报道口径、随政策演进,不构成法律意见。
H20 家族按封装与显存版本分四支,现货以 HGX 8 卡整机与 PCIe 单卡为主力:
H20 是 Hopper 家族里最好部署的一代:约 400W 的单卡功耗(媒体口径)只有 H100/H200(700W 级)的六成,HGX 8 卡整机为成熟风冷塔方案,PCIe 单卡双槽风冷即插即用——存量机房无需液冷改造即可上架,这也是它 2025 年初被大模型一体机产线选中的原因之一(公开报道口径)。

| 模型 / 场景 | 显存需求(FP8 估算) | H20 部署(8 卡 768GB) | 萬安指数 |
|---|---|---|---|
| DeepSeek R1 满血(671B) | 约 690GB | 八卡装得下——96GB×8=768GB,2025 年初 DeepSeek 满血推理一体机的主力配置之一(公开报道口径);余量偏紧,KV cache 需精打 | 78 |
| R1-Distill 70B 级 | 约 70GB | 单卡 96GB 余量充足,比 H100(80GB 临界)从容 | 88 |
| 72B 级开源模型 | 约 72GB | 单卡可部署,长上下文需留 KV cache 余量 | 85 |
| 7B-14B 级(含视频生成小模型) | 约 8-30GB | 单卡轻松,大批量产线靠多卡堆并发 | 90 |
显存按 FP8 权重 ≈ 参数量 × 1 字节估算(推算口径,未含 KV cache 与激活余量);「装得下」指显存容量维度,生成速度受算力削减影响(Tensor 算力约为 H100 同口径十分之一,媒体口径)——吞吐以实测为准。萬安指数为本库估算口径。

说明:H20 为对华特供机型,NVIDIA 未设官方产品页、海外权威硬件媒体亦无实拍评测,本词条暂以整机厂商图开架;实拍图随本库验货批次上架持续补充(本库验货实拍为最高优先级图源)。AI 生成图不冒充实拍;H100/H200 与 H20 外观同为 Hopper 系,照片不可作为识别依据(见「采购与验货」)。
本片为 H20 专属判例(数值全部按 H20 实锚:96GB / 4.0TB/s / 400W / HGX NVLink 900GB/s · 单卡 PCIe 口径如实标注),旁白与场景文本存档见仓库 _wiki_work_1006/gen_tts_benchh20.py。
| 项目 | 要求 / 现状 |
|---|---|
| CUDA / 驱动 | 535 系驱动起(新华三官方部署文档实机记录:NVIDIA-SMI 535.161.08 / CUDA 12.2 识别 H20) |
| 训练框架 | PyTorch / TensorFlow 官方支持 Hopper;H20 算力受限,训练场景以小规模微调为主 |
| 推理引擎 | vLLM / SGLang / TensorRT-LLM 均原生支持;大显存 + 高带宽是推理吞吐的立身之本 |
| 网络配套 | ConnectX-7 400G 或同级互连方案(整机厂标配口径) |
| 操作系统 | 主流 Linux 发行版(Ubuntu 22.04+ 等) |
H20 与 H100/H200 同属 Hopper 生态,软件栈完全共用——「生态缩水」不存在,「算力缩水」存在。软件栈版本随时间演进,以 NVIDIA 官方发布为准。
H20 采购的验货要点(三项):
完整六项压测判例(数值为 H20 实锚)见本词条「如何压测」节。
六项压测口径,数值判例全部按 H20 实锚:开箱识别 → 单卡烤机(400W 级风冷塔,≤85℃ 零 ECC 合格)→ 全机满载 → 显存带宽(标称 4.0TB/s,≥85% 合格)→ 互联(HGX 机组 nccl-tests ≥750GB/s / PCIe 单卡验 Gen5 x16 满链路)→ 推理吞吐(≥公开基准 80%)。
nvidia-smigpu-burn 3600 或 dcgmi diag -r 3 · 30–60 分钟bandwidthTest(CUDA 自带样例)nccl-tests all_reduce 基准vLLM 起真模型跑量口径说明:合格/优秀线为本库按工程通行口径整理(带宽按标称值占比、温度为数据中心通行上限),随验货报告实测数据积累逐步校准;本表不构成任何验收承诺,具体以合同约定为准。本库验货报告的实测项即按本表口径记录——NOT_EXECUTED 表示未执行该项,「没测」本身也是重要信息。
同一块 HGX H20 基板,各家整机差在形态、散热与服务——选型先看区别:
| 整机厂 | 代表形态 | 差异点 | 适合谁 |
|---|---|---|---|
| 浪潮信息 | 元脑 NF5688G7 等(HGX Hopper 8 卡模组) | 本土 AI 服务器份额领先,一体机产线成熟[9] | 国内部署 · 一体机产线 |
| 新华三 | UniServer 系(HGX H20 8 卡) | 官方部署文档完整(H20 实机识别记录公开),服务网络下沉[10] | 行业客户 · 要文档与服务 |
| 超微 Supermicro | HGX H20 8 卡整机(中国区渠道) | 走量 OEM,全球供应链背景(公开报道口径) | 看性价比 · 批量采购 |
| PCIe 单卡集成商 | 4U/2U 8×PCIe H20 塔式/机架式 | 无 NVLink 全互联,成本低,适配推理为主场景 | 推理产线 · 预算优先 |
| 整机厂 | 安装简易 | 维护便利 | 性能密度 | 寿命预期 |
|---|---|---|---|---|
| 浪潮信息 | 88 | 86 | 82 | 80 |
| 新华三 | 86 | 88 | 81 | 82 |
| 超微 Supermicro | 84 | 80 | 84 | 80 |
| PCIe 单卡集成商 | 90 | 82 | 68 | 78 |
整机厂信息来自各家官方发布与公开报道;萬安指数为本库估算口径(0–100,估分依据=公开形态、散热方案与服务网络差异),随实机验证更新,不构成采购承诺。具体型号以厂商官方发布为准。
在美国出口管制政策要求下、按许可阈值削减性能以合法进入中国大陆市场的型号。H20 是 Hopper 代的特供线(前有 A800/H800),交换逻辑:保显存/带宽/互联,砍 Tensor 算力。本库表述均为公开报道口径,不构成法律意见。
H20 的立身之本:单卡显存与带宽双双高于 H100(80GB / 3.35TB/s)——出口管制锁定的是算力指标,不是显存。这是「特供反而某项更强」的罕见案例。
第四代 NVLink,HGX H20 8 卡模组与 H100/H200 同代同速;PCIe 单卡形态则无 NVLink——多卡机组网需求先分清形态。
8 颗 H20 板载于基板、NVSwitch 全互联,合计 768GB 显存——DeepSeek R1 满血 FP8(约 690GB)单机可容纳,这是它 2025 年初被扫货的硬道理(推算口径 + 公开报道口径)。
2025-04 美方要求 H20 对华出口需许可(NVIDIA 计提约 55 亿美元),2025-07-15 获批恢复,此后供给与采购环境随政策反复。批次与许可状态影响保修与保值,验货必查。不构成法律意见。
| 日期 | 口径 | 区域 | 参考价带 | 说明 |
|---|---|---|---|---|
| 2025-02 | 渠道报道 | 中国大陆 | 8 卡整机约 110 万元/台(较年前 +10 万以上) | 财联社报道口径[6] |
| 2025-02 | 渠道报道 | 中国大陆 | 单卡下单价约 11 万元/颗 | 财联社报道口径[6] |
| 2025-07 | 供需预期 | 中国大陆 | 恢复销售获批,2025 全年 HBM 消耗份额预期升至 6% | TrendForce[3] |
| 2026-10-09 | 本库大厅 | — | 暂无 H20 在售 | 本库实查(家族口径已按精确型号核对);行情快照自 2026-10-09 起逐日积累,有货自动带出 |
图表口径:本库当前暂无 H20 在售、外部锚价仅零星时点——不做推算带(零散时点画曲线即编数据,没验证过不张嘴);行情快照逐日积累后价格趋势图自动上线(同 H100/H200 词条做法)。
看瓶颈在哪:推理与大显存场景(70B 级单卡、R1 满血八卡),H20 的 96GB/4.0TB/s 反而高于 H100 的 80GB/3.35TB/s,且曾为大陆合规在售机型、400W 好部署;训练、微调提速、高算密度场景,H20 的 Tensor 算力约为 H100 同口径的十分之一(媒体口径),直接看 H100/H200。一句话:H20 卖的是显存和准入,H100/H200 卖的是算力。
H20 是美国出口管制政策要求下的对华合规特供机型:2024 年上市,2025 年 4 月一度被要求许可、7 月获批恢复,此后供给与采购环境随政策反复(公开报道口径)。2026 年现货以早期存量流通为主,新机供给停滞。本条不构成法律意见,采购合规状态以主管部门政策与专业意见为准。
出口管制锁定的是算力指标,不是显存——H20 保住了 96GB HBM3 与 4.0TB/s 带宽(高于 H100 的 80GB / 3.35TB/s),砍掉的是 Tensor 算力。所以它是一张为推理而生的卡:大模型推理吃显存和带宽,不太吃峰值算力。
2024 年出货的主力是 96GB HBM3 初版;约148GB HBM3e 升级版为后续报道口径(个别报道称 141-148GB 不等)。两版外观无异,验货以 nvidia-smi 显存实测与固件报告为准,报价合同必须写明版本。
能:八卡 HGX H20 合计 768GB(96GB×8),FP8 满血权重约 690GB(推算口径)装得下——这正是 2025 年初 DeepSeek 推理一体机大量采用 H20 的原因(公开报道口径)。但注意「装得下」不等于「跑得快」:生成吞吐受算力削减影响,以实测为准。