
Grace是 NVIDIA 的数据中心 CPU 品牌——NVIDIA 首款自研 CPU:基于 Arm Neoverse V2 核心的 72 核处理器,专为 AI 与 HPC 的巨型内存吞吐设计(NVIDIA 官方页口径[1])。它极少单独出现:主角身份是 Grace Hopper(GH200)与 Grace Blackwell(GB200/GB300)超级芯片里的 CPU 侧——与 GPU 经 NVLink-C2C 芯片间互连组成「CPU+GPU 一体」的超级芯片。
它存在的意义是重构 CPU 与 GPU 的关系:传统架构里 CPU 与 GPU 之间隔着 PCIe,数据来回拷贝;Grace 与 GPU 之间是 NVLink-C2C 一致性互连(GB200 口径 900GB/s 级[2])——CPU 内存与 GPU 显存从软件视角连成一体,向量数据库、数据处理、KV cache 管理这些「CPU 侧活」直接吃 GPU 级带宽。
2026 年的现货市场,Grace 以 GB200/GB300 机柜的组成部分流通(36 颗/柜),独立形态(Grace CPU Superchip 单售)少见。本词条不带行情带——价格以货主实际报价为准。
萬安指数(0–100):按 CPU-GPU 协同场景匹配度加权(软件概念特化口径)。
2021 年 4 月,GTC 发布 Grace:NVIDIA 宣布进军 CPU——以 Arm Neoverse 核心打造面向 AI 与 HPC 的数据中心 CPU,名字致敬计算机架构先驱 Grace Hopper(NVIDIA 官方页与 GTC 发布口径[1])。
2022-2023 年,超级芯片落地:Grace Hopper(GH200,Grace+H100 经 NVLink-C2C)率先出货,Linux 内核与主流发行版完成 Arm 生态适配——「CPU+GPU 一致性内存」从论文变成产品(官方页口径[1])。
2024-2025 年,GB 世代放量:Grace Blackwell(GB200)与 GB300 把 Grace 带进机柜级主力——GB200 NVL72 每柜 36 颗 Grace 扛 72 颗 B200 的数据供给,LPDDR5X 大内存池成为机柜的「第二显存层」(GB200 词条口径)。
2026 年,现货定位:Grace 随 GB 系机柜流通,独立形态稀少。Arm 数据中心 CPU 阵营(Grace/AWS Graviton/Ampere 等)整体在成长,但 AI 超级芯片赛道 Grace 目前是「GPU 大厂自研 CPU」的独一份。数据中心芯片的跨境流通政策仍在演进,采购时以主管部门政策与专业意见为准(公开报道口径)。
| 项目 | 规格(NVIDIA Grace CPU Superchip · 官方口径) |
|---|---|
| 核心 | 72 核 Arm Neoverse V2(单超级芯片) |
| 内存 | LPDDR5X ECC——能效导向的大带宽内存(容量以配置为准) |
| 互连 | NVLink-C2C——CPU↔GPU 一致性互连(GB200 口径 900GB/s 级[2]) |
| 超级芯片形态 | Grace Hopper(GH200:Grace+H100)· Grace Blackwell(GB200:2×B200+1×Grace) |
| 机柜角色 | GB200/GB300 NVL72:每柜 36 颗 Grace(72 核 ×36=2592 核/柜) |
| 软件生态 | Linux(主流发行版 Arm 版)· NVIDIA 全栈软件原生支持 |
| 发布 | 2021-04 GTC 发布品牌 · GH200 2023 年出货 · GB200 2024-03 发布 |
规格以 NVIDIA 官方页为准(2026-10 口径)[1];具体时钟/功耗/内存容量细目以对应超级芯片与整机配置为准,本表未列=未实抓,不编。
| 层级 | 部件 | Grace 的关系 |
|---|---|---|
| 芯片级 | Grace Blackwell 超级芯片(2 B200 + 1 Grace) | NVLink-C2C 一致性互连——软件视角 CPU 内存与 GPU 显存一体 |
| 托盘级 | 计算托盘(4 GPU + 2 Grace/托) | Grace 承担托盘级数据处理与编排 |
| 机柜级 | GB200/GB300 NVL72 | 36 颗 Grace/柜 · 最高 17TB LPDDR5X 内存池(机柜口径) |
层级口径与 GB200 NVL72 词条一致;GB300 的 Grace 配置以整机厂文档为准。
Grace 家族按超级芯片组合分档;Grace 是 GB 系的 CPU 侧本体:
Grace 不以独立服务器形态部署——它焊在超级芯片与计算托盘里,散热随整机方案(GB 系全液冷)。部署视角的 Grace 是软件栈问题:Arm 架构意味着所有宿主软件(监控 agent、安全组件、自研工具链)要确认 Arm 版本可用——主流 Linux 发行版与 NVIDIA 全栈已原生支持,但企业内部的长尾软件要逐个盘点(本库整理口径)。
二手机柜验收时 Grace 侧的检查项:36 颗 CPU 全部在位识别、NVLink-C2C 链路健康(与 NVLink 域验收同批次做)、LPDDR5X 内存容量与配置和随货文件一致——Grace 故障的托盘级维修依赖整机厂通道,采购时确认质保路径。
| 负载 | Grace 的表现口径 | 萬安指数 |
|---|---|---|
| 训练数据管线 | 预处理/增强/分词在 CPU 侧直吃 NVLink-C2C 带宽喂 GPU | 86 |
| 向量数据库 / 检索 | 大内存池+一致性互连,向量检索的热数据层天然适配 | 83 |
| 推理 KV cache 分层 | LPDDR5X 大池做 GPU 显存的溢出层(GB200 词条口径) | 83 |
| 通用 x86 应用平移 | Arm 生态可用但非定位所在——按上表「通用替代」口径 | 45 |
负载档位为本库按公开规格的整理(推算口径,不构成性能承诺)。

实拍图随验货批次上架持续补充;AI 生成图不冒充实拍。
| 项目 | 要求 / 现状 |
|---|---|
| 操作系统 | 主流 Linux 发行版 Arm 版(Ubuntu/RHEL 系等,官方支持口径) |
| NVIDIA 全栈 | CUDA/驱动/NCCL 等对 Grace 原生支持——GB 系机柜的软件栈一体交付 |
| 框架 | PyTorch/TensorFlow 等 AI 框架 Arm 轮子可用,数据侧组件(DALI 等)随 NVIDIA 栈 |
| 容器化 | Arm 容器镜像生态成熟(多架构镜像已是行业常态) |
| 盘点提醒 | 企业自研工具/安全 agent 的 Arm 版可用性逐个确认——迁移的主要摩擦点(本库整理口径) |
Arm 数据中心生态经 AWS Graviton 等产品多年培育已成熟;版本随时间演进,以 NVIDIA 官方发布为准。
Grace 相关采购(随 GB 系机柜)的验收要点(三项):
Grace 侧四步速查(随 GB 系机柜验收执行):
Chip-to-Chip 互连:Grace 与 GPU 之间的一致性高速互连(GB200 口径 900GB/s 级)——让 CPU 内存与 GPU 显存在软件视角连成一体,是 Grace 区别于「外挂 CPU」的本质。
低功耗版 LPDDR5 内存:Grace 的内存选择——能效导向、大带宽,为「CPU 侧大内存池喂 GPU」的定位服务(GB200 机柜口径 17TB 级内存池)。
Grace+GPU 的封装组合:Grace Hopper(GH200)、Grace Blackwell(GB200 系)——把「CPU+GPU 主板关系」压缩成「芯片封装关系」,互连带宽与一致性约束完全重构。
Arm 的数据中心核心 IP:Grace 采用的 72 核 Neoverse V2——与 AWS Graviton3/Ampere One 同源的数据中心 Arm 血统,生态工具链共享。
NVIDIA 公开路线图上的下一代 CPU(随 Vera Rubin 平台披露)——Grace 的接棒者;路线图口径以 NVIDIA 官方发布为准。
Grace 以 GB 系机柜组成部分流通,独立行情不存在——本库诚实原则:不做行情带,价格以货主实际报价为准(机柜级价格随 GB200/GB300 NVL72 词条口径)。
在售检索:萬安算交所大厅 ›(0 佣金撮合、不参与交易,数据因此中立)。
定位不是:Grace 为「CPU+GPU 超级芯片」而生,价值在 NVLink-C2C 一致性互连与大内存池——单独当通用服务器用既买不到也用不对。通用算力还是 x86 与通用 Arm 服务器(Graviton 等)的天下。
不同架构不同场景没有直接换算——Grace 的强项是内存带宽与 CPU-GPU 协同(NVLink-C2C),通用整数/浮点吞吐的横评意义有限。选型看你的负载是不是「喂 GPU 的数据管线」,是则 Grace+GPU 组合优势大,否则别硬套。
托盘级维修:Grace 焊在计算托盘上,故障走整机厂托盘更换通道——二手柜采购时质保路径与备件托盘要写进合同,这是机柜级设备的隐性成本。
成熟:PyTorch/TensorFlow 有 Arm 轮子,NVIDIA 全栈对 Grace 原生支持,容器多架构镜像已是行业常态——摩擦点在企业自研工具与遗留软件的 Arm 版盘点,采购前做清单。
间接是:GB 系机柜用 Grace 替代了传统「x86 服务器+GPU」的 CPU 位——但竞争发生在「AI 集群 CPU 侧」这个细分位,通用数据中心 CPU 市场 x86 与通用 Arm 仍是主流。