算力百科COMPUTEPEDIA

算力百科 › 基础设施词条 › NVMe 全闪存储

NVIDIA 数据中心官方图(厂商图)
AI 数据中心场景图 · 萬安算力百科(NVIDIA 官网)

NVMe 全闪存储

AI 集群存储层 · NVMe-oF · GPUDirect Storage · 基础设施词条

概述OVERVIEW

NVMe 全闪存储是 AI 集群的「第三条腿」:算力(GPU)、网络(NVLink/fabric)之外,训练与推理的数据管道——checkpoint 写读、训练数据集吞吐、KV cache 分层,全压在存储层上。NVMe 协议(SSD 直连 PCIe、绕过传统 SAS/SATA 控制器)+ 全闪阵列 + NVMe-oF 网络 + GPUDirect Storage(数据从存储直达 GPU 显存、绕过 CPU 拷贝,NVIDIA 官方文档口径[3])构成现代 AI 存储的标准拼图。

它为什么在 AI 集群里变成刚需:千卡集群的 checkpoint 动辄数十 TB、训练数据集以百 TB 计——机械盘或混闪阵列的吞吐喂不满 GPU,GPU 等数据的每一秒都是白烧的卡钱。NVMe-oF 把全闪性能延展到网络(RDMA 直达[1]),GPUDirect Storage 把 CPU 从数据通路里摘掉——这两件事决定了存储层是加速器还是瓶颈。

本词条是品类选型词条:讲 AI 集群视角下的存储架构、选型参数与采购验收,不针对单一产品。存储无统一行情,价格以货主实际报价为准。

适用场景FIT

萬安指数(0–100):按场景匹配度加权估算。90+ 旗舰级 · 75+ 优秀 · 60+ 可用 · 60 以下不适用。

大模型训练数据管道93萬安指数
训练数据集吞吐 + checkpoint 快写快读——GPUDirect Storage 直通后 GPU 喂数不停摆,全闪 NVMe 是唯一能跟上的档位。
推理服务热数据层88萬安指数
模型权重加载(首 token 延迟的组成部分)+ KV cache 分层——NVMe 层做 GPU 显存的溢出层是主流架构。
数据湖前置层78萬安指数
对象存储(冷数据)与 GPU 集群之间的全闪缓存层——「对象湖+全闪缓存」是两段式架构的标准玩法。
一般文件共享40萬安指数
不喂 GPU 的普通文件共享用不着 NVMe-oF 级架构——常规 NAS 更实惠,别为用不上性能买单。

沿革HISTORY

2011 年,NVMe 1.0 规范发布:SSD 直连 PCIe、为闪存而生的协议取代 SAS/SATA 通道——全闪阵列的协议地基(行业公开口径)。

2016-2020 年,全闪阵列主流化:NVMe-oF 规范把 NVMe 延展到网络(RDMA 直达),Dell/NetApp/Pure 等厂商全闪阵列成为企业存储新标配,GPU 集群开始以全闪为存储底座(行业口径[1])。

2020 年,NVIDIA 发布 GPUDirect Storage:存储数据经 RDMA 直达 GPU 显存、绕过 CPU 中转(NVIDIA 开发者博客与官方文档口径[2][3])——AI 存储的最后一公里打通,CUDA 生态再下一城。

2023-2026 年,AI 集群标配化:大模型训练的 checkpoint 与数据吞吐需求把存储推到基础设施 C 位——「对象湖(冷)+ 全闪缓存(热)+ GPUDirect 直通」三段式成为 AI 存储参考架构(行业参考架构口径[4])。

选型参数SELECTION GUIDE

参数看什么口径说明
吞吐(GB/s)聚合读/写带宽对 GPU 消费速度的匹配按「集群每小时消费数据量」反推存储吞吐,留 30% 余量(推算口径)
IOPS 与延迟小 IO 场景(checkpoint 元数据、KV cache 分层)看 IOPS 与 P99 延迟大吞吐≠低延迟,两类负载分开看
NVMe-oF 支持RDMA 传输(RoCE/IB)下的网络延展与集群 fabric 路线对表:IB 网络配 IB-RDMA,以太网配 RoCE
GPUDirect Storage存储阵列/文件系统是否入 NVIDIA GDS 兼容列表官方兼容列表为准(NVIDIA 文档口径[3])——不入列表的方案直通要另做开发
并行文件系统Lustre/GPFS 系/厂商自研并行 FS多 GPU 节点并发读同一数据集,并行吞吐是关键
容量分层热(NVMe)/温(混闪)/冷(对象/磁带)三层全闪只放热数据——容量成本靠分层压下来
数据保护纠删码/副本、快照、异地容灾训练数据集与 checkpoint 的保险绳,按数据价值定档

选型口径为本库按公开架构文档的整理(2026-10 口径)[1][3][4];具体以厂商产品文档与实际压测为准。

全闪阵列NVMe SSD 池 NVMe-oF 网络RDMA 直达 GPU 显存GPUDirect 绕过 CPU AI 存储数据通路 · NVMe-oF + GPUDirect Storage(示意)

三段式 AI 存储架构TIERING

层介质/形态放什么关键指标
热层NVMe 全闪阵列 / 分布式 NVMe活跃训练集、checkpoint、KV cache 分层吞吐 + GPUDirect 直通
温层混闪 / 大容量 NVMe近期数据集版本、预处理中间产物容量性价比
冷层对象存储 / 磁带原始数据湖、历史归档单位容量成本

三层架构为本库按公开参考架构的整理口径[4];分层策略随业务数据生命周期定制。

生态与厂商格局VENDORS

AI 存储的三类玩家(本库整理口径,不构成采购推荐):

阵营代表定位与特点
企业全闪阵列Dell PowerStore/PowerScale、NetApp AFF、Pure FlashArray//FlashBlade、华为 OceanStor、浪潮 AS 系企业级数据保护与运维体系齐全;AI 适配看 GPUDirect 兼容与并行吞吐(公开产品线口径)
AI 原生存储VAST Data、WEKA、VDURA 等新一代并行文件系统厂商为 GPU 集群而生:并行 FS+NVMe 分层+GDS 深度适配(参考架构口径[4])
自建/开源Lustre、Ceph、JuiceFS 等自建方案超大集群自建可控性强,运维人力是成本(公开生态口径)

厂商信息为公开产品线整理,具体以各厂商官方资料为准;SSD 颗粒侧(三星/Solidigm/西数企业级 NVMe 盘)是另一层供应链,阵列采购时已含。

NVIDIA 数据中心官方图
AI 数据中心基础设施场景(官方图 · NVIDIA 官网)

存储设备实拍图随验货批次上架补充;AI 生成图不冒充实拍。

部署与集成DEPLOYMENT

存储上线的三步对表:fabric 对表(存储网络与计算 fabric 同路线:IB 集群配 IB-RDMA 存储网,以太网配 RoCE——混路线要网关,延迟与吞吐都打折);GDS 打通(按 NVIDIA 官方 GDS 文档部署组件[3],阵列在兼容列表内为前提);压测定档(真实训练任务的数据吞吐压测——paper specs 不算数,GPU 等不等你只有压测知道)。

运维提示:存储层的监控指标(吞吐/IOPS/延迟 P99/容量水位)与 GPU 集群监控同屏看——「GPU 利用率异常低」的第一个排查位就是存储喂料速度(本库运维经验口径)。

采购与验收PROCUREMENT

AI 存储采购的验收要点(三项):

1
真实任务压测先行
拿目标训练/推理任务的实际数据集压吞吐与延迟——厂商 demo 数据≠你的数据形态;压测不过的方案不进合同。
2
GDS 兼容与直通实测
阵列在 NVIDIA GDS 兼容列表内(官方口径[3])+ 实测直通带宽——「支持 NVMe-oF」不等于「支持 GPUDirect」,两回事分开验。
3
故障演练
盘故障重建、控制器切换、网络断链重连三项演练:训练跑一半存储抖一下的代价是整轮重来——演练通过再上线。

完整六项验收判例见本词条「如何验收」节。

如何验收ACCEPTANCE TEST

六项验收口径(AI 存储验收框架):开箱清点 → 基础吞吐 → GPUDirect 直通 → 并发读 → 故障演练 → 长稳联调。

1
开箱清点
控制器/NVMe 盘/缓存模块按装箱单清点;序列号与授权(容量授权/特性授权)状态导出留档。
2
基础吞吐
fio 等标准工具测聚合读写:对照厂商标称 ≥85% 合格(推算口径)——注意测试块大小与队列深度要贴真实负载。
3
GPUDirect 直通
按 NVIDIA GDS 官方文档部署并跑官方基准[3]:存储到 GPU 显存直通带宽达标、CPU 占用显著低于中转模式为合格。
4
并发读
多 GPU 节点并发读同一数据集:聚合吞吐线性度与 P99 延迟达标——单节点快、多节点塌的方案过不了这关。
5
故障演练
拔盘重建、控制器切换、网络断链三演练:数据不丢、业务恢复时长在合同 SLA 内为合格。
6
长稳联调
真实训练任务连续 ≥24 小时联调(判例框架口径):存储吞吐曲线平稳、GPU 无等待饥饿——联调通过才算交付。

运输与交付LOGISTICS

1
盘阵运输与静置
满配 NVMe 盘的阵列柜重量大、硬盘怕震:原厂包装+运输数据记录仪(如配置);到货静置后上电(按厂商口径)。
2
数据安全与残留
二手存储阵列的前世数据残留是安全红线:到货后全盘安全擦除(按数据安全规范)再入网——上一家的数据不能带进你的机房。
3
到货联合验收
外观、配件、授权三处核对;「如何验收」六项过完再签收——存储是数据的家,验收标准就高不就低。

术语卡GLOSSARY

NVMe

为闪存而生的存储协议:SSD 直连 PCIe 总线、高队列深度、低延迟——相比 SAS/SATA 协议把闪存速度解放出来。NVMe SSD 是全闪阵列的基本积木。

NVMe-oF

NVMe over Fabrics:把 NVMe 协议延展到网络(RDMA 传输,跑在 IB 或 RoCE 上)——服务器像访问本地盘一样访问远端全闪阵列,性能损耗极小(行业口径[1])。

GPUDirect Storage(GDS)

NVIDIA 的存储直通技术:数据从 NVMe/阵列经 RDMA 直达 GPU 显存、绕过 CPU 中转拷贝——训练数据加载与 checkpoint 读写的提效关键技术(官方文档口径[3])。

并行文件系统

多节点并发访问同一文件系统的存储架构(Lustre/GPFS 系等):把数据条带化到多台存储节点上聚合吞吐——千卡集群同时读训练集的只有并行 FS 扛得住。

Checkpoint

训练过程的存档点:模型权重+优化器状态的周期性落盘——大模型的 checkpoint 以十 TB 计,写慢了拖训练节奏、丢了损整轮进度。checkpoint 吞吐是 AI 存储的第一考题。

KV cache 分层

推理服务的显存溢出方案:GPU HBM 装不下的 KV cache 放到 NVMe 层——以 NVMe 带宽换显存容量,长上下文与大批量并发的推理架构组件。

局限与争议LIMITS

  • 吞吐幻觉:厂商标称吞吐是理想条件的实验室值——真实训练负载(小 IO 混合、多节点并发)下达标率常打对折,真实任务压测是唯一的照妖镜(本库验货经验口径)。
  • GDS 兼容性分化:「支持 NVMe-oF」不等于「入 NVIDIA GDS 兼容列表」——不入列表的方案直通要自研开发,隐性成本要算(官方文档口径[3])。
  • 全闪容量成本陷阱:把冷数据也放全闪是预算黑洞——三层分层架构(热/温/冷)是成本纪律,全闪只服务热数据(本库整理口径)。
  • 二手存储阵列的数据残留:二手阵列的前世数据安全是法律级风险——安全擦除记录必须作为交易前提(本库验货经验口径)。
  • 厂商锁定:并行文件系统与阵列的管理栈绑定深,中途换品牌的迁移成本高——选型时把「数据出去的难度」也当参数看(本库整理口径)。

行情说明MARKET NOTE

NVMe 全闪存储 · 行情带暂未开通

AI 存储以项目制采购为主流(配置/容量/软件栈差异大),二手阵列还需过数据安全关——暂无可复核的统一行情快照,本库诚实原则:不做行情带,价格以货主实际报价为准。

在售检索:萬安算交所大厅 ›(0 佣金撮合、不参与交易,不掌握亦不推测成交价,数据因此中立)。行情快照积累充分后本节将切换为标准行情带。

常见问题FAQ

AI 集群的存储和普通企业存储有什么不同?

三个差异点:吞吐量级(千卡集群喂数据是普通企业负载的几十倍)、直通架构(GPUDirect Storage 绕过 CPU)、并发形态(多 GPU 节点并行读同一数据集)——普通 NAS/混闪阵列在这三条面前都跟不上。

GPUDirect Storage 是必须的吗?

强烈建议:数据绕过 CPU 直达 GPU 显存,训练数据加载与 checkpoint 读写的延迟与 CPU 占用双降(官方文档口径);不支持 GDS 的方案也可跑,但 CPU 中转的吞吐天花板低、主机资源被数据搬运吃掉。

checkpoint 为什么是存储的第一考题?

大模型 checkpoint 以十 TB 计、写入频繁:写慢了拖训练节奏(GPU 等落盘),写入中断了损整轮进度——checkpoint 吞吐与可靠性是 AI 存储与普通存储的分水岭。

全闪阵列可以买二手吗?

可以但要过三关:数据安全关(前世数据的安全擦除记录是交易前提)、健康关(NVMe 盘写入寿命/SMART 全量导出)、授权关(容量与特性授权是否随硬件转移)。存储是数据的家,验收标准就高不就低。

存储网络和计算网络要分开吗?

推荐同路线可分层:IB 集群配 IB-RDMA 存储网、以太网集群配 RoCE——混路线要网关转换,延迟吞吐双打折。流量层面存储网与计算网可物理/逻辑隔离,避免 checkpoint 写入冲击训练通信。

NVMe(概念页)GB200 NVL72GB300 NVL72液冷 CDUBlueField-3ConnectX-7GPUDirect Storage并行文件系统KV cache 分层

选型对照与延伸COMPARE

参考资料REFERENCES

  1. Introl — AI-Optimized Storage: NVMe-oF, GPUDirect & Parallel File Systems(2025 架构综述) https://introl.com/blog/ai-optimized-storage-nvme-gpudirect-…
  2. NVIDIA Developer Blog — NVIDIA GPUDirect Storage(2020 发布稿) https://developer.nvidia.com/blog/gpudirect-storage/
  3. NVIDIA 官方文档 — GPUDirect Storage Overview Guide(部署与兼容口径) https://docs.nvidia.com/gds/latest/
  4. VDURA — AI Storage Reference Design(全闪参考架构口径) https://www.vdura.com/resources/reference-architecture/ai-st…
  5. 在售检索 — 萬安算交所(0 佣金撮合;AI 存储暂无行情快照,价格以货主报价为准) https://www.aixx.vip/hall.html
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。发现错误?欢迎通过勘误通道提交,核实后公开修正并记入版本史。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品