
NVMe 全闪存储是 AI 集群的「第三条腿」:算力(GPU)、网络(NVLink/fabric)之外,训练与推理的数据管道——checkpoint 写读、训练数据集吞吐、KV cache 分层,全压在存储层上。NVMe 协议(SSD 直连 PCIe、绕过传统 SAS/SATA 控制器)+ 全闪阵列 + NVMe-oF 网络 + GPUDirect Storage(数据从存储直达 GPU 显存、绕过 CPU 拷贝,NVIDIA 官方文档口径[3])构成现代 AI 存储的标准拼图。
它为什么在 AI 集群里变成刚需:千卡集群的 checkpoint 动辄数十 TB、训练数据集以百 TB 计——机械盘或混闪阵列的吞吐喂不满 GPU,GPU 等数据的每一秒都是白烧的卡钱。NVMe-oF 把全闪性能延展到网络(RDMA 直达[1]),GPUDirect Storage 把 CPU 从数据通路里摘掉——这两件事决定了存储层是加速器还是瓶颈。
本词条是品类选型词条:讲 AI 集群视角下的存储架构、选型参数与采购验收,不针对单一产品。存储无统一行情,价格以货主实际报价为准。
萬安指数(0–100):按场景匹配度加权估算。90+ 旗舰级 · 75+ 优秀 · 60+ 可用 · 60 以下不适用。
2011 年,NVMe 1.0 规范发布:SSD 直连 PCIe、为闪存而生的协议取代 SAS/SATA 通道——全闪阵列的协议地基(行业公开口径)。
2016-2020 年,全闪阵列主流化:NVMe-oF 规范把 NVMe 延展到网络(RDMA 直达),Dell/NetApp/Pure 等厂商全闪阵列成为企业存储新标配,GPU 集群开始以全闪为存储底座(行业口径[1])。
2020 年,NVIDIA 发布 GPUDirect Storage:存储数据经 RDMA 直达 GPU 显存、绕过 CPU 中转(NVIDIA 开发者博客与官方文档口径[2][3])——AI 存储的最后一公里打通,CUDA 生态再下一城。
2023-2026 年,AI 集群标配化:大模型训练的 checkpoint 与数据吞吐需求把存储推到基础设施 C 位——「对象湖(冷)+ 全闪缓存(热)+ GPUDirect 直通」三段式成为 AI 存储参考架构(行业参考架构口径[4])。
| 参数 | 看什么 | 口径说明 |
|---|---|---|
| 吞吐(GB/s) | 聚合读/写带宽对 GPU 消费速度的匹配 | 按「集群每小时消费数据量」反推存储吞吐,留 30% 余量(推算口径) |
| IOPS 与延迟 | 小 IO 场景(checkpoint 元数据、KV cache 分层)看 IOPS 与 P99 延迟 | 大吞吐≠低延迟,两类负载分开看 |
| NVMe-oF 支持 | RDMA 传输(RoCE/IB)下的网络延展 | 与集群 fabric 路线对表:IB 网络配 IB-RDMA,以太网配 RoCE |
| GPUDirect Storage | 存储阵列/文件系统是否入 NVIDIA GDS 兼容列表 | 官方兼容列表为准(NVIDIA 文档口径[3])——不入列表的方案直通要另做开发 |
| 并行文件系统 | Lustre/GPFS 系/厂商自研并行 FS | 多 GPU 节点并发读同一数据集,并行吞吐是关键 |
| 容量分层 | 热(NVMe)/温(混闪)/冷(对象/磁带)三层 | 全闪只放热数据——容量成本靠分层压下来 |
| 数据保护 | 纠删码/副本、快照、异地容灾 | 训练数据集与 checkpoint 的保险绳,按数据价值定档 |
选型口径为本库按公开架构文档的整理(2026-10 口径)[1][3][4];具体以厂商产品文档与实际压测为准。
| 层 | 介质/形态 | 放什么 | 关键指标 |
|---|---|---|---|
| 热层 | NVMe 全闪阵列 / 分布式 NVMe | 活跃训练集、checkpoint、KV cache 分层 | 吞吐 + GPUDirect 直通 |
| 温层 | 混闪 / 大容量 NVMe | 近期数据集版本、预处理中间产物 | 容量性价比 |
| 冷层 | 对象存储 / 磁带 | 原始数据湖、历史归档 | 单位容量成本 |
三层架构为本库按公开参考架构的整理口径[4];分层策略随业务数据生命周期定制。
AI 存储的三类玩家(本库整理口径,不构成采购推荐):
| 阵营 | 代表 | 定位与特点 |
|---|---|---|
| 企业全闪阵列 | Dell PowerStore/PowerScale、NetApp AFF、Pure FlashArray//FlashBlade、华为 OceanStor、浪潮 AS 系 | 企业级数据保护与运维体系齐全;AI 适配看 GPUDirect 兼容与并行吞吐(公开产品线口径) |
| AI 原生存储 | VAST Data、WEKA、VDURA 等新一代并行文件系统厂商 | 为 GPU 集群而生:并行 FS+NVMe 分层+GDS 深度适配(参考架构口径[4]) |
| 自建/开源 | Lustre、Ceph、JuiceFS 等自建方案 | 超大集群自建可控性强,运维人力是成本(公开生态口径) |
厂商信息为公开产品线整理,具体以各厂商官方资料为准;SSD 颗粒侧(三星/Solidigm/西数企业级 NVMe 盘)是另一层供应链,阵列采购时已含。

存储设备实拍图随验货批次上架补充;AI 生成图不冒充实拍。
存储上线的三步对表:fabric 对表(存储网络与计算 fabric 同路线:IB 集群配 IB-RDMA 存储网,以太网配 RoCE——混路线要网关,延迟与吞吐都打折);GDS 打通(按 NVIDIA 官方 GDS 文档部署组件[3],阵列在兼容列表内为前提);压测定档(真实训练任务的数据吞吐压测——paper specs 不算数,GPU 等不等你只有压测知道)。
运维提示:存储层的监控指标(吞吐/IOPS/延迟 P99/容量水位)与 GPU 集群监控同屏看——「GPU 利用率异常低」的第一个排查位就是存储喂料速度(本库运维经验口径)。
AI 存储采购的验收要点(三项):
完整六项验收判例见本词条「如何验收」节。
六项验收口径(AI 存储验收框架):开箱清点 → 基础吞吐 → GPUDirect 直通 → 并发读 → 故障演练 → 长稳联调。
为闪存而生的存储协议:SSD 直连 PCIe 总线、高队列深度、低延迟——相比 SAS/SATA 协议把闪存速度解放出来。NVMe SSD 是全闪阵列的基本积木。
NVMe over Fabrics:把 NVMe 协议延展到网络(RDMA 传输,跑在 IB 或 RoCE 上)——服务器像访问本地盘一样访问远端全闪阵列,性能损耗极小(行业口径[1])。
NVIDIA 的存储直通技术:数据从 NVMe/阵列经 RDMA 直达 GPU 显存、绕过 CPU 中转拷贝——训练数据加载与 checkpoint 读写的提效关键技术(官方文档口径[3])。
多节点并发访问同一文件系统的存储架构(Lustre/GPFS 系等):把数据条带化到多台存储节点上聚合吞吐——千卡集群同时读训练集的只有并行 FS 扛得住。
训练过程的存档点:模型权重+优化器状态的周期性落盘——大模型的 checkpoint 以十 TB 计,写慢了拖训练节奏、丢了损整轮进度。checkpoint 吞吐是 AI 存储的第一考题。
推理服务的显存溢出方案:GPU HBM 装不下的 KV cache 放到 NVMe 层——以 NVMe 带宽换显存容量,长上下文与大批量并发的推理架构组件。
AI 存储以项目制采购为主流(配置/容量/软件栈差异大),二手阵列还需过数据安全关——暂无可复核的统一行情快照,本库诚实原则:不做行情带,价格以货主实际报价为准。
在售检索:萬安算交所大厅 ›(0 佣金撮合、不参与交易,不掌握亦不推测成交价,数据因此中立)。行情快照积累充分后本节将切换为标准行情带。
三个差异点:吞吐量级(千卡集群喂数据是普通企业负载的几十倍)、直通架构(GPUDirect Storage 绕过 CPU)、并发形态(多 GPU 节点并行读同一数据集)——普通 NAS/混闪阵列在这三条面前都跟不上。
强烈建议:数据绕过 CPU 直达 GPU 显存,训练数据加载与 checkpoint 读写的延迟与 CPU 占用双降(官方文档口径);不支持 GDS 的方案也可跑,但 CPU 中转的吞吐天花板低、主机资源被数据搬运吃掉。
大模型 checkpoint 以十 TB 计、写入频繁:写慢了拖训练节奏(GPU 等落盘),写入中断了损整轮进度——checkpoint 吞吐与可靠性是 AI 存储与普通存储的分水岭。
可以但要过三关:数据安全关(前世数据的安全擦除记录是交易前提)、健康关(NVMe 盘写入寿命/SMART 全量导出)、授权关(容量与特性授权是否随硬件转移)。存储是数据的家,验收标准就高不就低。
推荐同路线可分层:IB 集群配 IB-RDMA 存储网、以太网集群配 RoCE——混路线要网关转换,延迟吞吐双打折。流量层面存储网与计算网可物理/逻辑隔离,避免 checkpoint 写入冲击训练通信。