训练数据管线是大模型训练的「原料供应链」:从原始数据(网页/书籍/代码/对话)的采集、清洗、去重、过滤、分词、打包,到训练时的加载、预处理、混合比例调度——整条管线决定了「GPU 吃到什么质量的数据、多快的速度」。
对采购方的意义:数据管线的吞吐决定了 GPU 的利用率——数据管线的吞吐跟不上 GPU 的消费速度,GPU 就在等数据(利用率下降)。存储选型(NVMe 全闪/并行文件系统)、网络带宽(GPUDirect Storage)、数据格式(预分词打包 vs 实时分词)都是管线效率的影响因子。
| 项目 | 数值 / 口径 |
|---|---|
| 数据清洗 | 去重 / 过滤 / 质量评分 / 脱敏 |
| 预分词打包 | 离线分词打包加速训练加载 |
| 存储选型 | NVMe 全闪 / 并行文件系统 / 对象存储分层 |
| GPUDirect Storage | 存储→GPU 显存直通(绕过 CPU) |
B300 的训练吞吐需要匹配的数据管线:NVMe 全闪存储 + GPUDirect Storage + 预分词打包是标准三件套——存储吞吐不足是 GPU 利用率低的最常见原因(本库整理口径)。采购时存储与 GPU 的吞吐配比是选型核心参数。