RDMA(Remote Direct Memory Access)是一种绕过操作系统内核、直接在两台机器的内存之间传输数据的技术——不占 CPU、不经过内核协议栈、延迟微秒级。传统 TCP/IP 网络里,一块数据从 A 机器到 B 机器需要 CPU 参与封装/解封/拷贝;RDMA 让网卡直接读写远端内存,CPU 完全不感知。
AI 训练集群里 RDMA 是基础设施的命脉:大模型训练的梯度同步(AllReduce)、参数服务器推送、存储直通 GPUDirect Storage——全部依赖 RDMA 的低延迟高带宽。RDMA 跑在 InfiniBand 或 RoCE(以太网)上,NVIDIA 的 NCCL 集合通信库底层自动选择最优 RDMA 路径。
| 项目 | 数值 / 口径 |
|---|---|
| 延迟 | 微秒级(TCP 毫秒级) |
| CPU 占用 | 接近零(绕过内核) |
| 传输协议 | InfiniBand / RoCE v2 |
| 配套技术 | GPUDirect RDMA(GPU 显存直通) |
B300 八卡机的 NVLink 域内不需要 RDMA(NVLink 直通),但跨机训练必须走 RDMA——B300 的 ConnectX-8 网卡(800G)支持 RDMA,配合 Quantum-X800 IB 交换机或 Spectrum-X800 以太网交换机组成训练 fabric。跨机 RDMA 的误码率和延迟直接影响训练吞吐——采购互连件时误码测试是核心验收项。