算力百科COMPUTEPEDIA

算力百科 › 技术概念 › RDMA 远程直接内存访问

RDMA 远程直接内存访问

REMOTE DIRECT MEMORY ACCESS · 技术概念词条

概述OVERVIEW

RDMA(Remote Direct Memory Access)是一种绕过操作系统内核、直接在两台机器的内存之间传输数据的技术——不占 CPU、不经过内核协议栈、延迟微秒级。传统 TCP/IP 网络里,一块数据从 A 机器到 B 机器需要 CPU 参与封装/解封/拷贝;RDMA 让网卡直接读写远端内存,CPU 完全不感知。

AI 训练集群里 RDMA 是基础设施的命脉:大模型训练的梯度同步(AllReduce)、参数服务器推送、存储直通 GPUDirect Storage——全部依赖 RDMA 的低延迟高带宽。RDMA 跑在 InfiniBand 或 RoCE(以太网)上,NVIDIA 的 NCCL 集合通信库底层自动选择最优 RDMA 路径。

关键数字KEY NUMBERS

项目数值 / 口径
延迟微秒级(TCP 毫秒级)
CPU 占用接近零(绕过内核)
传输协议InfiniBand / RoCE v2
配套技术GPUDirect RDMA(GPU 显存直通)

在 B300 上的意义ON B300

B300 八卡机的 NVLink 域内不需要 RDMA(NVLink 直通),但跨机训练必须走 RDMA——B300 的 ConnectX-8 网卡(800G)支持 RDMA,配合 Quantum-X800 IB 交换机或 Spectrum-X800 以太网交换机组成训练 fabric。跨机 RDMA 的误码率和延迟直接影响训练吞吐——采购互连件时误码测试是核心验收项。

边界与注意LIMITS

  • RDMA 配置门槛高:RoCE 模式下 PFC/ECN 的无损网络配置、拥塞控制、VLAN 隔离——每项都要调优,配置不当性能反而低于 TCP。
  • 安全隔离弱于 TCP:RDMA 绕过内核协议栈意味着传统防火墙无法深度检测——安全敏感场景需配合专有网络安全设备。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品