集合通信(Collective Communication)是多个 GPU/节点之间的协同通信模式——不是「A 发给 B」的点对点通信,而是「全体参与者共同完成一次通信操作」。四大核心原语:AllReduce(全体归约,训练梯度同步用)、AllGather(全体收集,推理输出合并用)、Broadcast(广播,参数分发用)、ReduceScatter(归约分散,梯度分片用)。
AI 训练的吞吐瓶颈通常在集合通信:大模型训练的数据并行梯度同步走 AllReduce、张量并行的中间结果走 AllGather/ReduceScatter——集合通信的效率直接决定训练的扩展效率。NCCL(NVIDIA)/ RCCL(AMD)是集合通信的标准库实现。
| 项目 | 数值 / 口径 |
|---|---|
| AllReduce | 全体归约(训练梯度同步) |
| AllGather | 全体收集(推理输出合并) |
| ReduceScatter | 归约分散(梯度分片) |
| 实现库 | NCCL(NVIDIA)/ RCCL(AMD) |
B300 HGX 8 卡的集合通信走 NVLink 域(SHARP 网内聚合加速 AllReduce)+ NVSwitch——域内通信几乎零损耗。跨机集合通信走 RDMA fabric——fabric 设计(拓扑/路由)决定跨机扩展效率。采购时集合通信压测(nccl-tests all_reduce_perf)是核心验收项。