算力百科COMPUTEPEDIA

算力百科 › 技术概念 › 集合通信

集合通信

COLLECTIVE COMMUNICATION · 技术概念词条

概述OVERVIEW

集合通信(Collective Communication)是多个 GPU/节点之间的协同通信模式——不是「A 发给 B」的点对点通信,而是「全体参与者共同完成一次通信操作」。四大核心原语:AllReduce(全体归约,训练梯度同步用)、AllGather(全体收集,推理输出合并用)、Broadcast(广播,参数分发用)、ReduceScatter(归约分散,梯度分片用)。

AI 训练的吞吐瓶颈通常在集合通信:大模型训练的数据并行梯度同步走 AllReduce、张量并行的中间结果走 AllGather/ReduceScatter——集合通信的效率直接决定训练的扩展效率。NCCL(NVIDIA)/ RCCL(AMD)是集合通信的标准库实现。

关键数字KEY NUMBERS

项目数值 / 口径
AllReduce全体归约(训练梯度同步)
AllGather全体收集(推理输出合并)
ReduceScatter归约分散(梯度分片)
实现库NCCL(NVIDIA)/ RCCL(AMD)

在 B300 上的意义ON B300

B300 HGX 8 卡的集合通信走 NVLink 域(SHARP 网内聚合加速 AllReduce)+ NVSwitch——域内通信几乎零损耗。跨机集合通信走 RDMA fabric——fabric 设计(拓扑/路由)决定跨机扩展效率。采购时集合通信压测(nccl-tests all_reduce_perf)是核心验收项。

边界与注意LIMITS

  • 集合通信效率=fabric 效率:跨机 AllReduce 的吞吐受限于最慢链路——fabric 中一条劣化链路会拖慢全体。
  • 算法选择影响性能:Ring/Tree 等集合通信算法在不同拓扑下性能不同——NCCL 自动选择但极端拓扑可能次优。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品