算力百科COMPUTEPEDIA

算力百科 › 技术概念 › NCCL 集合通信库

NCCL 集合通信库

NVIDIA COLLECTIVE COMMUNICATIONS LIBRARY · 技术概念词条

概述OVERVIEW

NCCL(NVIDIA 集合通信库)是「提供拓扑感知的 GPU 间通信原语」的库(NVIDIA 官方文档),专管多卡多机集合通信:AllReduce、Broadcast、Reduce、AllGather、ReduceScatter、AlltoAll、Gather、Scatter 八种原语外加点对点收发,每种集合通信收进单个 kernel 完成同步;API 仿 MPI、接口带 CUDA 流参数。

在 AI 算力机柜里,它是千卡万卡「合成一块大 GPU」的通信底座:官方文档明言训练重度依赖 AllReduce;PyTorch 官方博客把 DDP+NCCL 列为主流多卡扩展路径。传输拓扑感知自适应:PCIe、NVLink、InfiniBand Verbs、IP sockets 均可(官方文档)——柜内走 NVLink/NVSwitch,跨机走 400G/800G 网,同一套 API 通吃。

关键数字KEY NUMBERS

项目数值 / 口径
定位拓扑感知的 GPU 集合通信原语库(NVIDIA 官方文档定义)
集合原语AllReduce / AllGather / ReduceScatter 等八种 + 点对点收发(官方文档)
互联支持PCIe · NVLink · InfiniBand Verbs · IP sockets(官方文档)
版本官方文档最新 2.32.3(2026 年口径)

在 B300 上的意义ON B300

本库验收口径的「互联带宽实测」(nccl-tests 跑 all_reduce)压的就是 NCCL 这一层:B300 八卡机柜内走 NVLink/NVSwitch,多机训练再经网卡走 InfiniBand——NCCL 拓扑感知自动挑路。集合通信带宽达不达标,直接反映 NVSwitch 基板与网卡的实际成色(见「如何压测」节)。

买家视角:单卡跑分达标不等于多卡能协同——NCCL 联测要在整机乃至多机环境复测;二手机商组装的「多卡机」尤其要防八张卡各跑各的快、一通信就露馅。

边界与注意LIMITS

  • NCCL 只管通信不管计算,性能强依赖拓扑与配套:NVLink/NVSwitch、网卡、线缆、交换机任何一环掉链子,集合通信带宽就上不去;通信超时、挂死是集群运维高频坑,版本与驱动/CUDA 配套要成套核对。
  • 官方文档自述它不是完整的并行编程框架——只做 GPU 间通信加速;训练效率还得靠框架把计算与通信编排好,买家评估的是整机软件栈,不是单一库。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-11 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品