NCCL(NVIDIA 集合通信库)是「提供拓扑感知的 GPU 间通信原语」的库(NVIDIA 官方文档),专管多卡多机集合通信:AllReduce、Broadcast、Reduce、AllGather、ReduceScatter、AlltoAll、Gather、Scatter 八种原语外加点对点收发,每种集合通信收进单个 kernel 完成同步;API 仿 MPI、接口带 CUDA 流参数。
在 AI 算力机柜里,它是千卡万卡「合成一块大 GPU」的通信底座:官方文档明言训练重度依赖 AllReduce;PyTorch 官方博客把 DDP+NCCL 列为主流多卡扩展路径。传输拓扑感知自适应:PCIe、NVLink、InfiniBand Verbs、IP sockets 均可(官方文档)——柜内走 NVLink/NVSwitch,跨机走 400G/800G 网,同一套 API 通吃。
| 项目 | 数值 / 口径 |
|---|---|
| 定位 | 拓扑感知的 GPU 集合通信原语库(NVIDIA 官方文档定义) |
| 集合原语 | AllReduce / AllGather / ReduceScatter 等八种 + 点对点收发(官方文档) |
| 互联支持 | PCIe · NVLink · InfiniBand Verbs · IP sockets(官方文档) |
| 版本 | 官方文档最新 2.32.3(2026 年口径) |
本库验收口径的「互联带宽实测」(nccl-tests 跑 all_reduce)压的就是 NCCL 这一层:B300 八卡机柜内走 NVLink/NVSwitch,多机训练再经网卡走 InfiniBand——NCCL 拓扑感知自动挑路。集合通信带宽达不达标,直接反映 NVSwitch 基板与网卡的实际成色(见「如何压测」节)。
买家视角:单卡跑分达标不等于多卡能协同——NCCL 联测要在整机乃至多机环境复测;二手机商组装的「多卡机」尤其要防八张卡各跑各的快、一通信就露馅。