张量并行(Tensor Parallelism, TP)是把单层的矩阵运算切到多颗 GPU 上的并行策略:每颗 GPU 负责矩阵的一部分列或行,计算完成后通过 AllReduce/AllGather 合并结果。它是大模型训练和推理最核心的并行策略之一——与数据并行(DP)、流水线并行(PP)、专家并行(EP)并称四大并行策略。
对采购方的意义:张量并行的通信瓶颈决定了「卡间互联有多重要」——TP 切分越细,卡间通信量越大,对 NVLink/PCIe 带宽的需求越高。这就是为什么 HGX 基板(NVLink 域)比 PCIe 独立卡更适合训练——TP 的 AllReduce 在 NVLink 域内几乎零延迟。
| 项目 | 数值 / 口径 |
|---|---|
| 通信原语 | AllReduce / AllGather / ReduceScatter |
| 依赖互联 | NVLink(域内)/ RDMA(跨机) |
| NCCL | NVIDIA 集合通信库(自动选最优路径) |
| 并行策略组合 | TP × DP × PP × EP |
B300 HGX 8 卡的 NVLink 域(1.8TB/s/卡·域内全互联)让 TP=8 几乎零损耗——但 TP=8 超出域规模后需要跨机走 RDMA,通信瓶颈陡增。GB200 NVL72 把域规模扩到 72 颗——万亿参模型的 TP 可以在域内完成。