算力百科COMPUTEPEDIA

算力百科 › 技术概念 › 张量并行

张量并行

TENSOR PARALLELISM · 技术概念词条

概述OVERVIEW

张量并行(Tensor Parallelism, TP)是把单层的矩阵运算切到多颗 GPU 上的并行策略:每颗 GPU 负责矩阵的一部分列或行,计算完成后通过 AllReduce/AllGather 合并结果。它是大模型训练和推理最核心的并行策略之一——与数据并行(DP)、流水线并行(PP)、专家并行(EP)并称四大并行策略。

对采购方的意义:张量并行的通信瓶颈决定了「卡间互联有多重要」——TP 切分越细,卡间通信量越大,对 NVLink/PCIe 带宽的需求越高。这就是为什么 HGX 基板(NVLink 域)比 PCIe 独立卡更适合训练——TP 的 AllReduce 在 NVLink 域内几乎零延迟。

关键数字KEY NUMBERS

项目数值 / 口径
通信原语AllReduce / AllGather / ReduceScatter
依赖互联NVLink(域内)/ RDMA(跨机)
NCCLNVIDIA 集合通信库(自动选最优路径)
并行策略组合TP × DP × PP × EP

在 B300 上的意义ON B300

B300 HGX 8 卡的 NVLink 域(1.8TB/s/卡·域内全互联)让 TP=8 几乎零损耗——但 TP=8 超出域规模后需要跨机走 RDMA,通信瓶颈陡增。GB200 NVL72 把域规模扩到 72 颗——万亿参模型的 TP 可以在域内完成。

边界与注意LIMITS

  • TP 度数越高通信越重:TP=8 的 AllReduce 通信量远大于 TP=2——TP 度数要匹配 NVLink 域规模(域内跑 TP、跨域跑 DP/PP)。
  • TP 切分有最小粒度限制:模型的注意力头数和 FFN 维度必须能被 TP 度数整除——不合适的 TP 度数会导致负载不均衡。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品