算力百科 › 技术概念 › Scale-up 与 Scale-out
Scale-up(纵向扩展)和 Scale-out(横向扩展)是 AI 集群的两层互连架构:Scale-up 是「柜内扩展」——GPU 之间通过 NVLink/NVSwitch 高速全互联组成一个域(GB200 NVL72 的 72-GPU 单域);Scale-out 是「跨柜扩展」——通过 InfiniBand 或以太网把多个柜子连成更大集群。
对采购方的解读:Scale-up 决定「柜内通信有多快」(NVLink 域内带宽高但规模受限);Scale-out 决定「跨柜通信有多快」(InfiniBand/以太网带宽低但规模无限)。大模型训练的吞吐瓶颈通常在 Scale-out 层——fabric 设计(拓扑/路由/拥塞控制)是集成商的核心能力。
| 项目 | 数值 / 口径 |
|---|---|
| Scale-up 互连 | NVLink / NVSwitch(柜内) |
| Scale-out 互连 | InfiniBand / RoCE 以太网(跨柜) |
| Scale-up 带宽 | GB200 NVL72 域内 130TB/s |
| Scale-out 带宽 | ConnectX-8 每卡 800G |
B300 系的 Scale-up 走 NVLink 5(1.8TB/s/卡·域内全互联),Scale-out 走 ConnectX-8(800G·跨机 fabric)——采购整机时两层都要规划:柜内 NVLink 域的规模决定「多少卡像一颗卡」,跨柜 fabric 的设计决定「集群扩展效率」。