算力百科COMPUTEPEDIA

算力百科 › 技术概念 › Scale-up 与 Scale-out

Scale-up 与 Scale-out

SCALE-UP / SCALE-OUT · 技术概念词条

概述OVERVIEW

Scale-up(纵向扩展)和 Scale-out(横向扩展)是 AI 集群的两层互连架构:Scale-up 是「柜内扩展」——GPU 之间通过 NVLink/NVSwitch 高速全互联组成一个域(GB200 NVL72 的 72-GPU 单域);Scale-out 是「跨柜扩展」——通过 InfiniBand 或以太网把多个柜子连成更大集群。

对采购方的解读:Scale-up 决定「柜内通信有多快」(NVLink 域内带宽高但规模受限);Scale-out 决定「跨柜通信有多快」(InfiniBand/以太网带宽低但规模无限)。大模型训练的吞吐瓶颈通常在 Scale-out 层——fabric 设计(拓扑/路由/拥塞控制)是集成商的核心能力。

关键数字KEY NUMBERS

项目数值 / 口径
Scale-up 互连NVLink / NVSwitch(柜内)
Scale-out 互连InfiniBand / RoCE 以太网(跨柜)
Scale-up 带宽GB200 NVL72 域内 130TB/s
Scale-out 带宽ConnectX-8 每卡 800G

在 B300 上的意义ON B300

B300 系的 Scale-up 走 NVLink 5(1.8TB/s/卡·域内全互联),Scale-out 走 ConnectX-8(800G·跨机 fabric)——采购整机时两层都要规划:柜内 NVLink 域的规模决定「多少卡像一颗卡」,跨柜 fabric 的设计决定「集群扩展效率」。

边界与注意LIMITS

  • Scale-up 规模受封装限制:NVLink 域内 GPU 数量受铜缆距离和交换芯片端口数限制——NVL72 是当前的实用上限,NVL576 是路线图。
  • Scale-out 延迟高于 Scale-up:跨机通信走网络协议栈(即使 RDMA),延迟仍高于柜内 NVLink——训练并行策略要匹配两层带宽比例。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品