规格词条 · 中卡 STANDARD CARD
Intel Gaudi 3
Intel 现役 AI 加速器旗舰(2024 Vision 发布), 以太网原生 RoCE 互联打破 NVLink 封闭生态的第三厂商算力卡, IBM 云与 Dell XE9680 已实际部署, 补齐百科厂商覆盖线
概述
Intel Gaudi 3 是 Intel 面向大规模 AI 训练与推理推出的加速器产品线,采用台积电 5nm 工艺与双 die 架构,两颗相同计算 die 通过中介层桥接的高带宽低时延互连协同工作。其 MME 矩阵引擎在 BF16 与 FP8 下均提供 1678 TFLOPS 算力,配合 64 个 TPC 单元与 8 个 MME 单元;显存为 128 GB HBM2e(8 颗 16GB 堆叠),另有 96 MB 片上 SRAM。该产品以原生以太网 RoCE 互联为特色,提供形态为 OAM(HL-325L)与 PCIe(HL-338)两种版本,典型用途涵盖大模型训练、推理部署及数据中心集群扩展。
核心规格
| 架构 | Gaudi 3 (第5代异构AI加速架构, 2颗 identical compute die 经 interposer 桥接软件透明, TSMC 5nm) |
| 显存 | 128GB HBM2e (8×16GB stacks, 3.6GHz, 双die统一寻址) |
| 显存带宽 | 3.7 TB/s 峰值 (官方白皮书未公开位宽, 按带宽收录) |
| 算力 | MME矩阵: FP8 1678 / BF16 1678 / FP16(signed) 459 / TF32 459 / FP32 229 TFLOPS; TPC向量: FP8 57.3 / BF16 28.7 / FP16 28.7 / FP32 14.3 TFLOPS (全dense口径, 官方白皮书全文无稀疏数字) |
| 计算引擎 | 8× MME (每MME 64K MACs) + 64× TPC核心 (双die合计) |
| 片上SRAM | 96MB (12.8/6.4 TB/s 读/写) |
| 功耗 | OAM HL-325L: 900W TDP (被动散热; 液冷亦900W) | PCIe HL-338卡: 600W TDP (被动散热) |
| 互联 | 24× 200GbE RoCE (双向合计1200GB/s, 经48×112G PAM4 SerDes; 每卡21口卡间互联+3口scale-out) + PCIe Gen5 x16 主机接口 (128GB/s, 单向64GB/s) |
| 媒体解码 | 14路媒体解码器 |
| 形态 | OAM HL-325L (OCP OAM 2.0 mezzanine) / PCIe HL-338 卡 (CEM 5.1) / HLB-325 通用基板 (8卡 all-to-all 全互联, 6× OSFP800 scale-out) |
| 发布年 | 2024 (2024-04-09 Intel Vision 发布, Q2 2024 OEM 上市) |
规格已与官方基准快照对账(
基准来源,采集 2026-10-10)· 价格以货主实际报价为准
适用场景
- 大规模语言模型的分布式训练,借助每 OAM 21 组 OAM 间互连与 3 组扩展口的 24 路 200GbE RoCE 组网能力构建集群
- BF16/FP8 混合精度推理服务,利用 128 GB HBM2e 承载大参数量模型
- 基于 HLB-325 基板的 8 卡一体化节点,适合要求卡间全互联、低通信开销的训练任务
- 采用 PCIe Gen5 X16 主机接口的 HL-338 卡,适合已有通用服务器机房的弹性算力补充与推理扩容
同族型号
| 型号 | 显存 | 功耗 |
|---|
| Intel Data Center GPU Max 1550 对比 | 128GB HBM2e(每 Xe-Stack 挂独立 HBM2e stacks;Aurora 单卡 STREAM 实测 2.1TB/s) | 600W TDP(ARK 官方;Aurora ECP 实配为 CPU/GPU 4kW 均衡下 GPU 持续 500W 档) |
视频讲解 VIDEO
采购与验货要点
- 注意形态与散热约束:OAM 版 HL-325L 为被动散热设计,PCIe 版 HL-338 同样为被动散热,采购前需确认机柜风道、导风罩与气流组织能满足整卡散热需求,密闭高密度节点应评估液冷方案兼容性
- 确认机房网络条件:该产品互联基于 200GbE RoCE,HLB-325 基板对外通过 6 个 OSFP800 端口输出,需提前规划以太网交换机、光模块与布线,无需专用封闭互联生态
- 验货时核对白皮书口径:官方技术文档(doc 817486)未提供稀疏算力与显存位宽字段,供应商口径若含稀疏指标应要求注明测试条件;同时确认主机侧 PCIe Gen5 X16 插槽规格与供电满足整卡要求
常见问题
Intel Gaudi 3 与前代 Gaudi 2 相比提升有多大?
根据 Intel 在 Vision 2024 上公布的口径,Gaudi 3 相对 Gaudi 2 提供 4 倍 BF16 AI 算力与 1.5 倍显存带宽提升,工艺也从 Gaudi 2 的 7nm 升级到 5nm,架构改为双 die 通过中介层互连的设计。
Gaudi 3 的 OAM 版和 PCIe 版有什么区别?
OAM 版(HL-325L)面向高密度集群节点,卡间通过 21 组 OAM 间链路实现全互联,并通过 HLB-325 基板组成 8 卡系统,对外提供 24 路 200GbE RoCE;PCIe 版(HL-338)采用标准 PCIe CEM 5.1 接口,可直接插入通用服务器,组网与部署方式更灵活,但互联拓扑与密度不及 OAM 方案。
使用 Gaudi 3 需要什么网络环境?是否依赖专用互联协议?
Gaudi 3 原生采用以太网 RoCE 互联,每个 OAM 提供 24 路 200GbE(由 48 路 112G PAM4 SerDes 实现),其中 21 路用于 OAM 间互连、3 路用于向外扩展。这意味着用户可基于标准以太网交换机构建集群,不依赖封闭的专有互联生态,但需要准备支持 200GbE RoCE 的交换机与相应光互连资源。
采集 2026-10-10 · 侦察 C-侦察兵-GAUDI3-1010 · 升级厚词条走
编辑政策 流程