算力百科COMPUTEPEDIA
规格词条 · 中卡 STANDARD CARD

Intel Gaudi 2

NVIDIA A100 时代最出名的第三厂商 AI 训练卡: 业界首创 24×100GbE RoCE 片内原生集成(打破 NVLink 封闭互联), MLPerf 性价比黑马, Databricks 2024 实测训练吞吐 1.22× A100-80GB 且推理以 2.45TB/s 带宽打平 H100 3.35TB/s; 是 Gaudi 3 以太网互联路线的起点, 补齐百科 Intel AI 加速器产品线断代

概述

Intel Gaudi 2 是 Intel(收购 Habana Labs 后)推出的 AI 训练与推理加速器,定位于 NVIDIA A100 同代市场中的第三方选择。其架构以双 MME 矩阵引擎搭配多组 TPC 处理器为核心,配有大容量 HBM2E 显存与片上 SRAM,计算与显存子系统面向大模型训练设计。它最具辨识度的特点是在芯片内原生集成了多路 100GbE RoCE 以太网 RDMA 网口,以标准以太网实现多卡横向互联,而非依赖厂商私有互联协议。典型用途包括大规模语言模型训练、生成式 AI 推理,以及 MLPerf 等公开基准测试。

核心规格

架构Gaudi 2 (第2代异构AI加速架构, 7nm, 单die: 2× MME 矩阵引擎 + 24× TPC 核心)
显存96GB HBM2E (6× HBM2E stacks)
显存带宽2.45 TB/s (docs.habana.ai 官方架构页 + Databricks 2450 GB/s; Intel Gaudi 3 白皮书对比表作 2.46 TB/s, 两官方源差 0.01)
算力MME矩阵: FP8 865 / BF16 432 TFLOPS; TPC向量: BF16 11 TFLOPS (官方白皮书 Table 1, 全文无 sparse/dense 口径标注); FP8 支持 E4M3+E5M2 双格式, MME 累加 FP32
计算引擎2× MME (矩阵乘引擎) + 24× TPC (Tensor 处理器核心)
片上SRAM48MB (6.4/6.4 TB/s 读/写)
功耗OAM 模组: 600W TDP (Gaudi 3 白皮书 Table 8 verbatim 'TDP 600 W'; Databricks 实测口径同为每卡 600W)
互联24× 100GbE RoCE v2 (片内集成 RDMA NIC, 双向合计 600GB/s; 21 口用于系统内卡间 all-to-all, Databricks 旁证) + PCIe Gen4 x16 主机接口 (双向 64GB/s, 单向 32GB/s)
媒体解码8路媒体解码器 (HEVC / H.264 / VP9 / JPEG)
形态OAM 加速模组 (600W TDP, 6×HBM2E); 主机接口 PCIe Gen4 x16 (市面 PCIe CEM 卡与 SKU 型号 HL-225B/H 说法见 spec_reference 备注, 未获官方页面证实故不入规格)
发布年2022 (2022-05-10 Intel Vision 官宣 'Launching today', intc.com 官方新闻稿)
规格已与官方基准快照对账(基准来源,采集 2026-10-10)· 价格以货主实际报价为准

适用场景

同族型号

型号显存功耗
Intel Data Center GPU Max 1550 对比128GB HBM2e(每 Xe-Stack 挂独立 HBM2e stacks;Aurora 单卡 STREAM 实测 2.1TB/s)600W TDP(ARK 官方;Aurora ECP 实配为 CPU/GPU 4kW 均衡下 GPU 持续 500W 档)
Intel Data Center GPU Max 1100 对比48GB HBM2e(ARK 官方;SURF 节点配置记 'Max 1100 48G XeLink')300W TDP(ARK 官方;STH 实拍报道两处独立确认 300W——任务卡'450W?'假设被实抓推翻,Max 1100 无 450W 档)
Intel Gaudi 3 对比128GB HBM2e (8×16GB stacks, 3.6GHz, 双die统一寻址)OAM HL-325L: 900W TDP (被动散热; 液冷亦900W) | PCIe HL-338卡: 600W TDP (被动散热)

视频讲解 VIDEO

深度阅读:Intel Gaudi 3 薄卡 (后继代: 128GB HBM2e/3.7TB/s/24×200GbE) · 厚词条NVIDIA A100 薄卡 (同代竞品, intc.com 官宣与 Databricks 实测的对比基准) · 厚词条

采购与验货要点

常见问题

Gaudi 2 为什么用以太网互联而不用 NVLink 这种私有互联?
Gaudi 2 在芯片内原生集成了多路 100GbE RoCE 网口,采用标准的 RoCEv2 RDMA 协议实现多卡通信。这条路线的意义在于使用通用以太网交换机即可搭建大规模互联拓扑,不依赖厂商私有互联生态,理论上有利于降低采购与维护门槛,也是后续 Gaudi 3 延续以太网互联路线的起点。
Gaudi 2 的实际训练性能相比 NVIDIA A100 大概什么水平?
Databricks 曾发布独立的第三方实测,在训练 MPT-7B 模型的场景下,Gaudi 2 的训练吞吐达到 A100-80GB 的约 1.22 倍。需要说明这是特定模型、特定配置下的结果,实际收益与模型结构、并行策略和软件栈版本密切相关,建议以自身业务的实测为准。
Gaudi 2 适合推理吗,显存够不够跑大模型?
适合。它配备大容量 HBM2E 显存(共 96 GB,由六颗颗粒组成),对加载参数量较大的模型比较宽裕;Databricks 的测试也指出其显存带宽在实际推理中可与更高定位的 H100 相提并论。不过推理生态和工具链的成熟度仍需结合自身技术栈评估。
信源
采集 2026-10-10 · 侦察 C-侦察兵-GAUDI2-1010夜 · 升级厚词条走 编辑政策 流程
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品