NVIDIA A100 时代最出名的第三厂商 AI 训练卡: 业界首创 24×100GbE RoCE 片内原生集成(打破 NVLink 封闭互联), MLPerf 性价比黑马, Databricks 2024 实测训练吞吐 1.22× A100-80GB 且推理以 2.45TB/s 带宽打平 H100 3.35TB/s; 是 Gaudi 3 以太网互联路线的起点, 补齐百科 Intel AI 加速器产品线断代
Intel Gaudi 2 是 Intel(收购 Habana Labs 后)推出的 AI 训练与推理加速器,定位于 NVIDIA A100 同代市场中的第三方选择。其架构以双 MME 矩阵引擎搭配多组 TPC 处理器为核心,配有大容量 HBM2E 显存与片上 SRAM,计算与显存子系统面向大模型训练设计。它最具辨识度的特点是在芯片内原生集成了多路 100GbE RoCE 以太网 RDMA 网口,以标准以太网实现多卡横向互联,而非依赖厂商私有互联协议。典型用途包括大规模语言模型训练、生成式 AI 推理,以及 MLPerf 等公开基准测试。
| 架构 | Gaudi 2 (第2代异构AI加速架构, 7nm, 单die: 2× MME 矩阵引擎 + 24× TPC 核心) |
| 显存 | 96GB HBM2E (6× HBM2E stacks) |
| 显存带宽 | 2.45 TB/s (docs.habana.ai 官方架构页 + Databricks 2450 GB/s; Intel Gaudi 3 白皮书对比表作 2.46 TB/s, 两官方源差 0.01) |
| 算力 | MME矩阵: FP8 865 / BF16 432 TFLOPS; TPC向量: BF16 11 TFLOPS (官方白皮书 Table 1, 全文无 sparse/dense 口径标注); FP8 支持 E4M3+E5M2 双格式, MME 累加 FP32 |
| 计算引擎 | 2× MME (矩阵乘引擎) + 24× TPC (Tensor 处理器核心) |
| 片上SRAM | 48MB (6.4/6.4 TB/s 读/写) |
| 功耗 | OAM 模组: 600W TDP (Gaudi 3 白皮书 Table 8 verbatim 'TDP 600 W'; Databricks 实测口径同为每卡 600W) |
| 互联 | 24× 100GbE RoCE v2 (片内集成 RDMA NIC, 双向合计 600GB/s; 21 口用于系统内卡间 all-to-all, Databricks 旁证) + PCIe Gen4 x16 主机接口 (双向 64GB/s, 单向 32GB/s) |
| 媒体解码 | 8路媒体解码器 (HEVC / H.264 / VP9 / JPEG) |
| 形态 | OAM 加速模组 (600W TDP, 6×HBM2E); 主机接口 PCIe Gen4 x16 (市面 PCIe CEM 卡与 SKU 型号 HL-225B/H 说法见 spec_reference 备注, 未获官方页面证实故不入规格) |
| 发布年 | 2022 (2022-05-10 Intel Vision 官宣 'Launching today', intc.com 官方新闻稿) |