算力百科 › 技术概念 › Tensor Core 张量核心
Tensor Core 是 NVIDIA Volta 架构(2017)引入的专用矩阵计算单元——每个 Tensor Core 在一个时钟周期内完成一次 4×4 矩阵乘法运算。它解决的是同一个问题:深度学习的核心运算是矩阵乘法(GEMM),通用 CUDA 核心做矩阵乘效率低,Tensor Core 专门为此设计。
每一代 Tensor Core 支持的精度在演进:第一代(Volta)FP16;第二代(Turing)INT8/INT4;第三代(Ampere)BF16/TF32;第四代(Hopper)FP8;第五代(Blackwell)FP4。每一代新精度都让「同样面积塞更多算力」——这也是 B300 FP4 算力爆炸式增长的底层原因。
| 项目 | 数值 / 口径 |
|---|---|
| 第五代(Blackwell) | FP4/FP6/FP8/FP16/BF16/TF32/FP64 |
| FP4 算力(B300) | 约 15 PFLOPS 稠密 / 稀疏更高 |
| FP8 算力(H100) | 3,341 TFLOPS(稀疏) |
| 代际数量 | 第五代(Blackwell) |
B300 的第五代 Tensor Core 原生支持 FP4 和 FP6 精度——大模型推理可以量化到 FP4 而几乎不掉精度,这意味着同样的硅面积可以塞 2 倍于 FP8 的算力。买家看参数时要注意:NVIDIA 标称的 FP4 算力是稀疏口径,稠密口径减半——实际推理吞吐取决于框架的量化支持程度(TensorRT-LLM / vLLM 等)。