算力百科COMPUTEPEDIA

算力百科 › 技术概念 › Tensor Core 张量核心

Tensor Core 张量核心

NVIDIA TENSOR CORE · 技术概念词条

概述OVERVIEW

Tensor Core 是 NVIDIA Volta 架构(2017)引入的专用矩阵计算单元——每个 Tensor Core 在一个时钟周期内完成一次 4×4 矩阵乘法运算。它解决的是同一个问题:深度学习的核心运算是矩阵乘法(GEMM),通用 CUDA 核心做矩阵乘效率低,Tensor Core 专门为此设计。

每一代 Tensor Core 支持的精度在演进:第一代(Volta)FP16;第二代(Turing)INT8/INT4;第三代(Ampere)BF16/TF32;第四代(Hopper)FP8;第五代(Blackwell)FP4。每一代新精度都让「同样面积塞更多算力」——这也是 B300 FP4 算力爆炸式增长的底层原因。

关键数字KEY NUMBERS

项目数值 / 口径
第五代(Blackwell)FP4/FP6/FP8/FP16/BF16/TF32/FP64
FP4 算力(B300)约 15 PFLOPS 稠密 / 稀疏更高
FP8 算力(H100)3,341 TFLOPS(稀疏)
代际数量第五代(Blackwell)

在 B300 上的意义ON B300

B300 的第五代 Tensor Core 原生支持 FP4 和 FP6 精度——大模型推理可以量化到 FP4 而几乎不掉精度,这意味着同样的硅面积可以塞 2 倍于 FP8 的算力。买家看参数时要注意:NVIDIA 标称的 FP4 算力是稀疏口径,稠密口径减半——实际推理吞吐取决于框架的量化支持程度(TensorRT-LLM / vLLM 等)。

边界与注意LIMITS

  • Tensor Core 只加速矩阵运算:非矩阵运算(标量/向量操作)仍然走 CUDA 核心——并非所有计算都受益。
  • 低精度换 throughput 的 trade-off:FP4 量化可能损失模型精度——是否可用取决于模型和任务(分类/检索容忍度高,生成式任务容忍度低)。
  • 代际锁定:每代 Tensor Core 的新精度需要新版本 CUDA/框架支持——旧框架跑新卡的精度能力需要升级。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品