算力百科COMPUTEPEDIA
规格对比 · COMPARE

NVIDIA Tesla P4 vs NVIDIA GB300

规格NVIDIA Tesla P4NVIDIA GB300
架构Pascal (GP104-895-A1), Compute Capability 6.1;20 SM × 128 CUDA(4 GPC × 5 SM)NVIDIA Blackwell Ultra(GB300超级芯片=1 Grace CPU+2 Blackwell Ultra GPU,官方开发者博客直证'couples one Grace CPU with two Blackwell Ultra GPUs';每颗Blackwell Ultra GPU为TSMC 4NP工艺/2080亿晶体管/双die合体2.5D封装,开发者博客直证'TSMC 4NP and features 208B transistors'+'Dies per GPU: 2';机柜=36颗超级芯片即72 GPU+36 CPU,官方页直证)
显存8GB GDDR5(8 pcs 256M×32颗粒),板载ECC且出厂默认启用(官方brief:ECC Supported Enabled by default)288GB HBM3e(单GPU封装;超级芯片576GB;HGX板级2.1TB/机柜20TB并存)
显存带宽192 GB/s(官方datasheet与brief同为'Up to 192 GBytes/s',全家族口径唯一无冲突)8TB/s每GPU(官方开发者博客直证'8 TB/s per GPU';机柜'Up to 576 TB/s'÷72=8TB/s互证);超级芯片双GPU合计16TB/s(推导)
显存位宽256bit未收录(官方现行页/博客/新闻稿均未单列Blackwell Ultra显存位宽,宁缺勿编)
算力FP32 5.5 TFLOPS / INT8(DP4A) 22 TOPS(均标'* With Boost Clock Enabled';Pascal一代无Tensor Core;官方无INT4/FP64列,宁缺勿编)单超级芯片口径(主值):FP4(NVFP4) TC 40 PFLOPS稀疏|30 PFLOPS稠密(官方开发者博客直证'up to 30 PFLOPS dense, and 40 PFLOPS sparse';与机柜1440|1080÷36完全互证)。单GPU口径:FP4 20稀疏|15稠密(机柜÷72;博客稠密15直证'Ultra pushes that to 15 petaFLOPS');FP8/FP6 TC 10稀疏|5稠密(博客直证'5 | 10 PetaFLOPS'+机柜720÷72互证);INT8 TC约333 TOPS稀疏(机柜24 POPS÷72;HGX板级3 POPS÷8=375,对B200单卡9000 TOPS为代际性大砍);FP16/BF16 TC 5稀疏|2.5稠密(机柜360÷72;HGX板级36÷8=4.5);TF32 TC 2.5稀疏(机柜180÷72;HGX 18÷8=2.25);FP32约83 TFLOPS(机柜6 PFLOPS÷72;HGX 600÷8=75);FP64/FP64 TC约1.39 TFLOPS(机柜100 TFLOPS÷72;HGX 10÷8=1.25,对B200单卡37为~30倍砍——Ultra把算力让位给FP4稠密)。HGX B300板级8卡口径:FP4 144|108·FP8 72·INT8 3 POPS·FP16 36·TF32 18·FP32 600 TFLOPS·FP64 10 TFLOPS(官方页直证;低功耗SKU,不与超级芯片混写)
CUDA核心2560(20 SM × 128,官方brief与新闻稿一致)—
功耗75W(SKU 200,699-2G414-0200-100)/ 50W(SKU 201,699-2G414-0201-100);整卡全部由PCIe插槽供电,官方brief供电规格无任何外接辅助供电行(对照同场发布的P40用户指南明列CPU 8-pin)TGP 最高 1400W(单GPU,官方博客直证)
互联PCIe Gen3 x16(brief:PCI Express 3.0 ×16,支持Lane and polarity reversal);无NVLink(官方brief/datasheet均无NVLink行;Pascal代NVLink为GP100/P100 SXM2专属)NVLink第5代 1.8TB/s双向每GPU(官方开发者博客直证'1.8 TB/s bidirectional (18 links x 100 GB/s)'+HGX B300列'GPU-to-GPU 1.8 TB/s'直证;机柜130TB/s÷72≈1.81互证);超级芯片内2 GPU经NVLink+NVLink域延伸至机柜72 GPU全互联(130TB/s aggregate官方页直证);网络:ConnectX-8 SuperNIC每GPU 800Gb/s(官方页直证,Quantum-X800 IB或Spectrum-X以太)
发布年2016(官方新闻稿dateline BEIJING 2016-09-12,P4与P40同稿发布,即GTC China场合;2016-11上市;datasheet Sep16版;brief v01 2017-02-15)2025(2025-03-18 GTC发布,官方新闻稿直证;'second half of 2025'出货车官方原文直证;官方HGX页脚注与机柜页'Available Now'证实现货世代)
形态单槽半高(Low-Profile)半长 6.6英寸被动卡:68.58mm(2.7in,高) × 167.64mm(6.6in,长),整卡240g(含螺丝挡板另计9.7g半高挡板/15.6g ATX挡板),被动散热需机箱风道(支持双向进风),无显示输出超级芯片(GB300 Grace Blackwell Ultra Superchip)——部署形态:GB300 NVL72机柜36颗超级芯片全液冷单机柜(官方页'fully liquid-cooled, rack-scale'直证,即库里1.1-1.3亿锚点那台的最小计算单元)/HGX B300 NVL16 8卡板级(风冷或液冷,OEM整机厂出货形态)/DGX B300 8卡整机14.5kW;另有GB300桌面超级芯片变体(单Grace+单Blackwell Ultra,DGX Station口径,仅注记不混入本卡)
时钟Base 885 MHz / Max Boost 1531 MHz(默认Boost 1113 MHz)/ Idle 405 MHz;显存时钟 Performance 2.8 GHz(brief Table 2原文)—
媒体引擎1×解码引擎 + 2×编码引擎(datasheet:1x Decode Engine, 2x Encode Engine);官方口径35路HD(720p30) H.264实时转码+推理并发;官方15X低延迟vs上代M4/CPU、60X能效vs CPU(TensorRT+INT8场景)—
视频转码定位史上部署量最大的视频转码/边缘推理卡:半高单槽75W使其可进1U/2U服务器与NAS机箱, hyperscale视频AI服务(DeepStream生态)与自建NAS转码双场景通吃—
可靠性MTBF 1,677,428小时@35°C(非受控环境)/ 工作温度0-55°C / VBIOS 4Mbit EEPROM,UEFI Supported—
显存类型—HBM3e(GPU侧)+LPDDR5X(Grace CPU侧),官方页直证
CPU部分—Grace CPU每超级芯片1颗,72个Arm Neoverse V2核(机柜官方页'2,592 Arm Neoverse V2 cores'÷36颗直推,官方未单列单颗原文);CPU内存LPDDR5X每颗约480GB(机柜17TB÷36=472GB推导),带宽14TB/s(机柜官方页直证);GPU+CPU合计约1TB统一内存(开发者博客直证表述)
SM与CUDA核—单Blackwell Ultra GPU:160 SM/640个第五代Tensor Core(官方开发者博客直证'160 Streaming Multiprocessors (SMs) across two dies, providing 640 fifth-generation Tensor Cores');CUDA核20,480个(160 SMx每SM 128核,博客两要素直证,乘积为推导;对初代Blackwell 160 vs 144 SM为+11%)
L2缓存—未收录(官方现行信源未单列Blackwell Ultra L2容量,宁缺勿编)
机密计算—未收录(本次实抓信源未及Blackwell Ultra保密计算条目,宁缺勿编;Blackwell代际支持保密计算为B200卡已证,供厚词条另核)
编解码器—未收录(官方页/博客/新闻稿均未见GB300编解码器数量条目,宁缺勿编)
MIG切片—未收录(本次实抓信源未见GB300 MIG实例数官方条目,宁缺勿编)
← NVIDIA Tesla P4 身份卡 · NVIDIA GB300 身份卡
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品