显存是 GPU 上最埋头干活、也最怕热的部件——判读显存健康,第一课是 ECC(纠错码)机制。NVIDIA 官方手册原文口径:「单比特错误被硬件自动纠正、不造成数据损坏;双比特错误可检测但不可纠正」——单比特(可纠正)错误在坏点初期零感知,但计数持续攀升往往就是颗粒老化的前兆;双比特(不可纠正)错误则直接威胁计算正确性,训练中途报错、推理结果劣化都可能与它相关。
NVIDIA 给坏点备了三层后手:页退休(同页多次单比特错误或一次双比特错误即触发,驱动把坏页隐藏)、行重映射(坏行重定向到保留行,Ampere 起支持,预算 A100 最多 64 次、H100 达 512 次——均为 NVIDIA 官方文档口径);颗粒侧则自 HBM3 起内置片上纠错码(SK hynix 官方公告)。工具怎么读数见本库验卡指南词条,本条讲读数背后的机理。
| 项目 | 数值 / 口径 |
|---|---|
| 单比特 vs 双比特 | 单比特硬件自动纠正 · 双比特可检测不可纠正(NVIDIA nvidia-smi 官方手册) |
| 计数器两套口径 | 易失(驱动加载起算)/ 累计(终身计数)· Ampere 起累计不可清零(NVIDIA 手册) |
| 行重映射预算 | A100 最多 64 次 · H100 达 512 次(NVIDIA GPU Memory Error Management 文档) |
| 颗粒侧防线 | HBM3 起片上内置纠错码(SK hynix 2021 官方公告) |
B300 这代单卡 288GB HBM3e,显存健康直接决定整机寿命:验二手卡先读 ECC——易失计数接近零而累计计数高企,说明卡带病服役过;Ampere 起累计不可清零,这个终身计数是二手买家最硬的凭据之一。行重映射次数逼近预算上限(H100 为 512 次)的卡,要按「显存池即将缩水」来评估残值。
物理面三查:金手指(PCIe 边缘触点)看氧化、磨损与插拔痕——镀层发黑磨穿意味着多手流转或接触不良隐患;散热器看拆装痕、导热垫老化与显存侧温度(GPU-Z 可读显存温度与颗粒厂商,见验卡指南词条)——显存长期高温是单比特错误累积的第一诱因,压测时显存温度与 ECC 增量要一起盯。