KV Cache(Key-Value Cache)是大模型推理过程中缓存注意力机制中间结果的显存区域——每生成一个 token,都要把它的 Key 和 Value 缓存下来供后续 token 的注意力计算引用。KV Cache 的大小随上下文长度线性增长——长上下文推理的显存瓶颈就在 KV Cache。
KV Cache 是推理场景显存规划的「隐形杀手」:一个 7B 模型的权重可能只占 14GB,但长上下文的 KV Cache 可能再吃几十 GB——显存规划时只算模型权重是新手常见错误。大显存卡(H200 NVL 141GB / MI325X 256GB)在长上下文场景的优势就是 KV Cache 空间大。
| 项目 | 数值 / 口径 |
|---|---|
| 增长规律 | 随上下文长度线性 |
| 瓶颈场景 | 长上下文/大批量并发 |
| 优化技术 | PagedAttention / MQA / GQA / 量化 |
| 显存占比 | 可超权重本身 |
B300 288GB 的显存优势在长上下文推理场景最明显——KV Cache 的空间是 80GB 档的 3 倍以上。但 KV Cache 的实际大小取决于批大小、上下文长度和模型架构(MHA/GQA 差异大)——采购前用目标模型的推理压测数据定显存规格。