算力百科COMPUTEPEDIA

算力百科 › 技术概念 › KV Cache 推理缓存

KV Cache 推理缓存

KV CACHE · 技术概念词条

概述OVERVIEW

KV Cache(Key-Value Cache)是大模型推理过程中缓存注意力机制中间结果的显存区域——每生成一个 token,都要把它的 Key 和 Value 缓存下来供后续 token 的注意力计算引用。KV Cache 的大小随上下文长度线性增长——长上下文推理的显存瓶颈就在 KV Cache。

KV Cache 是推理场景显存规划的「隐形杀手」:一个 7B 模型的权重可能只占 14GB,但长上下文的 KV Cache 可能再吃几十 GB——显存规划时只算模型权重是新手常见错误。大显存卡(H200 NVL 141GB / MI325X 256GB)在长上下文场景的优势就是 KV Cache 空间大。

关键数字KEY NUMBERS

项目数值 / 口径
增长规律随上下文长度线性
瓶颈场景长上下文/大批量并发
优化技术PagedAttention / MQA / GQA / 量化
显存占比可超权重本身

在 B300 上的意义ON B300

B300 288GB 的显存优势在长上下文推理场景最明显——KV Cache 的空间是 80GB 档的 3 倍以上。但 KV Cache 的实际大小取决于批大小、上下文长度和模型架构(MHA/GQA 差异大)——采购前用目标模型的推理压测数据定显存规格。

边界与注意LIMITS

  • KV Cache 不可压缩到零:量化 KV Cache(FP8/INT4)可以省显存但可能掉精度——精度敏感场景慎用。
  • 多租户共享的隔离风险:多个用户共享同一张卡的 KV Cache 空间——一个用户的长上下文可能挤占其他用户的空间。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品