vLLM 是目前最流行的开源大模型推理引擎:核心创新是 PagedAttention(把 KV Cache 像操作系统虚拟内存一样分页管理)——大幅提升显存利用率和并发吞吐。支持 Continuous Batching(动态批处理)、Tensor Parallelism、量化推理(GPTQ/AWQ/FP8)——是 vLLM 让「推理框架选型」从 NVIDIA 专有(TensorRT-LLM)变成了开源多选。
对采购方的意义:vLLM 的性能直接影响 GPU 选型——同样的卡,vLLM 的版本和配置不同,吞吐可能差 2 倍。采购前用目标模型+目标 vLLM 版本跑基准是选型的必要步骤。vLLM 同时支持 CUDA(NVIDIA)和 ROCm(AMD)——跨阵营选型时它是共同的推理栈底座。
| 项目 | 数值 / 口径 |
|---|---|
| 核心创新 | PagedAttention(KV Cache 分页管理) |
| 支持硬件 | NVIDIA CUDA + AMD ROCm |
| 并发能力 | Continuous Batching(动态批处理) |
| 开源 | Apache 2.0 |
vLLM 对 B300 的支持随 CUDA/Blackwell 生态成熟——FP8/FP4 量化的推理路径需要最新版本的 vLLM 和模型支持。采购前用目标模型+vLLM 最新版跑基准(吞吐/延迟/并发)——基准数据是选型的硬依据。