算力百科COMPUTEPEDIA

算力百科 › 技术概念 › vLLM 推理引擎

vLLM 推理引擎

VLLM · 技术概念词条

概述OVERVIEW

vLLM 是目前最流行的开源大模型推理引擎:核心创新是 PagedAttention(把 KV Cache 像操作系统虚拟内存一样分页管理)——大幅提升显存利用率和并发吞吐。支持 Continuous Batching(动态批处理)、Tensor Parallelism、量化推理(GPTQ/AWQ/FP8)——是 vLLM 让「推理框架选型」从 NVIDIA 专有(TensorRT-LLM)变成了开源多选。

对采购方的意义:vLLM 的性能直接影响 GPU 选型——同样的卡,vLLM 的版本和配置不同,吞吐可能差 2 倍。采购前用目标模型+目标 vLLM 版本跑基准是选型的必要步骤。vLLM 同时支持 CUDA(NVIDIA)和 ROCm(AMD)——跨阵营选型时它是共同的推理栈底座。

关键数字KEY NUMBERS

项目数值 / 口径
核心创新PagedAttention(KV Cache 分页管理)
支持硬件NVIDIA CUDA + AMD ROCm
并发能力Continuous Batching(动态批处理)
开源Apache 2.0

在 B300 上的意义ON B300

vLLM 对 B300 的支持随 CUDA/Blackwell 生态成熟——FP8/FP4 量化的推理路径需要最新版本的 vLLM 和模型支持。采购前用目标模型+vLLM 最新版跑基准(吞吐/延迟/并发)——基准数据是选型的硬依据。

边界与注意LIMITS

  • vLLM 版本迭代极快:几乎每周都有新版本——生产环境的版本升级策略要谨慎(新功能的性能提升 vs 稳定性风险)。
  • 多卡并行的 TP 配置敏感:TP 度数、GPU 拓扑、批大小等参数对吞吐影响大——没有「万能配置」,逐模型调优是必要的。
  • 模型覆盖度:vLLM 支持主流开源模型——但特定架构(如 MoE 的专家路由)的支持可能滞后于模型发布。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品