TensorRT-LLM(TRT-LLM)是 NVIDIA 的大模型推理优化引擎:把 PyTorch/HuggingFace 模型编译优化成 NVIDIA GPU 上的高性能推理引擎——核心优化包括算子融合、精度量化(FP8/FP4)、KV Cache 管理(PagedAttention)、In-flight Batching(动态批处理)等。
对采购方的意义:TensorRT-LLM 是 NVIDIA 推理性能标称数字的软件底座——厂商标称的推理吞吐通常基于 TRT-LLM 优化后的结果。采购时如果不使用 TRT-LLM(如用 vLLM),实际吞吐会低于标称值——但差距正在缩小(vLLM 的性能持续优化中)。
| 项目 | 数值 / 口径 |
|---|---|
| 优化维度 | 算子融合 · 量化 · PagedAttention · In-flight Batching |
| 支持模型 | LLaMA / Mistral / Qwen / DeepSeek / ChatGLM 等 |
| 配套工具 | TensorRT Model Optimizer(量化) |
| 开源 | GitHub 开源(Apache 2.0) |
B300 的 FP4 推理性能标称基于 TensorRT-LLM 的 FP4 路径——实际部署时如果用 vLLM 或其他推理框架,性能可能低于 TRT-LLM 的最优值。采购前用目标模型+目标推理框架跑基准才是准确的选型依据。