算力百科COMPUTEPEDIA

算力百科 › 技术概念 › TensorRT-LLM

TensorRT-LLM

NVIDIA TENSORRT-LLM · 技术概念词条

概述OVERVIEW

TensorRT-LLM(TRT-LLM)是 NVIDIA 的大模型推理优化引擎:把 PyTorch/HuggingFace 模型编译优化成 NVIDIA GPU 上的高性能推理引擎——核心优化包括算子融合、精度量化(FP8/FP4)、KV Cache 管理(PagedAttention)、In-flight Batching(动态批处理)等。

对采购方的意义:TensorRT-LLM 是 NVIDIA 推理性能标称数字的软件底座——厂商标称的推理吞吐通常基于 TRT-LLM 优化后的结果。采购时如果不使用 TRT-LLM(如用 vLLM),实际吞吐会低于标称值——但差距正在缩小(vLLM 的性能持续优化中)。

关键数字KEY NUMBERS

项目数值 / 口径
优化维度算子融合 · 量化 · PagedAttention · In-flight Batching
支持模型LLaMA / Mistral / Qwen / DeepSeek / ChatGLM 等
配套工具TensorRT Model Optimizer(量化)
开源GitHub 开源(Apache 2.0)

在 B300 上的意义ON B300

B300 的 FP4 推理性能标称基于 TensorRT-LLM 的 FP4 路径——实际部署时如果用 vLLM 或其他推理框架,性能可能低于 TRT-LLM 的最优值。采购前用目标模型+目标推理框架跑基准才是准确的选型依据。

边界与注意LIMITS

  • NVIDIA 生态绑定:TRT-LLM 仅支持 NVIDIA GPU——AMD 卡的推理优化走 ROCm/vLLM 路线。
  • 编译时间成本:TRT-LLM 需要为每个模型/精度/批量组合编译 engine——首次部署的编译时间可能较长。
  • 版本迭代快:TRT-LLM 的版本更新频繁——旧版本 engine 可能不兼容新版本运行时,需要重新编译。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品