TensorRT 是 NVIDIA 的深度学习推理优化工具生态:官方定义「让开发者获得高性能深度学习推理的工具生态」,内含推理编译器、运行时与模型优化,构建在 CUDA 并行编程模型之上(NVIDIA TensorRT 官方页)。它把训练好的模型做层融合、内核自动调优与低精度量化,编译成针对具体 GPU 的高性能推理引擎。
在 AI 算力机柜里的角色:训练看 PyTorch,线上推理吞吐多经 TensorRT 兑现——大模型走其 LLM 专用分支 TensorRT-LLM(本库另立词条,2026-09 发布 1.0 版)。官方口径:较纯 CPU 平台提速至 36 倍,PyTorch 单行接入提至 6 倍;TensorRT-LLM 性能至高 8 倍、TCO 优化 5.3 倍、能耗降近 6 倍(NVIDIA 官方页)。
| 项目 | 数值 / 口径 |
|---|---|
| 定位 | NVIDIA 推理优化工具生态:编译器+运行时+模型优化(官方页定义) |
| 性能口径 | 较纯 CPU 平台提速至 36 倍 · PyTorch 单行接入至 6 倍(官方页) |
| TensorRT-LLM | 性能至高 8 倍 · TCO 优化 5.3 倍 · 能耗降近 6 倍(官方页) |
| 版本 | 11.x 自 2026-09 起 · 官方发布说明最新 11.4.0(2026-10 更新) |
B300(Blackwell Ultra)这代卡的推理数字都要在软件栈里兑现:NVIDIA 标的「Agentic AI 性能至高 50 倍、成本降 35 倍」就是与 TensorRT/TensorRT-LLM 栈绑定的口径(TensorRT 官方页),B300 的 FP4 推理标称同样落在 TensorRT-LLM 路径。同一颗卡,软件栈配没配对,实测吞吐能差出数倍。
买家视角:验货的推理吞吐实测要把软件栈版本(TensorRT 版本、量化精度、是否经 TensorRT-LLM)与所用模型一并写进报告,数字才可比、可复现;把自家深度优化栈跑出的分数当裸机性能卖,是二手市场常见的虚高手法。