推理吞吐基准(Inference Benchmark)是评估 GPU 推理性能的核心测试:不是「跑一个标准软件看分数」,而是「用目标业务的真实模型、真实精度、真实批量在目标 GPU 上测吞吐和延迟」——**基准的价值在于「贴近真实」而非「数字好看」**。
核心指标:吞吐(tokens/s,每秒生成 token 数)决定服务容量;延迟(TTFT 首字延迟/ITL 逐 token 延迟)决定用户体验;并发数决定服务能力。采购方的选型基准应该是「目标模型+目标精度+目标批量」的组合实测——而不是厂商发布的通用跑分。
| 项目 | 数值 / 口径 |
|---|---|
| 吞吐 | tokens/s(每秒生成 token 数) |
| TTFT | 首字延迟(用户体感核心) |
| ITL | 逐 token 延迟(流畅度指标) |
| 合格线 | ≥公开基准 80%(判例框架口径) |
B300 的 FP4 推理吞吐基准——采购方应该用自己业务的真实模型+真实精度+真实批量在 B300 上跑基准——厂商的演示数字不能作为采购依据。基准工具推荐:vLLM benchmark_serving / TensorRT-LLM benchmark / MLPerf Inference。