算力百科COMPUTEPEDIA

算力百科 › 技术概念 › 推理吞吐基准

推理吞吐基准

INFERENCE BENCHMARK · 技术概念词条

概述OVERVIEW

推理吞吐基准(Inference Benchmark)是评估 GPU 推理性能的核心测试:不是「跑一个标准软件看分数」,而是「用目标业务的真实模型、真实精度、真实批量在目标 GPU 上测吞吐和延迟」——**基准的价值在于「贴近真实」而非「数字好看」**。

核心指标:吞吐(tokens/s,每秒生成 token 数)决定服务容量;延迟(TTFT 首字延迟/ITL 逐 token 延迟)决定用户体验;并发数决定服务能力。采购方的选型基准应该是「目标模型+目标精度+目标批量」的组合实测——而不是厂商发布的通用跑分。

关键数字KEY NUMBERS

项目数值 / 口径
吞吐tokens/s(每秒生成 token 数)
TTFT首字延迟(用户体感核心)
ITL逐 token 延迟(流畅度指标)
合格线≥公开基准 80%(判例框架口径)

在 B300 上的意义ON B300

B300 的 FP4 推理吞吐基准——采购方应该用自己业务的真实模型+真实精度+真实批量在 B300 上跑基准——厂商的演示数字不能作为采购依据。基准工具推荐:vLLM benchmark_serving / TensorRT-LLM benchmark / MLPerf Inference。

边界与注意LIMITS

  • 基准数字的口径陷阱:厂商标称的吞吐通常是「最大理论值」——实际业务负载下的吞吐可能只有标称的 50-80%(取决于批大小/上下文长度/精度策略)。
  • 基准工具差异:不同基准工具(vLLM benchmark / MLPerf / TensorRT-LLM benchmark)的测试方法不同——跨工具对比需要统一口径。
  • 基准不能替代 POC:基准数字只是起点——真实的业务 POC(Proof of Concept)才能验证端到端的表现(含数据管线/前后处理/运维监控)。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品