推理优化技术栈是大模型推理服务的完整技术体系——从底层到上层依次:硬件层(GPU/互连/存储)→ 编译层(TensorRT-LLM / vLLM / SGLang)→ 服务层(批处理/路由/缓存/监控)→ 业务层(用户请求/API 网关/计费)。每一层都有优化空间——「推理优化」不是单点技术而是全栈工程。
核心优化技术一览:PagedAttention(KV Cache 分页)、Continuous Batching(动态批处理)、Speculative Decoding(投机解码)、Chunked Prefill(分块预填充)、FP8/FP4 量化、Prefix Caching(前缀缓存)——每项技术都有独立的吞吐/延迟收益,组合使用效果叠加。
| 项目 | 数值 / 口径 |
|---|---|
| PagedAttention | KV Cache 分页管理(vLLM 首创) |
| Continuous Batching | 动态批处理(吞吐提升数倍) |
| Speculative Decoding | 投机解码(小模型猜+大模型验) |
| Prefix Caching | 前缀缓存(共享 prompt 免重算) |
B300 的推理优化技术栈完整覆盖:FP4/FP8 量化(硬件层)+ TensorRT-LLM/vLLM 编译(编译层)+ In-flight Batching/Prefix Caching(服务层)——每层都有独立的优化收益,组合使用效果叠加。选型时推理栈的完整度比单点峰值性能更重要。