
L40S是 NVIDIA Ada Lovelace 架构的PCIe 双槽数据中心 GPU:48GB GDDR6 ECC、FP8 Tensor Core 1,466 TFLOPS(稀疏口径)、FP32 91.6 TFLOPS,350W 双槽被动形态——官方给它的定位是「渲染与推理兼顾的双能卡」:图形(3×NVENC/3×NVDEC 含 AV1、RT Core 212 TFLOPS)与 AI 推理(FP8/INT8)一台机器全包(NVIDIA 官方规格口径[1])。
它在国内现货市场的走红逻辑很朴素:48GB 大显存 + PCIe 即插即用 + 不占 NVLink 资源——不需要 HGX 基板、不需要整机定制,普通 2U 服务器插上就能跑 70B 级量化推理与 SD/视频生成管线。它是 2024-2026 年推理侧走量最大的数据中心卡之一(本库验货经验口径),也是「AI 推理 + 渲染农场 + 视频转码」混合业务的最优解之一。
买 L40S 的三件事:与 L40/L40S 的价差核对(差 2 TFLOPS 的 FP32 与 50W 功耗,价差要对得上)、16-pin 供电转接(老电源要合规转接线)、Secure Boot 与 NEBS 认证状态(企业合规场景的硬指标,官方规格口径[1])。本词条不带行情带——价格以货主实际报价为准。
萬安指数(0–100):本库按公开规格加权估算——显存 40% + 互联 30% + 生态 30%,按场景调权。
2023 年,L40S 发布:Ada Lovelace 架构的 L40 升级版——FP32 91.6 TFLOPS(L40 为 90.5)、同款 48GB GDDR6 与 3×NVENC/3×NVDEC,主攻「生成式 AI 推理+图形」双能定位(NVIDIA 官方规格与产品线口径[1][2])。
2024 年,推理走量期:生成式 AI 推理需求爆发,L40S 以「48GB + PCIe 即插即用」的组合成为推理侧走量主力——视频生成管线(SD/可灵类)、大模型量化推理、转码农场三线并进(本库整理口径)。
2025-2026 年,现货主力地位延续:更新的 RTX 6000 Ada(工作站线)与 L40(原版)并行流通,L40S 凭借 FP8 与 NEBS 认证保持推理侧性价比甜点位。后续 Ada 后继产品线随 NVIDIA 公开路线图演进。跨境流通政策仍在演进,采购时以主管部门政策与专业意见为准(公开报道口径)。
| 项目 | 规格(NVIDIA L40S · 官方口径) |
|---|---|
| GPU 架构 | NVIDIA Ada Lovelace |
| 单卡显存 | 48GB GDDR6 with ECC |
| 显存带宽 | 864GB/s |
| CUDA / Tensor / RT 核心 | 18,176 CUDA · 568 个第四代 Tensor Core · 142 个第三代 RT Core(RT 性能 212 TFLOPS) |
| FP32 | 91.6 TFLOPS |
| TF32 Tensor | 183 TFLOPS(稀疏 366) |
| BF16 / FP16 Tensor | 362.05 TFLOPS(稀疏 733) |
| FP8 / INT8 Tensor | 733 TFLOPS(稀疏 1,466) |
| 编解码器 | 3× NVENC | 3× NVDEC(含 AV1 编解码) |
| 主机接口 | PCIe Gen4 x16(双向 64GB/s) |
| 功耗 / 供电 | 350W · 1× 16-pin |
| 形态 | 4.4"(H) × 10.5"(L) 双槽 · 被动散热 |
| 显示输出 | 4× DisplayPort 1.4a |
| 安全 / 认证 | Secure Boot with Root of Trust · NEBS Ready Level 3 |
| MIG / NVLink | 不支持 MIG · 不支持 NVLink(PCIe 独立卡定位) |
规格以 NVIDIA 官方快照为准(2026-10 口径[1],与本库薄卡逐条对账一致);「稀疏」为官方以星号标注口径,dense 减半。
| 项目 | L40 | L40S(本词条) | L40S vs L40 一句话 |
|---|---|---|---|
| FP32 | 90.5 TFLOPS | 91.6 TFLOPS | FP32 差 1 档、功耗差 50W、价差要匹配——推理优先选 L40S,纯渲染预算敏感看 L40 |
| 功耗 | 300W | 350W | |
| 显存 | 48GB GDDR6 ECC | 48GB GDDR6 ECC |
L40 对照为本库薄卡同款官方快照口径;L40S 的 FP8/INT8 提升来自频率与供电强化(同架构)。
Ada Lovelace 数据中心卡家族按定位分档;L40S 是推理/图形双能档:
L40S 是 4.4 英寸高 × 10.5 英寸长的双槽被动卡(350W、1× 16-pin 供电)——被动散热依赖服务器强制风道,普通塔式工作站插卡要加涡轮风扇方案。部署三对表:供电(16-pin 接口,老电源用合规转接线,350W 满载线材规格核好)、PCIe Gen4 槽位直连(x16 直连 CPU,过 switch 吃带宽)、风道(双槽被动卡对机箱风道敏感,满载 350W 的进风温度要控制)。
多卡部署:2U 服务器常见 2-4 卡配置,4 卡满载 1.4kW 的风道压力要认真算——L40S 无 NVLink 意味着多卡是「并列算力」而非「互联域」,推理与渲染场景正好,训练场景不适用。
| 模型 / 场景 | 显存需求(FP16 估算) | L40S 部署口径 | 萬安指数 |
|---|---|---|---|
| 70B 级量化推理 | INT4/FP8 约 35-40GB | 单卡 48GB 临界可跑(KV cache 精打),双卡余量舒适 | 84 |
| SD / 视频生成管线 | FP16 8-24GB | 单卡多并发,FP8 加速管线流畅 | 88 |
| 视频转码农场 | —(编解码器负载) | 3×NVENC/3×NVDEC 含 AV1,转码密度行业标杆 | 90 |
| 大模型训练 | — | 无 NVLink/无 MIG——训练场景不适用(对照 A100/H100 词条) | 45 |
显存按 FP16 权重 ≈ 参数量 × 2 字节估算(推算口径,未含 KV cache);量化部署的精度策略随框架而定。

| 项目 | 要求 / 现状 |
|---|---|
| CUDA | Ada 架构(计算能力 8.9)——CUDA 11.8 起完整支持,现役 12.x 全覆盖 |
| 框架 | PyTorch / TensorFlow / vLLM 全支持(推理侧生态成熟) |
| 图形栈 | Omniverse / DCC 全支持——4×DP 1.4a 直连显示器(数据中心卡少见) |
| 虚拟化 | vGPU 支持(RTX vWS/vPC 授权口径)——VDI 与云工作站方案成熟 |
| 驱动 | NVIDIA 数据中心驱动线(与 A/H 系共用) |
Ada 生态与 Ampere 共享 CUDA 主线;vGPU 授权类型按使用场景采购(官方口径)。软件版本随时间演进,以 NVIDIA 官方发布为准。
L40S 采购的验货要点(三项):
完整六项压测判例见本词条「如何压测」节。
六项压测口径,数值判例全部按 L40S 实锚:开箱识别 → 单卡烤机(350W)→ FP8/INT8 算力 → 编解码并发 → 图形渲染 → 长稳烤机。
L40S 的产品定位:RT Core 图形能力 + FP8 AI 推理能力同卡兼备——渲染农场白天渲染、夜里跑推理,一台机器两用(官方定位口径)。
新一代视频编码标准(同画质码率比 H.264 省约 30-50%,行业口径):L40S 的 3×NVENC/3×NVDEC 均含 AV1——流媒体与云游戏场景的带宽成本利器。
电信级设备认证(Network Equipment-Building System):抗震、散热、可靠性达电信机房标准——L40S 的 NEBS Ready 认证让它能进运营商级机房(官方规格口径)。
硬件信任根安全启动:固件签名校验防篡改——企业合规与政企采购的安全底线项(官方规格口径),验货时安全启动状态列入检查。
新一代 PCIe 供电接口(CEM5 规格系):单接口供 350W+——老电源需要合规转接线,转接线质量是 L40S 稳定运行的隐性变量。
L40S 现货以原厂新品与整机拆机并行,成色与渠道让价差存在——暂无可复核的统一行情快照,本库诚实原则:不做行情带,价格以货主实际报价为准。
在售检索:萬安算交所大厅 ›(0 佣金撮合、不参与交易,数据因此中立)。行情快照积累充分后本节将切换为标准行情带。
推理与 AI 场景选 L40S:FP8/INT8 算力翻倍(733/1,466 对 L40 的 362/733 稀疏口径)、功耗 350W 对 300W——推理吞吐的差距大于价差;纯渲染预算敏感看 L40。
量化后可以:INT4/FP8 约 35-40GB 对 48GB 显存临界可跑(KV cache 精打),双卡余量舒适;FP16 原版 140GB 装不下——量化部署是 L40S 的主流姿势。
不建议:无 NVLink(多卡无互联)、无 MIG(不能切分)——训练场景既缺互联又缺切分能力。L40S 的定位在推理、转码与图形,训练看 A100/H100/B300 词条。
三件:nvidia-smi 甄别 L40 冒充(FP32 91.6 对 90.5、350W 对 300W)、16-pin 供电与转接线状态(返修常见原因)、NVENC/AV1 编解码实测(转码场景核心卖点)。金手指与散热器原装性目检。
要加涡轮风扇:L40S 是双槽被动卡(无风扇),塔式工作站风道推不动 350W 被动散热——主动散热转接架或机架式服务器是正确姿势;另外 16-pin 供电与 Gen4 x16 槽位也要核。