规格词条 · 中卡 STANDARD CARD
NVIDIA L40S
Ada代48GB单卡推理/渲染/Omniverse全能主力,FP8稀疏1,466TF+AV1编解码,是当前国内现货流通量最大的大显存Ada卡之一

NVIDIA 厂商官方图
实拍
实拍图
概述
NVIDIA L40S 是基于 Ada Lovelace 架构的 PCIe 双槽数据中心 GPU,搭载 48GB GDDR6 显存(带 ECC)与 864GB/s 显存带宽,通过 PCIe Gen4 x16 提供双向 64GB/s 互联。它配备 18,176 个 CUDA 核心、142 个第三代 RT Core 与 568 个第四代 Tensor Core,FP8 Tensor Core 算力可达 1,466 TFLOPS(稀疏),并集成三组 NVENC/NVDEC 编解码单元,支持 AV1 编解码。凭借大显存、高算力与视频处理能力的组合,L40S 常用于大模型推理、图像生成、光线追踪渲染以及 Omniverse 等数字孪生工作负载,是国内现货流通量较大的大显存 Ada 卡之一。
核心规格
| 架构 | NVIDIA Ada Lovelace architecture |
| 显存 | 48 GB GDDR6 with ECC |
| 显存带宽 | 864 GB/s |
| FP32算力 | 91.6 teraFLOPS |
| FP16算力 | 733 teraFLOPS* |
| FP8算力 | 1,466 teraFLOPS* |
| 功耗TDP | 350 W |
| 互联 | PCIe Gen4 x16 |
| 形态 | 4.4" (H) x 10.5" (L), dual slot |
| 编解码器 | 3x (includes AV1 encode and decode) |
规格已与官方基准快照对账(
基准来源,采集 2026-10-09)· 价格以货主实际报价为准
适用场景
- 大语言模型与多模态模型的单卡或小规模集群推理部署,48GB 显存可承载较大参数量的模型与较长上下文
- 基于 FP8/INT8 量化的高性能推理服务,利用 1,466 TFLOPS(稀疏)的 Tensor Core 算力提升吞吐
- 依托 142 个第三代 RT Core 进行离线与实时光线追踪渲染、可视化和内容制作
- Omniverse 与数字孪生应用,以及利用三组 NVENC/NVDEC(含 AV1)的批量视频转码与流媒体处理
同族型号
采购与验货要点
- 注意整机与机房供电:L40S 单卡最大功耗 350W,采用 16-pin 供电接口,整机需预留相应冗余电源与线缆,机柜功率密度要按此规划
- 确认散热与机箱形态:该卡为被动散热的双槽全高设计,尺寸约 4.4 英寸高、10.5 英寸长,必须安装在具有足够风道的服务器中,不支持普通桌面机箱直接使用
- 互联与部署拓扑:L40S 仅支持 PCIe Gen4 x16(双向 64GB/s),不支持 NVLink,也不支持 MIG 分区,多卡间通信需走 PCIe 与主机侧网络,采购时应结合业务对卡间带宽的需求选型;同时可留意 Secure Boot 与 NEBS Level 3 认证对交付环境的意义
常见问题
NVIDIA L40S 显存多大?跑大模型推理够用吗?
L40S 配备 48GB GDDR6 显存,支持 ECC 校验,显存带宽为 864GB/s。对于推理而言,48GB 可以容纳较大参数量的模型或通过量化进一步扩展容量,适合大多数单卡推理部署需求。
L40S 支持 NVLink 和 MIG 吗?多卡训练怎么办?
L40S 不支持 NVLink 互联,也不支持 Multi-Instance GPU(MIG)分区。卡间通信只能通过 PCIe Gen4 x16(双向 64GB/s),因此它更适合推理、渲染等场景;如果业务对卡间高带宽通信敏感(如大规模多卡训练),需要在组网设计上额外评估。
L40S 的视频编解码能力怎么样?能处理 AV1 吗?
可以。L40S 集成 3 组 NVENC 编码器和 3 组 NVDEC 解码器,包含对 AV1 编码与解码的硬件支持,适合用于视频转码、流媒体处理以及与渲染/Omniverse 结合的图形视频生成类工作负载。
采集 2026-10-09 · 侦察 侦察兵-自动小弟B1 · 升级厚词条走
编辑政策 流程