算力百科COMPUTEPEDIA

算力百科 › 软件词条 › CUDA

NVIDIA 数据中心机柜官方图(厂商图)
NVIDIA 算力场景图 · 萬安算力百科(NVIDIA 官网)

CUDA

NVIDIA 并行计算平台 · 2006 年至今 · 软件词条

概述OVERVIEW

CUDA是 NVIDIA 的并行计算平台与编程模型:2006 年 11 月随 GeForce 8800(G80,统一渲染架构)发布——把 GPU 从「图形处理器」变成「通用并行计算处理器」,开发者用类 C 语言直接写 GPU 程序(NVIDIA CUDA 官方页口径[1])。今天它是 AI 算力世界的事实标准:PyTorch、TensorFlow、vLLM 之下,几乎所有主流 AI 框架的 GPU 后端都踩在 CUDA 上。

CUDA 不只是一个「驱动」——它是三层软件栈:底层驱动与硬件指令集(由卡的「计算能力」版本决定)、中层 CUDA Toolkit(nvcc 编译器、运行时)与 CUDA-X 库全家桶(cuBLAS/cuDNN/NCCL 等[2][3])、上层框架与自研应用。选卡时说的「计算能力」(Compute Capability,如 H100=9.0、Blackwell=10.0)就是 CUDA 世界的硬件代数——它是二手卡验货与框架兼容性的第一对照参数(官方对照表口径[4])。

对采购方,CUDA 意味着两件实际的事:生态锁定(CUDA 存量产线迁移到 ROCm/oneAPI 有真实成本,详见「局限与争议」)与版本兼容(框架要求的 CUDA 版本 vs 卡的驱动与计算能力,二手卡验货必查项)。本词条是软件概念词条——与各机型词条互为经纬。

适用场景FIT

萬安指数(0–100):按生态匹配度加权估算(软件概念词条特化口径)。

AI 框架 GPU 后端96萬安指数
PyTorch/TensorFlow/vLLM 的 GPU 后端事实标准——CUDA 版本兼容性是框架选卡的第一道闸。
自研算子开发93萬安指数
CUDA C++ 直接写核函数:极致性能的最后一段路——推理引擎的定制算子、HPC 移植都走这条路。
科学计算加速87萬安指数
cuBLAS/cuFFT/CUDA-X 库覆盖线性代数到傅里叶变换——二十年代码资产沉淀是 CUDA 的护城河本体。
非 NVIDIA 硬件35萬安指数
CUDA 编译产物面向 NVIDIA 架构——AMD 卡走 ROCm/HIP、 Intel 走 oneAPI,迁移有真实成本(详见局限与争议)。

沿革HISTORY

2006 年 11 月,CUDA 随 GeForce 8800(G80)发布:统一渲染架构让 GPU 的流处理器可以被通用并行程序调度,「Compute Unified Device Architecture」之名从此立起(NVIDIA CUDA 官方页与公开技术史口径[1])——GPU 通用计算(GPGPU)从学术技巧变成工程平台。

2012-2016 年,深度学习引爆:AlexNet 用两块 GTX 580 训练夺冠(公开技术史口径),CUDA-GPU 从此成为深度学习的标配算力——cuDNN 等专用库相继成熟,CUDA-X 库全家桶成型(cuDNN 官方页[2])。

2017-2022 年,数据中心化:Volta(计算能力 7.0)引入 Tensor Core,CUDA 从消费卡走向数据中心主战场;NCCL 集合通信库成为多卡训练的标准件(NCCL 官方页[3])。A100(8.0)与 H100(9.0)时代,CUDA 版本与框架生态的绑定愈发深。

2023-2026 年,Blackwell 时代:计算能力进入 10.0 代(官方对照表口径[4]),FP4/FP8 新精度由 CUDA 栈原生支持;同时 ROCm(AMD)与 oneAPI(Intel)作为替代路线持续追赶——CUDA 的生态统治与替代力量的拉锯,是 2026 年算力选型的背景板(详见「局限与争议」)。

计算能力对照COMPUTE CAPABILITY

计算能力(Compute Capability,常缩写 CC/sm_XX)是 CUDA 世界的「硬件代数」——决定了卡能跑哪些指令集、框架与驱动怎么适配。本库在售机型的 CC 对照(以 NVIDIA 官方对照表为准" + _r(4) + "):

机型架构计算能力本库词条
B300 / GB300 系(Blackwell Ultra)Blackwell Ultra10.x 代(以官方表为准)B300
B200 / GB200 系(Blackwell)Blackwell10.0GB200 NVL72 词条
H100 / H200 / H20(Hopper)Hopper9.0H200
L40S / L40 / L20(Ada)Ada Lovelace8.9L40S
A100 / A800(Ampere)Ampere8.0A100
RTX 6000 Ada / A 系工作站卡Ada / Ampere8.9 / 8.6RTX 6000 Ada 薄卡

完整全量对照(含全部消费卡/专业卡)以 NVIDIA 官方 CUDA GPUs 页为准[4];「以官方表为准」= 本表只列本库在售机型,Blackwell Ultra 精确小版本以官方表更新为准,不猜。

验货场景速查:二手卡到手先跑 nvidia-smi -q 看驱动与 CUDA Version(驱动支持的 CUDA 上限),再对照卡的计算能力——框架要求(如 PyTorch 构建时的 CUDA 版本)与卡的 CC 匹配,才算「这张卡能进产线」。

CUDA-X 库全家桶LIBRARIES

库干什么谁在用
cuBLAS线性代数(矩阵乘等)——深度学习的算术底座所有训练/推理框架
cuDNN深度学习原语加速(卷积/注意力等,官方页口径[2])训练与推理框架的算子底座
NCCL多卡多机集合通信(AllReduce 等,官方页口径[3])分布式训练的通信底座
CUDA-X Data Science / AI 等数据处理、推荐、量化等垂直库族(CUDA-X 官方口径)数据管线与垂直场景
nvcc / Nsight 工具链编译器与性能分析(Toolkit 组件,官方文档口径[6])自研算子开发与调优

CUDA-X 是 NVIDIA 对 GPU 加速库族的统称(官方口径);各库版本与 CUDA Toolkit 版本有配套矩阵——升级前先查配套表(官方文档口径" + _r(6) + ")。

版本与兼容COMPATIBILITY

场景规则验货含义
驱动 vs CUDA驱动版本决定可支持的 CUDA 上限(向下兼容)二手卡看 nvidia-smi 右上角 CUDA Version=驱动能力上限,不等于已装 Toolkit 版本
Toolkit vs 计算能力新版 Toolkit 支持新 CC;旧 Toolkit 编译产物跑新卡可能要重编框架镜像的 CUDA 版本与卡 CC 匹配——旧框架跑新卡(如 CUDA 11.x 镜像跑 Blackwell)需确认兼容路径
前向兼容数据中心的特定驱动机制允许新卡跑旧 CUDA 二进制(官方文档口径[6])数据中心卡(Tesla/数据中心系)的兼容福利——具体用法按官方文档,别凭记忆操作

兼容矩阵随版本演进,以 NVIDIA 官方文档为准[6];本表为决策方向口径,非操作手册。

CUDA 为软件平台,无硬件图集;软件栈示意见「技术规格」节。官方标志物素材以 NVIDIA 官方发布为准。

软件与生态ECOSYSTEM

项目现状
获取CUDA Toolkit 经 NVIDIA 官方下载页分发(官方口径[5]),驱动与 Toolkit 分离安装
框架支持PyTorch / TensorFlow / JAX / vLLM / TensorRT 等以 CUDA 为主要 GPU 后端
容器化NVIDIA Container Toolkit——框架镜像自带 CUDA 运行时,宿主机只管驱动
竞品AMD ROCm(HIP 生态)、Intel oneAPI(SYCL 系)——框架支持度与算子覆盖持续追赶中(详见局限与争议)
代码资产二十年的 CUDA 代码沉淀(论文复现/开源仓库/自研算子)是迁移成本的核心构成

生态信息为公开口径整理;版本与支持矩阵随时间演进,以 NVIDIA 官方发布为准。

采购视角PROCUREMENT VIEW

买卡时 CUDA 相关的三项检查(与机型词条的硬件验货互补):

1
计算能力对框架
目标框架/镜像要求的 CUDA 版本与卡的 CC 匹配(对照表见上)——「便宜的老卡」如果 CC 太老跑不动新框架,省的钱是假的。
2
驱动上限实测
到手先 nvidia-smi -q:驱动版本与 CUDA 上限、卡型号与显存对表卖家描述——云定制卡(vGPU 授权状态)在这一步现形。
3
软件栈迁移暗成本
从 CUDA 产线切 ROCm/oneAPI 的成本按人月算(框架版本、算子覆盖、调优经验三重成本)——「卡价差」要对比「迁移总账」再决策。

硬件侧的六项压测见各机型词条(如 A100/B300 词条);本节只覆盖软件视角。

验货速查QUICK CHECK

CUDA 视角的二手卡四步速查(与硬件压测配套):

1
身份与上限
nvidia-smi -q:卡型号、驱动版本、CUDA Version 上限、VBIOS——与卖家描述逐项对表。
2
计算能力确认
deviceQuery(CUDA samples)或框架内 torch.cuda.get_device_capability():CC 与官方表核对" + _r(4) + "——冒充卡在 CC 上现形。
3
框架实跑
目标框架跑一次标准前向+反向:能初始化、能训练、无算子 fallback 报错——纸面兼容不等于实跑可用。
4
授权状态
云定制卡的 vGPU/授权状态检查:授权锁卡的转产线成本要算进总价(本库验货经验口径)。

运输与交付LOGISTICS

1
软件资产随货清单
卡的交付不止硬件:驱动版本、授权状态、原厂测试记录(含 CUDA 实跑截图)随货清点——软件状态是二手卡价值的一半。
2
许可与合规
CUDA 软件许可随 NVIDIA SDK 分发条款(EULA),对转译运行到非 NVIDIA 平台有限制条款(公开讨论口径)——企业合规语境下以法务意见为准,本库表述不构成法律意见。

术语卡GLOSSARY

计算能力(Compute Capability)

CUDA 世界的硬件代数(如 8.0/9.0/10.0):决定卡的指令集与特性——框架与编译器按 CC 生成/选择代码。验货时 CC 与官方表核对是识别冒充卡的硬手段(官方对照表" + _r(4) + ")。

nvcc

CUDA C++ 的编译器(CUDA Toolkit 组件):把核函数编译成面向特定 CC 的 GPU 二进制——「编译目标 CC」决定二进制能跑哪些卡。

cuDNN / NCCL

CUDA-X 两大明星库:cuDNN 加速深度学习原语(卷积/注意力),NCCL 做多卡集合通信——训练框架「能跑得快」的两大底座(官方页口径" + _r(2) + _r(3) + ")。

Tensor Core

Volta 起引入的矩阵计算单元:混合精度训练的硬件基础——每代 Tensor Core 的新精度(FP16→BF16→FP8→FP4)都由 CUDA 栈首发支持,是「CUDA 版本追硬件」的典型场景。

ROCm 与 oneAPI

两大替代路线:AMD ROCm(HIP 语法贴近 CUDA,迁移工具链成熟度持续提升)、Intel oneAPI(SYCL 跨厂商路线)——算子覆盖与调优人力仍是与 CUDA 的差距所在(公开评测共识口径)。

前向兼容 / 后向兼容

CUDA 的兼容规则:新驱动支持旧 CUDA(后向兼容,常态);数据中心卡经特定机制让新卡跑旧 CUDA 二进制(前向兼容,官方文档口径" + _r(6) + ")——跨版本部署前查官方文档,别凭印象。

局限与争议LIMITS

  • 生态锁定的真实成本:CUDA 存量产线迁移 ROCm/oneAPI 的成本=框架版本适配+算子覆盖缺口+调优经验重攒三重叠加,按人月算——「卡价差」要对比「迁移总账」再决策(公开评测共识口径)。
  • 许可条款的边界争议:CUDA SDK 许可对在非 NVIDIA 硬件上转译运行有限制条款,围绕它的公开讨论持续存在(公开报道口径)——企业合规语境以法务意见为准,本库表述不构成法律意见。
  • 版本矩阵的复杂度:驱动/Toolkit/框架/库四层版本配套关系是运维复杂度的主要来源——容器化(镜像自带运行时)是主流解法,但宿主驱动的上限约束仍在(官方文档口径[6])。
  • 旧卡与新框架的代沟:新框架版本逐步放弃过老 CC 的支持——「低价老卡跑新框架」要验证而不是假设(本库验货经验口径)。
  • 本词条为软件概念口径:CUDA 性能的具体数字(各框架基准)随版本快速演进,本库不做快照式性能对比——以官方发布与独立基准为准。

常见问题FAQ

CUDA 是什么?和驱动是一回事吗?

不是一回事:驱动是让系统认出卡的底层软件;CUDA 是并行计算平台(Toolkit 编译器+运行时+CUDA-X 库全家桶)。nvidia-smi 右上角的「CUDA Version」指驱动支持的 CUDA 上限,不是已安装的 Toolkit 版本——两者常被混为一谈。

买二手卡为什么要看计算能力?

计算能力(CC)决定卡能跑哪些指令集与框架特性:CC 太老的新框架跑不动,CC 与卡型不符则可能是冒充卡——对照官方表核 CC(如 A100=8.0/H100=9.0/Blackwell=10.0)是二手卡验货的硬手段。

CUDA 版本不兼容怎么办?

三板斧:升级驱动(提升 CUDA 上限)、换用与卡 CC 匹配的框架镜像(容器自带运行时)、数据中心卡查官方前向兼容机制。具体组合以 NVIDIA 官方文档为准,别凭记忆跨版本硬凑。

AMD 卡的 ROCm 能替代 CUDA 吗?

分场景:主流框架(PyTorch 等)的常见模型 ROCm 已能跑,HIP 语法贴近 CUDA 迁移工具也在成熟;但算子覆盖、调优人力与二十年代码资产与 CUDA 仍有差距——新产线可以评估,存量 CUDA 产线迁移按人月算总账。

CUDA 的许可有什么要注意的?

CUDA SDK 按 NVIDIA 分发条款授权,其中对在非 NVIDIA 硬件上转译运行有限制条款(公开讨论口径)——常规「NVIDIA 卡上跑 CUDA」不受影响;涉及跨平台转译的合规问题请以法务意见为准,本库表述不构成法律意见。

H200A100B300L40SConnectX-7NVMe 全闪存储cuDNN / NCCLTensor CoreROCm / oneAPI 对照

延伸阅读EXPLORE

参考资料REFERENCES

  1. NVIDIA 官网 — CUDA Zone(CUDA 官方主档) https://developer.nvidia.com/cuda-zone
  2. NVIDIA 官网 — cuDNN 产品页(CUDA-X 深度学习库口径) https://developer.nvidia.com/cudnn
  3. NVIDIA 官网 — NCCL 产品页(集合通信库口径) https://developer.nvidia.com/nccl
  4. NVIDIA 官方文档 — CUDA GPUs:计算能力全量对照表(CC 对照主档,2026-10 口径) https://developer.nvidia.com/cuda-gpus
  5. NVIDIA 官网 — CUDA Toolkit 下载页(分发口径) https://developer.nvidia.com/cuda-downloads
  6. NVIDIA 官方文档 — CUDA Toolkit & 驱动兼容矩阵(版本配套与前后向兼容口径) https://docs.nvidia.com/cuda/
  7. 在售检索 — 萬安算交所(0 佣金撮合,配 CUDA 兼容视角的选卡服务) https://www.aixx.vip/hall.html
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。发现错误?欢迎通过勘误通道提交,核实后公开修正并记入版本史。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品