
ROCm(Radeon Open Compute)是 AMD 的开源 GPU 计算平台——CUDA 的头号替代路线:HIP 可移植编程接口(语法贴近 CUDA,官方提供 hipify 自动转换工具)、开源软件栈(多数组件开源许可)、PyTorch/vLLM 等主流框架的 ROCm 版支持,硬件面向 AMD Instinct 系(MI300X/MI325X/MI210 等)(AMD ROCm 官方文档口径[1])。
它与 CUDA 的关系是「追赶到哪了」的公开话题:主流开源框架能跑(MI300X 的 PyTorch/vLLM 推理与训练已有规模部署案例[2]),差距在算子覆盖、调优人力与二十年 CUDA 代码资产的厚度——选型的真实问题不是「ROCm 行不行」,而是「你的产线迁移总账算下来值不值」(本库整理口径,详见局限与争议)。
对万安算交所的用户,ROCm 词条回答三件事:MI300X 等 AMD 卡能不能进你的产线(框架兼容性核对清单)、ROCm 与 CUDA 的选型对照(配合 CUDA 词条阅读)、买 AMD 卡验货时查什么(ROCm 版本与硬件支持矩阵)。
萬安指数(0–100):生态匹配度特化口径。
2016 年,ROCm 首版发布:AMD 把 GPU 计算软件栈开源化(Radeon Open Compute之名立起)——与闭源的 CUDA 形成路线分野(AMD ROCm 官方文档口径[1])。
2020-2022 年,HIP 生态成型:PyTorch/TensorFlow 官方 ROCm 支持落地,hipify 工具链让 CUDA 代码半自动移植——框架侧的「能跑」问题基本解决(公开生态口径)。
2023-12,MI300X 里程碑:192GB HBM3 的 Instinct 旗舰发布,ROCm 6.0 同步支持——微软/Azure、Meta 等公开采用 MI300X 推理部署,ROCm 第一次站上旗舰级 AI 产线(AMD 发布稿与本库 MI300X 词条口径[2])。
2024-2026 年,追赶加速期:ROCm 6.x 持续迭代,MI325X 等新卡随发随支持;推理引擎(vLLM/SGLang)的 ROCm 版成为大显存推理的现实选项——与 CUDA 的差距仍在(算子/调优/文档),但「能不能跑」的答案越来越接近「能」(本库整理口径)。
| 层 | ROCm(AMD) | CUDA(NVIDIA) |
|---|---|---|
| 编程接口 | HIP(语法贴近 CUDA · hipify 自动迁移工具) | CUDA C++ |
| 编译器 | hipcc / Clang 系 | nvcc |
| 线性代数库 | hipBLAS / rocBLAS | cuBLAS |
| 深度学习原语 | MIOpen | cuDNN |
| 集合通信 | RCCL(NCCL 的 AMD 移植) | NCCL |
| 硬件 | Instinct MI300X / MI325X / MI210 等 | A100 / H100 / H200 / B300 等 |
| 许可 | 多数组件开源(MIT/Apache 系) | 专有许可(SDK EULA) |
对照为本库按官方文档的整理[1](2026-10 口径);各库版本配套矩阵以官方发布为准。
| 阶段 | 动作 | 成本构成 |
|---|---|---|
| 评估 | 目标模型/框架在 ROCm 上跑基准(MI300X 实测) | 人日级——先验「能不能跑」 |
| 移植 | hipify 转换自研算子 + 算子覆盖缺口补齐 | 人周~人月——深度 CUDA 算子是成本大头 |
| 调优 | ROCm 侧重新调参(内核选择/精度策略) | 人月级——性能追平需要调优人力 |
| 运维 | 双栈并行或全面切换的决策 | 长期——混合栈的复杂度要评估 |
迁移框架为本库按公开实践口径的整理(推算口径);具体成本随产线深度而变。

| 项目 | 现状 |
|---|---|
| 获取 | AMD ROCm 官方文档站分发[1],多数组件开源可审计 |
| 框架 | PyTorch 官方 ROCm 版 · TensorFlow · vLLM/SGLang 推理引擎 ROCm 支持 |
| 硬件支持 | Instinct MI300X / MI325X / MI210 系为主力(支持矩阵以官方文档为准[1]) |
| 云生态 | Oracle/Microsoft Azure 等 MI300X 实例(AMD 生态稿口径,同 MI300X 词条) |
| 观察工具 | rocm-smi / amd-smi 系统观测 |
| 版本节奏 | 6.x 现役——升级前核支持矩阵(卡型×框架×ROCm 三元配套) |
生态信息为公开口径整理;版本随时间演进,以 AMD 官方发布为准。
买 AMD 卡(MI300X/MI325X)时 ROCm 相关的三项检查:
AMD 卡(ROCm 视角)的四步速查:
AMD 的可移植编程接口:语法设计贴近 CUDA C++,配套 hipify 工具把 CUDA 源码半自动转换成 HIP 源码——「CUDA 存量代码进 AMD 卡」的主通道。
NCCL 的 AMD 移植版:多卡集合通信库(AllReduce 等),接口与 NCCL 一致——分布式训练框架在 ROCm 侧的通信底座,rccl-tests 是压测工具。
AMD 的深度学习原语加速库(对应 cuDNN 角色):卷积/注意力等算子的优化实现——框架 ROCm 版的算子底座。
CUDA→HIP 的源码自动转换工具链:把 cudaMalloc 等 API 调用机械翻译成 hip 前缀——机械转换覆盖大部分代码,剩余算子缺口人工补(迁移成本的主变量)。
ROCm 版本 × 卡型号 × 框架版本的三元配套表:三者在官方支持矩阵内交叉确认后才算「可用配置」——买卡与升级前的必查项(官方文档口径[1])。
ROCm 是开源软件栈,本身无行情——硬件侧的 MI300X/MI325X 行情随各自词条口径(均无快照,价格以货主实际报价为准)。
在售检索:萬安算交所大厅 ›(0 佣金撮合、数据因此中立)。
分场景:主流开源框架+主流模型,ROCm 能跑且 MI300X 有规模部署案例;但算子覆盖、调优人力、二十年代码资产与文档厚度与 CUDA 有真实差距——新产线可评估,存量 CUDA 产线迁移按人月算总账。
三段账:hipify 机械转换(容易)→ 算子覆盖缺口人工补(成本大头)→ ROCm 侧重新调优(性能追平要人力)。自研 CUDA 算子越深,迁移越贵——先拿目标模型跑基准再决策。
三件:卡的型号在 ROCm 官方支持矩阵内、目标框架 ROCm 版实跑目标模型、多卡 rccl-tests 互联带宽达标——纸面支持不等于实跑可用(本库验货经验口径)。
可以:两套栈分装不同环境(容器隔离是主流做法),硬件各归各卡——双栈并行的「评估期产线」是常见形态,长期二选一或分业务保留看总账。
多数组件开源(MIT/Apache 系许可),可审计可自建——开放性是相对 CUDA 专有许可的真实差异点;但部分组件与文档完整性仍在演进中(公开生态口径)。