AMD ROCm 开源 GPU 计算平台全景指南:Core SDK、AI 生态与系统基础设施
2026/9/17 6:58:03 网站建设 项目流程

AMD ROCm 开源 GPU 计算平台全景指南:Core SDK、AI 生态与系统基础设施

【免费下载链接】legacy-rocm-buildAMD ROCm™ Software - GitHub Home项目地址: https://gitcode.com/GitHub_Trending/ro/legacy-rocm-build

AMD ROCm(Radeon Open Compute)是 AMD 的开源 GPU 计算平台,一个覆盖编译器、运行时与库的端到端生态系统,面向 AI、HPC 及领域专用负载设计。本指南以本仓库的入口文档 docs/index.md 为核心骨架,结合 README.md、核心组件说明 与 7.14.0 发布说明 等仓库资源,系统梳理 ROCm 的四大板块——Core SDK、AI Ecosystem、GPU Systems and Infrastructure 与 Toolkits,帮助你快速理解 ROCm 的软件栈构成、组件分类方式,以及从安装、兼容性验证到性能工具链的完整入门路径。

ROCm 平台定位:开源的端到端 GPU 计算栈

按 docs/index.md 的定义,ROCm 是 AMD 的开源 GPU 计算平台,由编译器、运行时和库组成一个端到端生态系统,服务于 AI、HPC 与领域专用负载。它的三个关键属性是:

  • 开源:软件栈整体开源,由社区与 AMD 共同演进;
  • 跨平台:同时支持 Linux 与 Windows;
  • 硬件覆盖广:面向 AMD Instinct™(数据中心 GPU)、AMD Radeon™(消费/工作站 GPU)与 AMD Ryzen™ AI(APU)三类设备优化。

更细化的描述见 docs/about/what-is-rocm.rst:ROCm 是 AMD 面向 GPU 加速计算的开源软件栈,提供编程 AMD GPU 所需的运行时、编译器、性能与系统工具、以及优化的数学和计算库;更广泛的 ROCm 生态还包括 PyTorch 等 ROCm 启用的 HPC 应用与深度学习框架。而 README.md 补充了一个重要定位:ROCm 特别适合 GPU 加速的高性能计算(HPC)、AI、科学计算与计算机辅助设计(CAD),其核心编程模型由HIP驱动——一个 C++ 运行时 API 与内核语言,提供与 NVIDIA CUDA 相似的接口,让开发者编写可移植的 GPU 代码,同时它也支持 OpenMP 与 OpenCL。

从 README.md 中还可以看到一个与仓库状态直接相关的事实:本仓库(legacy-rocm-build)即将弃用,后续开发与 issue 讨论将迁移到 ROCm/TheRock,TheRock 正是 AMD 的开源构建与发布系统。理解这一点有助于你正确看待本仓库中的文档——它们代表 ROCm 在 TheRock 化改造后的最新组织方式。

ROCm Core SDK:GPU 计算的基石

入口页的第一个板块是Core SDK,它被定位为"在 AMD 硬件上进行 GPU 计算的基础库、运行时与工具"——包括数学与计算库、通信原语、HIP 运行时、性能分析与调试工具等。仓库中对应的完整清单由 docs/data/components.yaml 驱动,并通过 docs/components/core.rst 渲染成文。

七大组件分组

docs/components/core.rst 将 Core SDK 组件划分为七个固定分组,顺序如下:

  1. Math and compute libraries(数学与计算库):覆盖稠密与稀疏线性代数、FFT、随机数生成等 GPU 加速数学库;
  2. Communication libraries(通信库):如 RCCL、rocSHMEM,用于多 GPU / 多节点集合通信;
  3. Runtime and compilers(运行时与编译器):HIP、HIPIFY、LLVM、ROCr Runtime 等;
  4. Profiling and debugging tools(性能分析与调试工具):ROCm Compute Profiler、ROCm Systems Profiler、ROCprofiler-SDK、ROCgdb 等;
  5. Control and monitoring tools(控制与监控工具):AMD SMI、ROCm Data Center Tool(RDC)、rocminfo;
  6. Media libraries(媒体库):rocDecode、rocJPEG;
  7. Storage(存储):hipFile,支持存储与 GPU 内存之间的直接数据传输(AMD Infinity Storage 的一部分,绕过主机侧拷贝以降低大吞吐 GPU I/O 的延迟与命令开销)。

roc* 与 hip* 前缀的命名语义

这是读懂 ROCm 库清单的关键约定(见 docs/components/core.rst):

  • roc*前缀:原生高性能实现,直接以 HIP 为 AMD GPU 编写,如 rocBLAS、rocFFT、rocRAND、rocSPARSE、rocSOLVER、rocPRIM、rocThrust;
  • hip*前缀:可移植封装,实现与 NVIDIA CUDA 等价的 API,使 CUDA 应用能以最小代码改动移植到 AMD GPU,如 hipBLAS、hipFFT、hipRAND、hipSOLVER、hipSPARSE、hipCUB、hipFile。

hip*封装与roc*原生库通常成对出现(如 hipBLAS/rocBLAS、hipSPARSE/rocSPARSE),这种双轨结构正是 ROCm 可移植性设计的核心。

版本与发布节奏

当前仓库对应 ROCm7.14.0(见 docs/about/release-notes.md)。该版本是 ROCm 迁移到 TheRock 构建系统后的重要一步,发布说明总结的三大变化方向值得注意:

  • 更精简的核心:Core SDK 聚焦于必需的运行时与开发组件;
  • 面向用例的扩展:AI、数据科学、HPC 等领域可选的领域专用 SDK;
  • 模块化安装:只安装工作流所需的组件,从而简化安装、缩小占用并加速创新(组件可独立发布)。

此外,发布说明指出 7.14.0 的亮点集中在 AI 推理、分布式负载与性能分析:vLLM 推理就绪镜像与包、ROCprofiler-SDK 在 AI 分析工作流中的采用、系统遥测与验证覆盖扩展,以及数学/稀疏/通信库的更新。

AI Ecosystem:AMD GPU 上的 AI 全栈

入口页的第二个板块是AI Ecosystem,定位为"在 AMD GPU 上使用主流 ROCm 启用框架部署 AI 工作负载的全栈文档与配方"。仓库中的 docs/ai-ecosystem.md 对该板块展开了详细描述:AI 生态文档门户包含深度学习框架的安装与配置、大规模模型训练、LLM 与扩散模型推理服务,以及 AMD GPU 上 AI 工作负载的性能优化指南。

AI 生态构建在 ROCm Core SDK 之上——由 Core SDK 提供底层 GPU 运行时(HIP)、编译器与数学库。其覆盖范围包括:

  • 深度学习框架:PyTorch 与 JAX 在 AMD GPU 上的安装,涵盖 AMD Instinct、Radeon GPU 与 Ryzen APU,跨 Linux 与 Windows,基于 pip 分发;
  • 训练:使用 PyTorch 分布式原语(DDP、RPC、集合通信)跨多 GPU 扩展模型训练,应对超出单 GPU 内存的大模型;
  • 推理:使用高性能推理框架服务 LLM 与生成式 AI 模型,覆盖单节点与分布式多 GPU 部署,涉及 vLLM、SGLang、MIGraphX、ONNX Runtime、xDiT、ComfyUI 等;
  • 分布式推理:在 MI355X 集群上通过 MoRI(Modular RDMA Interface)实现多节点 prefill-decode 分离式推理服务;
  • 优化:吞吐、延迟与内存效率优化,包括 vLLM V1 性能调优、模型量化、模型加速库、Triton kernel 与 Composable Kernel 优化;
  • 教程:AI Playbooks 与 AI Developer Hub 等实操指南。

当前 7.14.0 版本启用的框架版本为:PyTorch 2.12.0、JAX 0.10.0、vLLM 0.23.0、SGLang 0.5.13、TensorFlow 2.21(取代此前的 PyTorch 2.9.1、JAX 0.8.2、vLLM 0.19.1、SGLang 0.5.9)。这些版本信息同时出现在 docs/compatibility/compatibility-matrix.rst 的 AI 生态兼容性章节中。

GPU Systems and Infrastructure:规模化部署与运维

入口页的第三个板块面向 AMD Instinct GPU 的规模化部署与运维,包括 AMD GPU Driver 安装、集群管理、GPU 分区、监控、虚拟化、云部署与容器。其两个核心入口为:

  • AMD GPU Driver(amdgpu):ROCm 正常运行依赖内核驱动层,安装时通常需要单独安装 amdgpu 驱动;
  • Network Operator(Kubernetes):在 Kubernetes 集群中管理 GPU 网络资源。

兼容性矩阵 的"系统要求"章节解释了为什么这一层需要谨慎对待:ROCm 依赖固件、驱动与用户空间组件组成的协调栈,各层之间保持版本对齐是 GPU 正常运行与性能达标的保证,对 AMD 数据中心产品尤其如此。矩阵逐表列出 GPU 详情、支持的操作系统、内核驱动与固件版本,并分别覆盖 AMD Instinct、Radeon 与 Ryzen 三类设备,同时包含虚拟化支持(Instinct 与 Radeon)与 SR-IOV 场景。

7.14.0 在系统层的新增支持包括:新增多款 Ryzen AI APU(gfx1151/gfx1153 系列);新增 RHEL 10.2 与 RHEL 9.8 支持;SLES 15 SP7、SLES 16 与 Debian 13 支持 MI350P;MI350X 上新增 VMware ESXi 9.1 虚拟化配置;以及在 MI355X/MI350X 上启用 DPX 与 CPX 计算分区模式(配合 NPS2 内存分区)的 SR-IOV 多虚拟功能(VF)分区支持。

Toolkits:面向领域的扩展工具包

入口页的第四个板块是Toolkits——面向领域应用的高性能库开源集合。仓库列出了五个 ROCm 工具包:ROCm Data Science(数据科学)、ROCm Finance(金融)、ROCm Life Science(生命科学)、ROCm LLMExt(LLM 扩展)与 ROCm Simulation(仿真)。

结合 docs/about/release-notes.md 的"未来变更"章节可以确认这一策略:未来版本将增加更多领域专用扩展工具包(数据科学、生命科学、金融、仿真及其他 HPC 领域),这与 Core SDK 向"精简核心 + 领域扩展"演进的路线完全一致。

安装与兼容性:从零开始的实操路径

安装前的兼容性验证

无论选择哪种安装方式,官方流程都要求先通过 兼容性矩阵 确认硬件与系统组合受支持。矩阵覆盖 Linux(Ubuntu、Debian、RHEL、Oracle Linux、Rocky Linux、SLES)与 Windows,GPU 目标包括 CDNA4/CDNA3/CDNA2(Instinct)与 RDNA4/RDNA3(Radeon)等架构(见 README.md)。如果 GPU 不在官方支持列表中,仍可能通过 TheRock nightly 构建获得社区启用支持。

安装方式与安装前准备

安装指南 支持多种安装方式,包括包管理器(apt/dnf/zypper)、Runfile 安装器、pip 与 tarball。以 Runfile 方式为例(命令取自 docs/install/include/200-install.rst):

# 下载 Runfile 安装器 wget https://repo.radeon.com/rocm/installer/rocm-runfile-installer/rocm-rel-7.14/rocm-installer-7.14.0-7.run # 安装内核驱动(amdgpu),安装后需重启 bash rocm-installer-7.14.0-7.run deps=install amdgpu

以 Ubuntu + 包管理器方式为例(同一文件的真实命令):

# 1. 下载并安装 GPG key sudo mkdir --parents --mode=0755 /etc/apt/keyrings wget https://repo.amd.com/rocm/packages-multi-arch/gpg/rocm.gpg -O - | \ gpg --dearmor | sudo tee /etc/apt/keyrings/amdrocm.gpg > /dev/null # 2. 注册 ROCm 仓库 sudo tee /etc/apt/sources.list.d/rocm.list << EOF deb [arch=amd64 signed-by=/etc/apt/keyrings/amdrocm.gpg] https://repo.amd.com/rocm/packages-multi-arch/ubuntu2404 stable main EOF sudo apt update # 3. 安装核心 ROCm 包 sudo apt install amdrocm7.14

7.14.0 的 Runfile 安装器还引入了多项新能力(见 发布说明):多 GPU 架构支持(单次安装可装一个或多个 GPU 架构、自动探测 GPU 并安装匹配架构、按架构查询/选择性卸载)、灵活的组件选择(core运行时库与工具为默认项,另有core-dev开发头文件、dev-tools调试分析工具、core-sdk综合 SDK、opencl运行时支持)、可选的图形支持(Mesa/OpenGL,启用时附带amdgpu-lib包)、构建与清单信息查看,以及统一安装器(一个安装文件支持所有 Linux 发行版)。

安装前置条件:GPU 访问权限

安装 ROCm 前的关键前置步骤之一是配置 GPU 访问权限,docs/install/include/100-prerequisites.rst 给出了两种方法:

方法一:用户组方式(默认机制,GPU 访问由videorender组控制)

# 将当前用户加入 render 和 video 组 sudo usermod -a -G render,video $LOGNAME

方法二:udev 规则(系统级、更灵活,可免去用户组管理并实现细粒度 GPU 访问)

sudo tee /etc/udev/rules.d/70-amdgpu.rules << EOF KERNEL=="kfd", GROUP="render", MODE="0666" SUBSYSTEM=="drm", KERNEL=="renderD*", GROUP="render", MODE="0666" EOF sudo udevadm control --reload-rules sudo udevadm trigger

两种方式应用后均需重启系统生效。

卸载与升级注意事项

安装指南 明确指出:如果系统已安装 ROCm 7.2.4 或更早版本,升级前需要先卸载旧版本再继续。Windows 用户还需注意:不要将 ROCm 编译器与运行时 DLL 复制到 System32,以免引发冲突。

性能验证与运维辅助:ROCm Extras

除 Core SDK 外,仓库还提供ROCm Extras(docs/components/extras.rst):用于基准测试、验证与管理 ROCm 部署的补充工具,不参与 GPU 应用开发,但适合验证硬件健康、测量系统性能与管理 GPU 集群。核心工具包括:

  • ROCm Validation Suite(RVS):验证 ROCm 安装与 AMD GPU 硬件的测试套件,覆盖 GPU 功能、内存、电源行为与点对点通信,帮助诊断安装问题与硬件故障;
  • TransferBench:在用户指定设备(CPU、GPU、NIC)之间对同时进行的存储器传输做基准测试的实用工具,随 RVS 一同安装。

另外,发布说明 提到 ROCm Bandwidth Test(RBT)在 7.14.0 达到生命周期终点,功能由 TransferBench 与 RVS 承接——迁移时建议优先采用这两个工具。

仓库布局与进一步探索

想深入理解 ROCm 的文档与数据组织方式,可以从以下仓库路径继续阅读:

  • docs/index.md:入口页(本文骨架);
  • docs/about/what-is-rocm.rst:ROCm 平台定义与 Core SDK/Extras 概览;
  • docs/components/core.rst:Core SDK 七大组件分组的模板与渲染逻辑;
  • docs/data/components.yaml:Core SDK 组件清单数据源(docs/data/components-default.yaml 与 docs/data/components-previous.yaml 为对照数据);
  • docs/compatibility/compatibility-matrix.rst:兼容性矩阵与系统要求;
  • docs/install/rocm.rst:完整安装指南;
  • docs/about/release-notes.md:7.14.0 发布说明、已知问题与解决记录;
  • docs/about/transition-guide-TheRock.md:TheRock 迁移指南;
  • README.md:仓库总览与核心组件清单。

ROCm 的设计脉络可以用一句话概括:以精简的 Core SDK 为底座,用 HIP 提供 CUDA 兼容的可移植编程模型,通过 AI 生态与领域 Toolkit 覆盖上层工作负载,再以兼容性矩阵、驱动与运维工具保证规模化部署的可靠性。从入口文档出发,沿着上述仓库路径逐层深入,你就能建立起对 AMD ROCm 软件栈完整而准确的技术认知。

【免费下载链接】legacy-rocm-buildAMD ROCm™ Software - GitHub Home项目地址: https://gitcode.com/GitHub_Trending/ro/legacy-rocm-build

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询