ROCm Core SDK

提供基于 AMD 硬件开发 GPU 加速应用所需的一切组件。ROCm Core SDK 包含构成 ROCm 软件栈底层基础的核心库、运行时、编译器及工具。

Diagram of the ROCm Core SDK showing math, communication, media, storage, runtime, profiling, debugging, and monitoring libraries, including Composable Kernel, MIOpen, rocWMMA, hipBLAS, rocBLAS, RCCL, rocDecode, hipFile, HIP, LLVM, ROCm Compute Profiler, ROCgdb, AMD SMI, and RDC.

ROCm 7.14 新增功能

依托生产级 TheRock 平台,加快模块化 ROCm 开发速度

覆盖 AMD Instinct GPU、Radeon 和 Ryzen AI 的广泛 AI 硬件支持

优化了对主流开源 AI 框架和推理引擎的支持

借助云原生编排和开发者工具,实现企业级 AI 部署

针对分布式 AI、剖析工具和规模化部署,优化性能表现

AMD ROCm Lockup White

ROCm 发展历程

近十年来,ROCm 得到知名企业和研究机构的广泛采用。探索 ROCm 发展历程中的各个里程碑。

ROCm Core SDK 组件

了解支撑 ROCm Core SDK 的核心组件

AMD ROCm Lockup White

依托 GPU 加速 AI、数学及通信库,为高性能计算赋能助力。原生 roc* 库针对 AMD GPU 进行了性能优化,而 hip* 包装器简化了 CUDA 代码移植。利用高性能多 GPU 和多节点通信库,支持大规模分布式 AI 和 HPC 工作负载。

借助 AMD 编译器工具链和运行时,高效构建和运行 GPU 应用。利用性能剖析和调试工具衡量性能表现、分析 GPU 利用率并识别瓶颈,从而优化 AI、HPC 及加速计算应用。

利用运行时、驱动程序和操作系统工具,有效监控和管理 GPU 硬件,包括温度、功耗、显存和资源分配。

监控和管理 GPU 硬件状态,包括温度、功耗和资源分配。

AI 推理

基于 ROCm 实现生产级 AI 推理

依托完全开源的推理技术栈,在 AMD GPU 上部署主流开源模型。凭借预构建的容器和上游框架支持,快速启动并运行。

开箱即用的开源推理技术栈

从模型微调到生产部署,无需更改工作流程

AMD ROCm 提供开源的端到端推理技术栈,原生支持 PyTorch 等上游框架,并具备经过验证的 vLLM、SGLang 容器,使得开发团队可通过统一的工作流程在 AMD Instinct 加速器上完成从模型微调、基准测试直至生产部署的全过程。

高效推理,默认优化

轻松提高吞吐量,无需按模型调整开销

ROCm 将量化模型包、原生低精度执行能力和经过优化的 Transformer 热点路径内核相结合,减少调整工作量,同时充分提高实际服务的吞吐量和效率。

面向现代服务的分布式推理

专为预填充、解码和横向扩展工作负载而构建

ROCm 支持分布式推理,还支持预填充与解码分离以及经过优化的多 GPU、多节点通信,可在推理服务规模扩大时维持响应速度和利用率。

面向 Kubernetes 和 AI 实现生产就绪

在集群规模下可靠运行推理服务

ROCm 通过 AMD GPU Operator、内置遥测能力和模块化驱动程序架构与 Kubernetes 实现集成,支持在高度安全的气隙隔离环境中实现自动化部署、可观测性以及可预测的生命周期管理。

AI 训练

基于 AMD GPU 的大规模端到端 AI 训练

依托开源端到端软件平台,在 AMD GPU 上完成 AI 模型训练与微调。借助经过优化的框架、高效 GPU 加速能力,从单个 GPU 无缝扩展到多节点集群。

经过优化的 AI 训练性能

利用计算和优化技术加速模型训练

ROCm 利用 AMD GPU 的出色并行处理能力,有效缩短训练时间,并提高 AI 工作负载的整体性能。凭借经过优化的库、高效的资源管理以及支持的主流 AI 框架,开发者可以加快训练更大规模的模型,同时充分优化 GPU 利用率。

针对专用 AI 模型实现高效微调

利用 ROCm 调整基础模型以适配特定领域的任务

凭借经过优化的库、广泛的框架兼容性以及高效的资源管理,ROCm 可助力开发者在 AMD GPU 上加速微调大语言模型及其他基础模型。加快模型微调速度,同时与开源框架、模型和工具无缝集成。

可扩展的分布式训练

在 AMD GPU 集群上可靠运行多节点训练

Primus 依托分布式执行、拓扑感知调度以及容错运行能力,助力团队在 AMD GPU 集群上开展大规模训练。随着工作负载与集群规模增长,这有助于保障训练过程更加稳定一致。

企业级训练和运维

面向长时间运行作业的遥测、验证及快速恢复机制

Primus 通过提供数据遥测、仪表板和节点运行状况基准测试,帮助团队掌握训练成效和集群运行状况。这有助于企业更加可靠地运行大规模训练工作负载,同时加快故障排除速度。

ROCm 助力高性能计算和超级计算

基于 ROCm 构建和规模化部署 HPC 应用

从经过优化的库到先进的超级计算机,ROCm 与 AMD GPU 强强结合,为高性能计算赋能助力。

加速高性能计算创新

推动科学、工程与研究领域取得重大突破

开源软件平台 AMD ROCm 可为能源、分子动力学、物理学、计算化学、气候科学及其他研究领域的高性能计算 (HPC) 与超级运算工作负载添能助力,帮助解决一些棘手的计算难题。

灵活的高性能计算编程

根据应用场景选用合适的工具进行开发

ROCm 支持多种高性能计算 (HPC) 编程模型、包括 OpenMP®、HIP、OpenCL™ 和 Python™,使得开发者可根据其工作负载灵活选用适合的语言和框架来构建、优化和规模化部署应用。

经过优化的 HPC 库

利用经过优化的库加速应用

ROCm 包括一套全面的数学库和通信库,旨在简化 HPC 开发,同时在 AMD 计算平台上提升应用性能、可扩展性和运行效率。

已在超算领域得到验证

凭借超大规模算力,为顶尖超级计算机赋能助力

在全球 500 强超级计算机中,有 177 台采用 AMD 技术,包括 Frontier、LUMI 以及即将面世的 El Capitan 系统。ROCm 提供坚实的软件基石,支持高效运行百亿亿级及更高算力规模的超大型高要求 HPC 应用。

合作伙伴成功案例

合作伙伴和成功案例

了解 AMD 如何与各大企业和研究机构携手合作。

精选博客

HIP 入门

了解如何使用 HIP 和 ROCm 对 AMD GPU 进行编程,从掌握并行计算基础知识入手,直到构建首个 GPU 加速应用。

ROCprofiler 简介

探索全新的 ROCprofiler-SDK,了解其统一性能剖析基础设施如何简化 AMD GPU 上的 AI 和 HPC 应用性能优化过程。

AMD 性能剖析工具

了解 AMD 性能剖析工具如何提供深入的性能洞察,帮助开发者对在 CPU 和 GPU 上运行的异构应用进行基准测试、剖析和优化。

支持的硬件

开发人员资源

ROCm Developer screen shot

ROCm 开发人员中心

着手开发支持 AMD GPU 加速的应用。访问 ROCm 开发人员中心,获取最新的用户指南、容器、培训视频、网络研讨会等内容。

AI 开发者计划

获取免费的 AMD Developer Cloud 信用值、专属培训课程和社区支持,并参加每月硬件抽奖活动,旨在助您顺利开展 AI 开发工作。

ROCm 新闻通讯

接收最新 ROCm 资讯。

附注

©2024 AMD 公司,版权所有。保留所有权利。AMD、AMD 箭头标识、AMD ROCm、AMD Instinct、霄龙、EPYC、Radeon Instinct 及其组合是 AMD 公司的商标。PyTorch 是 PyTorch 公司的商标或注册商标。本文中用到的其他产品名称仅用于标识目的,可能是其各自公司的商标。

  1. 如需了解 ROCm 所支持的全部 Radeon 产品,请访问 https://rocm.docs.amd.com/en/latest/reference/gpu-arch-specs.html