ROCm 核心 SDK

这里有在 AMD 硬件上开发 GPU 加速应用程序所需的一切。ROCm 核心 SDK 包含构成 ROCm 软件栈基础的基本库、运行时、编译器和工具。

Diagram of the ROCm Core SDK showing math, communication, media, storage, runtime, profiling, debugging, and monitoring libraries, including Composable Kernel, MIOpen, rocWMMA, hipBLAS, rocBLAS, RCCL, rocDecode, hipFile, HIP, LLVM, ROCm Compute Profiler, ROCgdb, AMD SMI, and RDC.

ROCm 7.14 的新功能

可用于生产环境的 TheRock,可实现更快、模块化的 ROCm 开发

为 AMD Instinct GPU、Radeon 和锐龙 AI 提供广泛的 AI 硬件支持

改进了对主流开源 AI 框架和推理引擎的支持

具备云原生编排和开发者工具的企业级 AI 部署

增强了在分布式 AI、分析和可扩展部署等方面的性能

AMD ROCm Lockup White

ROCm 的逐年演进

近十年来,众多领先企业和研究机构一直在采用 ROCm 技术。敬请探索 ROCm 发展历程中的各个里程碑。

ROCm 核心 SDK 组件

探索 ROCm 核心 SDK 的关键组件

AMD ROCm Lockup White

面向高性能计算 (HPC) 的 GPU 加速 AI、数学和通信库。原生 roc* 库可优化 AMD GPU 的性能,而 hip* 封装库则简化了 CUDA 的移植。利用高性能的多 GPU 和多节点通信库,扩展分布式 AI 和 HPC 工作负载。

使用 AMD 编译器工具链和运行时,高效构建和运行 GPU 应用程序。利用性能分析和调试工具,衡量性能、分析 GPU 利用率并发现瓶颈,从而优化 AI、HPC 和加速计算应用程序。

使用运行时、驱动程序和操作系统工具监控和管理 GPU 硬件,包括温度、功耗、内存和资源分配。

监控和管理 GPU 硬件状态,包括温度、功耗和资源分配。

AI 推理

使用 ROCm 进行生产级 AI 推理

使用完全开源的推理技术栈,在 AMD GPU 上部署领先的开放模型。借助预构建的容器和上游框架支持,快速开始运行。

开放式、跳出固有思维的推理

从调优到生产级服务 —— 无需改变工作流程

AMD ROCm 提供了一个开源的端到端推理技术栈,支持上游框架(包括 PyTorch)和经过验证的 vLLM 和 SGLang 容器,因此团队可以采用一致的工作流程,从调优和基准测试过渡到在 AMD Instinct GPU 上生产级服务。

高效推理,默认优化

高吞吐量,无需针对每个模型进行额外调优

ROCm 将量化模型包与原生低精度执行和优化的 Transformer 热路径内核相结合,从而减少调优工作量,同时最大限度地提高实际服务的吞吐量和效率。

面向现代服务的分布式推理

专为预填充、解码和横向扩展工作负载而打造

ROCm 支持分布式推理,具备预填充/解码分解和优化的多 GPU、多节点通信功能,有助于在推理规模扩大时保持响应能力和利用率。

适用于 Kubernetes 的生产就绪型人工智能

在机群规模下可靠地运行推理

ROCm 通过 AMD GPU Operator、内置遥测功能和模块化驱动程序架构,实现与 Kubernetes 集成,支持在安全且物理隔离的环境中实现自动化部署、可观测性和可预测的生命周期管理。

AI 训练

在 AMD GPU 上实现大规模端到端 AI 训练

使用开放的端到端软件平台,在 AMD GPU 上训练和 AI 模型调优。利用优化的框架、高效的 GPU 加速以及从单 GPU 到多节点集群的无缝扩展。

优化 AI 训练性能

利用计算和优化来加速模型训练

ROCm 利用 AMD GPU 的并行处理能力,缩短训练时间并提升 AI 工作负载的整体性能。凭借优化的库、高效的资源管理以及对现代 AI 框架的支持,开发者可以更快地训练更大的模型,同时最大限度地利用 GPU。

针对专用 AI 的高效调优

使用 ROCm 将基础模型适配到特定领域的任务

ROCm 利用优化的库、广泛的框架兼容性和高效的资源管理,加速在 AMD GPU 上对大型语言模型和其他基础模型进行调优。它能够更快地调优模型,并与开源框架、模型和工具无缝集成。

可扩展的分布式训练

在 AMD GPU 集群上可靠地运行多节点训练

Primus 通过分布式执行、拓扑感知调度和容错操作,帮助团队在 AMD GPU 集群上扩展训练规模。这有助于随着工作负载和集群的增长,实现更一致的训练。

企业级培训运营

长时间运行作业的遥测、验证和更快恢复

Primus 提供遥测、看板和节点健康状况基准测试,使团队能够了解训练性能和集群的健康状况。这有助于组织以更高的可靠性运行大型训练工作负载,并更快地进行故障排除。

面向 HPC 和超级计算的 ROCm

使用 ROCm 构建和扩展 HPC 应用

从优化的代码库到领先的超级计算机 —— ROCm 可在 AMD GPU 上实现高性能计算。

加速 HPC 创新

推动科学、工程和研究领域的突破性进展

AMD ROCm 支持处理能源、分子动力学、物理学、计算化学、气候科学和其他研究领域的高性能计算 (HPC) 和超级计算工作负载,提供了一个开放的软件平台,以帮助解决世界上一些最复杂的计算挑战。

灵活的 HPC 编程

使用最适合您应用的工具进行开发

ROCm 支持多种 HPC 编程模型,包括 OpenMP®、HIP、OpenCL™ 和 Python™,使开发人员能够灵活地使用最适合其工作负载的语言和框架来构建、优化和扩展应用。

优化的 HPC 库

利用优化的代码库加速应用程序

ROCm 包含一套全面的数学和通信库,旨在简化 HPC 开发,同时提高 AMD 计算平台上的应用程序性能、可扩展性和效率。

在超算领域久经验证

大规模计算驱动着世界领先的超级计算机

AMD 为全球 500 强超级计算机中的 177 台提供技术支持,包括 Frontier、LUMI 以及即将推出的 El Capitan 系统。ROCm 为运行一些全球规模最大、要求最高的高性能计算 (HPC) 应用提供了软件基础,​​这些应用的计算能力可达百亿亿次级甚至更高。

合作伙伴成功案例

合作伙伴关系和取得的成就

了解企业和领先的研究机构如何与 AMD 合作共赢

博客推荐

HIP 入门

学习如何使用 HIP 和 ROCm 对 AMD GPU 进行编程,从并行计算基础知识到构建您的第一个 GPU 加速应用程序。

AMD 分析工具

了解 AMD 分析工具如何提供深入的性能洞察,以帮助开发人员对在 CPU 和 GPU上运行的异构应用程序进行基准测试、分析和优化。

支持的硬件

开发者资源

ROCm Developer screen shot

ROCm 开发者中心

立即着手开发 AMD GPU 加速应用程序吧。访问 ROCm 开发者中心,获取最新的用户指南、容器、培训视频、网络研讨会等资源。

AI 开发者计划

免费获取 AMD 开发者云积分、专属培训、每月硬件抽奖活动以及社群支持,为你的 AI 开发工作助力。

订阅 ROCm 资讯

敬请订阅,接收 ROCm 最新动态。

附注

©2024 Advanced Micro Devices, Inc. 保留所有权利。AMD、AMD 箭头标志、AMD ROCm、AMD Instinct、EPYC、Radeon Instinct 及其组合均为 Advanced Micro Devices, Inc. 的商标。PyTorch 是 PyTorch 的商标或注册商标。本出版物中使用的其他产品名称仅用于标识目的,可能是其各自公司的商标。

  1. 如需查看 ROCm 支持的 Radeon 显卡完整列表,请访问 https://rocm.docs.amd.com/en/latest/reference/gpu-arch-specs.html