ROCm 核心 SDK
这里有在 AMD 硬件上开发 GPU 加速应用程序所需的一切。ROCm 核心 SDK 包含构成 ROCm 软件栈基础的基本库、运行时、编译器和工具。
ROCm 7.14 的新功能
可用于生产环境的 TheRock,可实现更快、模块化的 ROCm 开发
为 AMD Instinct GPU、Radeon 和锐龙 AI 提供广泛的 AI 硬件支持
改进了对主流开源 AI 框架和推理引擎的支持
具备云原生编排和开发者工具的企业级 AI 部署
增强了在分布式 AI、分析和可扩展部署等方面的性能
ROCm 的逐年演进
近十年来,众多领先企业和研究机构一直在采用 ROCm 技术。敬请探索 ROCm 发展历程中的各个里程碑。
ROCm 核心 SDK 组件
探索 ROCm 核心 SDK 的关键组件
面向高性能计算 (HPC) 的 GPU 加速 AI、数学和通信库。原生 roc* 库可优化 AMD GPU 的性能,而 hip* 封装库则简化了 CUDA 的移植。利用高性能的多 GPU 和多节点通信库,扩展分布式 AI 和 HPC 工作负载。
使用 AMD 编译器工具链和运行时,高效构建和运行 GPU 应用程序。利用性能分析和调试工具,衡量性能、分析 GPU 利用率并发现瓶颈,从而优化 AI、HPC 和加速计算应用程序。
使用运行时、驱动程序和操作系统工具监控和管理 GPU 硬件,包括温度、功耗、内存和资源分配。
监控和管理 GPU 硬件状态,包括温度、功耗和资源分配。
AI 推理
使用 ROCm 进行生产级 AI 推理
使用完全开源的推理技术栈,在 AMD GPU 上部署领先的开放模型。借助预构建的容器和上游框架支持,快速开始运行。
开放式、跳出固有思维的推理
从调优到生产级服务 —— 无需改变工作流程
AMD ROCm 提供了一个开源的端到端推理技术栈,支持上游框架(包括 PyTorch)和经过验证的 vLLM 和 SGLang 容器,因此团队可以采用一致的工作流程,从调优和基准测试过渡到在 AMD Instinct GPU 上生产级服务。
高效推理,默认优化
高吞吐量,无需针对每个模型进行额外调优
ROCm 将量化模型包与原生低精度执行和优化的 Transformer 热路径内核相结合,从而减少调优工作量,同时最大限度地提高实际服务的吞吐量和效率。
面向现代服务的分布式推理
专为预填充、解码和横向扩展工作负载而打造
ROCm 支持分布式推理,具备预填充/解码分解和优化的多 GPU、多节点通信功能,有助于在推理规模扩大时保持响应能力和利用率。
适用于 Kubernetes 的生产就绪型人工智能
在机群规模下可靠地运行推理
ROCm 通过 AMD GPU Operator、内置遥测功能和模块化驱动程序架构,实现与 Kubernetes 集成,支持在安全且物理隔离的环境中实现自动化部署、可观测性和可预测的生命周期管理。
AI 训练
在 AMD GPU 上实现大规模端到端 AI 训练
使用开放的端到端软件平台,在 AMD GPU 上训练和 AI 模型调优。利用优化的框架、高效的 GPU 加速以及从单 GPU 到多节点集群的无缝扩展。
优化 AI 训练性能
利用计算和优化来加速模型训练
ROCm 利用 AMD GPU 的并行处理能力,缩短训练时间并提升 AI 工作负载的整体性能。凭借优化的库、高效的资源管理以及对现代 AI 框架的支持,开发者可以更快地训练更大的模型,同时最大限度地利用 GPU。
针对专用 AI 的高效调优
使用 ROCm 将基础模型适配到特定领域的任务
ROCm 利用优化的库、广泛的框架兼容性和高效的资源管理,加速在 AMD GPU 上对大型语言模型和其他基础模型进行调优。它能够更快地调优模型,并与开源框架、模型和工具无缝集成。
可扩展的分布式训练
在 AMD GPU 集群上可靠地运行多节点训练
Primus 通过分布式执行、拓扑感知调度和容错操作,帮助团队在 AMD GPU 集群上扩展训练规模。这有助于随着工作负载和集群的增长,实现更一致的训练。
企业级培训运营
长时间运行作业的遥测、验证和更快恢复
Primus 提供遥测、看板和节点健康状况基准测试,使团队能够了解训练性能和集群的健康状况。这有助于组织以更高的可靠性运行大型训练工作负载,并更快地进行故障排除。
面向 HPC 和超级计算的 ROCm
使用 ROCm 构建和扩展 HPC 应用
从优化的代码库到领先的超级计算机 —— ROCm 可在 AMD GPU 上实现高性能计算。
加速 HPC 创新
推动科学、工程和研究领域的突破性进展
AMD ROCm 支持处理能源、分子动力学、物理学、计算化学、气候科学和其他研究领域的高性能计算 (HPC) 和超级计算工作负载,提供了一个开放的软件平台,以帮助解决世界上一些最复杂的计算挑战。
灵活的 HPC 编程
使用最适合您应用的工具进行开发
ROCm 支持多种 HPC 编程模型,包括 OpenMP®、HIP、OpenCL™ 和 Python™,使开发人员能够灵活地使用最适合其工作负载的语言和框架来构建、优化和扩展应用。
优化的 HPC 库
利用优化的代码库加速应用程序
ROCm 包含一套全面的数学和通信库,旨在简化 HPC 开发,同时提高 AMD 计算平台上的应用程序性能、可扩展性和效率。
在超算领域久经验证
大规模计算驱动着世界领先的超级计算机
AMD 为全球 500 强超级计算机中的 177 台提供技术支持,包括 Frontier、LUMI 以及即将推出的 El Capitan 系统。ROCm 为运行一些全球规模最大、要求最高的高性能计算 (HPC) 应用提供了软件基础,这些应用的计算能力可达百亿亿次级甚至更高。
合作伙伴成功案例
合作伙伴关系和取得的成就
了解企业和领先的研究机构如何与 AMD 合作共赢
博客推荐
支持的硬件
开发者资源
订阅 ROCm 资讯
敬请订阅,接收 ROCm 最新动态。
附注
©2024 Advanced Micro Devices, Inc. 保留所有权利。AMD、AMD 箭头标志、AMD ROCm、AMD Instinct、EPYC、Radeon Instinct 及其组合均为 Advanced Micro Devices, Inc. 的商标。PyTorch 是 PyTorch 的商标或注册商标。本出版物中使用的其他产品名称仅用于标识目的,可能是其各自公司的商标。
- 如需查看 ROCm 支持的 Radeon 显卡完整列表,请访问 https://rocm.docs.amd.com/en/latest/reference/gpu-arch-specs.html
©2024 Advanced Micro Devices, Inc. 保留所有权利。AMD、AMD 箭头标志、AMD ROCm、AMD Instinct、EPYC、Radeon Instinct 及其组合均为 Advanced Micro Devices, Inc. 的商标。PyTorch 是 PyTorch 的商标或注册商标。本出版物中使用的其他产品名称仅用于标识目的,可能是其各自公司的商标。
- 如需查看 ROCm 支持的 Radeon 显卡完整列表,请访问 https://rocm.docs.amd.com/en/latest/reference/gpu-arch-specs.html