Descripción general

Pila de software de GPU optimizada

AMD ROCm™ es una plataforma de software abierta que ayuda a los equipos de centros de datos a configurar, implementar y escalar rápidamente las cargas de trabajo de IA y centro de datos en nodos y GPU. Los desarrolladores pueden usar marcos de trabajo conocidos, ajustar el código esencial para el rendimiento y utilizar HIP para adaptar los marcos de trabajo y aplicaciones de GPU existentes para el hardware AMD compatible.

Zoom de imagen
ROCm AI stack diagram showing Silo AI, Primus, ROCm Inference, open ecosystem tools, Core SDK, expansions, and deployment.

← Mira el video

ROCm.AI: aceleración de la velocidad de desarrollo y optimización del rendimiento

Una experiencia de desarrollador nativa de la IA que acelera el desarrollo de ROCm, simplifica el desarrollo y la optimización de las cargas de trabajo de IA y maximiza el rendimiento en hardware AMD

Desarrollo

Crea, entrena e implementa la IA a gran escala con el software AMD ROCm

El software AMD ROCm™ reúne marcos de trabajo abiertos, bibliotecas optimizadas, herramientas de modelos e infraestructura de escalabilidad horizontal para respaldar el desarrollo de la IA desde la experimentación hasta la producción.

Crea

Desarrollo de modelos simplificado

Desarrolla con PyTorch, TensorFlow y JAX utilizando flujos de trabajo y contenedores optimizados con AMD para modelos abiertos populares, más de 3 millones de Hugging Face.

Entrena

AMD Primus: entrena modelos de IA a gran escala

Usa las bibliotecas de comunicación de ROCm y AMD Primus para el entrenamiento previo, el ajuste fino y el entrenamiento distribuido en GPU AMD Instinct™.

Optimiza

Optimiza y ejecuta modelos de IA

Usa AMD Quark, AITER, vLLM y SGLang para optimizar los modelos, acelerar las operaciones esenciales e implementar inferencia de alto rendimiento.

Implementar

Implementa en la infraestructura de IA

Escala desde GPU individuales hasta entornos de múltiples nodos con contenedores, Kubernetes, Slurm, telemetría y herramientas de administración del ciclo de vida.

Crea, optimiza, escala y ejecuta computación de alto rendimiento con AMD ROCm

El software AMD ROCm™ ayuda a los desarrolladores de computación de alto rendimiento a crear o portar aplicaciones científicas, a perfilar y optimizar el rendimiento, y a pasar de ejecuciones con una sola GPU a ejecuciones con múltiples nodos.

Crea

Crea y porta aplicaciones científicas

Desarrolla un código acelerado por GPU con descarga de OpenMP® o HIP, usa marcos de trabajo de computación de alto rendimiento como Kokkos y RAJA, y usa HIPIFY para ayudar a traducir el código de CUDA® existente.

Optimiza

Perfila y ajusta el rendimiento

Perfila los kernels y el movimiento de datos con las herramientas de ROCm, luego usa bibliotecas optimizadas para álgebra lineal, FFT, solucionadores y operaciones dispersas. Valida los resultados a medida que los ajustas.

Escala

Escala en GPU y nodos

Usa un MPI basado en GPU para aplicaciones distribuidas y rocSHMEM para comunicaciones iniciadas por GPU y, luego, mide el rendimiento a medida que aumentan los recuentos de GPU y nodos.

Ejecuta

Ejecuta en infraestructura de HPC

Empaqueta las aplicaciones en contenedores de computación de alto rendimiento y envía trabajos de clúster con Slurm. ROCm se utiliza en sistemas de clase superior como El Capitan, Frontier y LUMI.

Lo nuevo

ROCm 10.0: creado para la era de la IA agéntica

Icono
Crea con la experiencia de AMD

Las habilidades de AMD aportan conocimientos de AMD seleccionados y flujos de trabajo validados a los agentes de codificación de IA, lo que ayuda a los desarrolladores a crear aplicaciones optimizadas para AMD con orientación en las herramientas que ya utilizan.

Icono
Ejecuta con flujos de trabajo más simples

La CLI de ROCm proporciona una interfaz unificada para configurar, administrar y operar cargas de trabajo de IA en hardware AMD.

Icono
Optimiza la inferencia de extremo a extremo

ROCm Hyperloom utiliza IA agéntica para perfilar cargas de trabajo, identificar cuellos de botella, implementar optimizaciones y validar el rendimiento en el código de host y los kernels de GPU.

Icono
Desarrolla en un SDK de ROCm Core modular

El SDK de ROCm Core proporciona una base modular para crear, implementar y optimizar las cargas de trabajo de IA en las plataformas AMD.

Ecosistema y socios

Un amplio ecosistema de IA abierto creado con marcos de trabajo, socios de tecnología y desarrolladores líderes para acelerar la innovación, permitir la portabilidad y escalar la IA desde el desarrollo hasta la producción.

Hardware compatible

Recursos para desarrolladores

ROCm Developer screen shot

Preguntas frecuentes

AMD ROCm™ es una pila de software abierta para el desarrollo de aplicaciones de computación de alto rendimiento y de IA en GPU AMD compatibles. Los equipos lo utilizan para entrenar y ejecutar modelos de IA, crear software acelerado por GPU y ejecutar cargas de trabajo científicas en GPU y nodos.

ROCm y CUDA son plataformas informáticas de GPU independientes. ROCm proporciona una pila de software abierta para las GPU AMD compatibles, y su modelo de programación HIP ofrece una ruta para migrar el código fuente de CUDA. Las herramientas y las API no son intercambiables directamente, por lo que las tareas de migración dependen de la aplicación y sus dependencias.

No siempre. Las aplicaciones basadas en marcos de trabajo de IA compatibles pueden comenzar con una versión del marco de trabajo con ROCm habilitado. El código que llama a las API de CUDA o depende de bibliotecas específicas de CUDA puede necesitar cambios. HIPIFY ayuda a traducir el código de CUDA compatible a HIP, después de lo cual los desarrolladores deben probar la exactitud y ajustar el rendimiento según sea necesario.

ROCm es compatible con PyTorch, TensorFlow y JAX para el desarrollo de IA, además de vLLM y SGLang para la ejecución de modelos. Las versiones compatibles dependen de la versión de ROCm y de la configuración del sistema. Comprueba la matriz de compatibilidad actual antes de seleccionar una versión del marco de trabajo.

En primer lugar, comprueba la matriz de compatibilidad de la GPU y el sistema operativo. A continuación, sigue la guía de instalación de AMD para esa configuración. AMD Infinity Hub ofrece contenedores preconfigurados, mientras que la CLI de ROCm puede ayudar con la configuración y los diagnósticos en sistemas compatibles. Ejecuta una carga de trabajo de muestra para verificar el entorno antes de escalar.

Newsletter de ROCm

Recibe las últimas noticias de ROCm.

Notas al pie

©2024 Advanced Micro Devices, Inc. Todos los derechos reservados. AMD, el logotipo de la flecha de AMD, AMD ROCm, AMD Instinct, EPYC, Radeon Instinct y sus combinaciones son marcas registradas de Advanced Micro Devices, Inc. PyTorch es una marca comercial o marca comercial registrada de PyTorch. Los otros nombres de productos utilizados en esta publicación se presentan solo con fines de identificación y pueden ser marcas comerciales de sus respectivas empresas.

  1. Para obtener una lista completa de las piezas Radeon compatibles con ROCm, visita https://rocm.docs.amd.com/en/latest/reference/gpu-arch-specs.html