Présentation

Optimisé pour les charges de travail d'IA

Certaines équipes doivent entraîner ou ajuster un modèle, tandis que d'autres cherchent à mettre en production un modèle ouvert existant. ROCm prend en charge ces deux approches sur les GPU AMD, grâce à des flux de travail d'entraînement distribué et à des softwares permettant d'optimiser, de déployer et de développer l'inférence d'IA à grande échelle.

Inférence d'IA

Inférence d'IA de production avec ROCm

Déployez les meilleurs modèles ouverts sur les GPU AMD à l'aide d'une pile d'inférence entièrement open source. Soyez opérationnel rapidement grâce à des conteneurs préconfigurés et à la prise en charge des frameworks en amont.

Choisissez votre moteur

Commencez à mettre en service des modèles ouverts

AMD ROCm propose une pile d'inférence complète avec la prise en charge des frameworks en amont, des conteneurs vLLM ou SGLang, ainsi que d'autres composants afin que votre équipe puisse démarrer rapidement avec des softwares d'inférence éprouvés avant d'intégrer un modèle à votre application.

Empreinte réduite¹

Améliorez l'efficacité de la mémoire et de la mise en service des modèles

ROCm associe des paquets de modèles quantifiés à une exécution native en basse précision et à des noyaux de chemin critique optimisés pour les transformateurs, afin de réduire l'effort de réglage tout en maximisant le débit et l'efficacité pour une mise en service en conditions réelles.

Répondez à une demande croissante

Faites évoluer l'inférence sur plusieurs GPU et nœuds

Lorsqu'un modèle ou un volume de requêtes dépasse les capacités d'un seul serveur, répartissez la mise en service sur plusieurs GPU AMD Instinct™. Les déploiements compatibles peuvent séparer les phases de préremplissage et de décodage afin d'allouer les ressources de manière optimale.

Contrôlez votre parc

Exécutez l'inférence avec Kubernetes

ROCm s'intègre à Kubernetes via AMD GPU Operator, la télémétrie intégrée et une architecture de pilotes modulaire, prenant en charge le déploiement automatisé, l'observabilité et la gestion prévisible du cycle de vie dans des environnements sécurisés et isolés physiquement.

Entraînement de l'IA

Entraînement de l'IA de bout en bout à grande échelle sur les GPU AMD

Des flux de travail unifiés à la fiabilité à l'échelle du cluster, Primus simplifie et accélère l'entraînement de grands modèles.

Frameworks flexibles

Reproduisez facilement vos exécutions d'entraînement

Commencez à entraîner vos modèles sur les GPU AMD Instinct™ à l'aide de flux de travail unifiés via les recettes AMD Primus pour Megatron-LM, PyTorch TorchTitan ou JAX MaxText. Utilisez une interface CLI unique et des configurations réutilisables pour réexécuter vos expériences et comparer facilement les modifications.

Maximisez l'utilisation des GPU

Éliminez les goulots d'étranglement liés aux transformeurs

Primus améliore le débit d'entraînement et l'utilisation des GPU grâce à des noyaux optimisés et à une accélération tenant compte des communications. Les équipes peuvent utiliser ces fonctionnalités via l'ensemble de la pile Primus ou intégrer Primus Turbo à leurs environnements d'entraînement personnalisés.

Maximisez l'exécution de vos tâches

Entraînement distribué évolutif

Lorsqu'un modèle dépasse les capacités d'un seul serveur, Primus facilite la distribution de l'entraînement sur plusieurs GPU et nœuds AMD Instinct™. Primus-SaFE utilise un placement tenant compte de la topologie du système et des mécanismes automatiques de relance afin d'aider les tâches de longue durée à se remettre des interruptions, même lorsque les clusters gagnent en taille.

Vérifiez et surveillez

Opérations d'entraînement prêtes pour l'entreprise

Primus aide les équipes à évaluer l'état des nœuds avant le lancement d'importantes tâches d'entraînement. Pendant l'exécution, ses outils de télémétrie et ses tableaux de bord offrent une visibilité complète sur les performances et la santé du cluster, afin d'aider les équipes à identifier les problèmes et à les résoudre plus rapidement.

Actualités

Découvrez les dernières avancées dans le domaine du développement de l'IA avec ROCm.

Hardware pris en charge

Ressources pour les développeurs

ROCm Developer screen shot

Newsletter dédiée à ROCm

Recevez les dernières actualités concernant ROCm.

Notes de bas de page

©2024 Advanced Micro Devices, Inc. Tous droits réservés. AMD, le logo AMD avec la flèche, AMD ROCm, AMD Instinct, EPYC, Radeon Instinct et leurs combinaisons sont des marques commerciales d'Advanced Micro Devices, Inc. PyTorch est une marque commerciale ou une marque déposée de PyTorch. Les autres noms de produits cités dans cette publication ne sont mentionnés qu'à des fins d'identification et peuvent être des marques déposées de leurs sociétés respectives.

  1. Pour une liste complète des pièces Radeon prises en charge par ROCm, rendez-vous sur : https://rocm.docs.amd.com/en/latest/reference/gpu-arch-specs.html.