DPU AMD Pensando™
Les services de mise en réseau, de sécurité et de stockage s'exécutent simultanément pour garantir des performances déterministes et une utilisation efficace des ressources dans les déploiements cloud et IA.
Découvrez comment la technologie de mise en réseau d'AMD améliore les performances de l'IA
La mise en réseau IA est une structure haute performance qui alimente l'IA à grande échelle. Elle relie les GPU, les accélérateurs et les systèmes, offrant ainsi la cohérence en termes de débit, de synchronisation et de performances que les charges de travail d'entraînement, d'inférence et d'IA agentique exigent à mesure qu'elles se développent.
À mesure que les charges de travail d'IA augmentent en termes d'échelle et de complexité, les performances du système dépendent de plus en plus de la mise en réseau. De la mise en réseau front-end aux structures scale-up et scale-out, chaque couche détermine l'efficacité de l'infrastructure d'IA.
Les meilleurs modèles d'IA nécessitent un réseau capable de déplacer rapidement les données entre les accélérateurs, avec une bande passante élevée et une faible latence, pour assurer une utilisation optimale.
Les protocoles d'IA évoluent à une vitesse vertigineuse. Un réseau programmable permet une infrastructure flexible et prête pour les développements futurs.
Les systèmes ouverts offrent le choix aux entreprises, ce qui permet de créer des infrastructures flexibles et d'optimiser les coûts à toutes les échelles.
Découvrez comment les choix stratégiques de mise en réseau ont un impact sur les performances globales de l'IA, les coûts d'infrastructure, l'évolutivité et la croissance future.
La mise en réseau front-end connecte les utilisateurs et les données à l'infrastructure d'IA pour une ingestion fiable à grande échelle.
Elle offre une accélération simultanée des services de stockage, de sécurité et de mise en réseau tout en préservant les ressources de calcul pour les charges de travail d'IA.
Technologie clé :
La technologie UALoE et les softwares étroitement couplés permettent de créer un domaine scale-up dans lequel de nombreux GPU fonctionnent comme une seule ressource de calcul, avec un réseau à large bande passante prenant en charge le parallélisme des tenseurs, les grands modèles et des charges de travail résilientes et performantes.
Ce domaine unifie 72 GPU et fournit une mise en réseau résiliente avec des connexions alternatives, une gestion automatisée des pannes et un isolement des charges de travail pour assurer un fonctionnement continu.
Technologie clé :
La mise en réseau scale-out offre la bande passante, l'efficacité et la résilience nécessaires pour distribuer l’entraînement et l'inférence à très grande échelle entre plusieurs centres de données.
Cela accélère l'IA distribuée entre les racks, les centres de données et les régions avec des performances prévisibles, une restauration rapide et des coûts d'infrastructure réduits.
Technologie clé :
Entraînement des modèles
L'entraînement de modèles avec des milliards de paramètres exige une synchronisation précise et à faible latence sur des centaines de milliers de GPU.
Les communications collectives à très faible latence accélèrent l’entraînement et améliorent l'utilisation des clusters.
Inférence distribuée
La réponse à des millions de requêtes d'inférence en temps réel exige des performances homogènes et à faible latence dans des conditions de demande imprévisibles.
La mise en réseau déterministe à faible latence garantit des réponses d'inférence rapides et cohérentes, même en cas de fluctuation de la demande.
IA agentique
Les charges de travail d'IA agentique reposent sur une coordination continue entre plusieurs services complexes.
Les services d'infrastructure accélérés permettent une exécution efficace, une communication à faible latence et une meilleure utilisation dans les flux de travail d'IA à grande échelle.
À mesure que l'IA évolue au-delà des nœuds individuels, la mise en réseau scale-up relie de nombreux GPU en une seule ressource de calcul et fournit la haute disponibilité nécessaire pour maintenir les charges de travail d’entraînement et agentiques en cas de défaillance réseau.
Ces charges de travail d'IA sont souvent sensibles aux redémarrages. La mise en réseau scale-up doit donc fournir la résilience nécessaire pour restaurer rapidement le réseau en cas de perturbations sans interrompre les tâches en cours ou perdre le travail déjà réalisé.
AMD propose un large portefeuille de technologies de mise en réseau IA conçues pour répondre aux exigences de performances, d'évolutivité et de résilience de l'infrastructure d'IA moderne.
Avec une pile software multigénérationnelle mature, le software de gestion Helios permet des opérations d'intégrité de structure intelligentes en assurant la surveillance de l'intégrité, la télémétrie, la fiabilité, la disponibilité, le service et l'automatisation.
La conception de la solution AMD Helios Rackscale est une infrastructure d'IA entièrement intégrée, combinant les derniers GPU AMD Instinct™, les CPU pour serveur AMD EPYC™ et la mise en réseau AMD Pensando™, élaborée à l'aide de normes industrielles ouvertes permettant une inférence à grande échelle, un entraînement de modèles de pointe et un réglage précis.
AMD collabore avec les plus grandes entreprises du secteur pour aider à faire progresser l'IA.
FAQ
La mise en réseau IA est optimisée pour la communication GPU synchronisée à volume élevé s'exécutant sur des architectures scale-up et scale-out. Elle offre également une gestion de la congestion intelligente, une récupération rapide et une observabilité approfondie dont les charges de travail traditionnelles n'ont pas besoin.
Une carte réseau IA ajoute une logique programmable et une accélération dédiée qui optimise la communication entre GPU, réduit la latence et améliore la fiabilité à grande échelle.
Le scale-up désigne l'optimisation des performances au sein des nœuds ou des systèmes étroitement couplés. Le scale-out consiste à étendre les capacités entre les clusters et les pods au sein d'un centre de données. Le scale-across permet une gestion et une orchestration unifiées de plusieurs centres de données géographiquement dispersés, afin de les faire fonctionner comme un seul système.
AMD s'appuie sur des normes Ethernet éprouvées et entretient des relations étroites avec les partenaires de l'écosystème pour garantir l'interopérabilité tout en évitant toute dépendance à un fournisseur.
La technologie UALoE (Ultra Accelerator Link over Ethernet) est utilisée dans les systèmes à l'échelle du rack pour les structures de réseau scale-up. Elle permet à de nombreux GPU de fonctionner comme un seul système unifié. Elle offre les performances de GPU étroitement couplés tout en conservant la fiabilité et l'ouverture requises par l'IA en production, le tout basé sur les normes Ethernet pour une flexibilité évolutive.
La pile software AMD inclut AMD Cluster Controller (ACC) pour les opérations automatisées Day 0/Day 2, AMD Fabric Manager (AFM) pour le partitionnement et l'isolement des GPU, et AMD Fabric Operating System (AFOS) pour des opérations de commutateur fiables. Ensemble, ces solutions permettent d'éliminer la configuration manuelle et de rendre les clusters d'IA à grande échelle pratiques à utiliser en production.
Contactez un représentant commercial AMD.