L'infrastructure d'IA, un défi au niveau du système

L'essor de l'IA générative et agentique accroît la demande qui pèse sur l'infrastructure des entreprises. L'inférence est désormais la charge de travail d'IA la plus importante, l'entraînement continue de progresser et l'IA agentique génère une quantité effarante de calculs pour l'inférence, l'orchestration et le déplacement de données. Ces charges de travail ne dépendent pas uniquement des performances des accélérateurs.

Les CPU doivent orchestrer les charges de travail, la mise en réseau doit assurer le déplacement des données, les softwares doivent maintenir un taux d'utilisation élevé et le rack physique doit tout prendre en charge, de l'alimentation et du refroidissement à la disponibilité et la facilité de maintenance à grande échelle.

À mesure que les déploiements des clients prennent de l'ampleur, ceux-ci n'évaluent plus individuellement les GPU ; ils évaluent le rendement et l'efficacité de l'ensemble du système. Alors que les clients se concentrent de plus en plus sur les flux de travail multi-agents, cette exigence ne cesse de s'accentuer, car les modèles, applications, outils et données interconnectés doivent tous fonctionner ensemble de manière fluide.

À mesure que vos clients étendent leur infrastructure d'IA, les conceptions fragmentées où chaque composant est isolé peuvent entraîner une complexité accrue en matière d'intégration, de mise en réseau et d'opérations. La solution rackscale AMD Helios™ permet de résoudre ce problème en réunissant le calcul, la mémoire, la mise en réseau, les softwares, l'alimentation, le refroidissement, la sécurité et la facilité de maintenance dans une plateforme à l'échelle du rack conçue de manière collaborative.

Une plateforme dédiée pour l'IA hyperscale et souveraine

La plateforme rackscale AMD Helios est entièrement intégrée et spécialement conçue pour l'inférence à volume élevé, l'entraînement de modèles de pointe, l'ajustement et l'IA souveraine et agentique. Associant la puissance des GPU AMD Instinct™, des CPU pour serveur AMD EPYC™, des cartes réseau et DPU AMD Pensando™, du software AMD ROCm™ et d'une architecture de rack ouverte conforme aux normes Meta Open Rack Wide, la plateforme rackscale AMD Helios offre une solution tout-en-un aux clients qui souhaitent créer ou mettre à niveau leur infrastructure d'IA.

Bien plus qu'un simple rack destiné à l'utilisation des GPU, il s'agit d'une architecture de référence complète, conçue pour offrir les meilleurs calculs du secteur1 et permettant aux clients de transformer des conceptions hyperscale en plateformes de production faciles à déployer.

Plutôt que de devoir configurer la solution optimale pour leurs clients et leurs besoins en IA, les partenaires peuvent utiliser la plateforme rackscale AMD Helios pour associer les meilleures technologies d'AMD. Ils peuvent ainsi proposer un système cohérent et optimisé pour l'inférence à volume élevé, l'entraînement de modèles de pointe, l'ajustement et l'IA agentique, dans le cadre de déploiements d'infrastructures hyperscale, de cloud IA/NeoCloud, d'IA souveraine et de grande entreprise.

Les composants de base de la plateforme rackscale AMD Helios

La plateforme rackscale AMD Helios réunit plusieurs composants AMD de base qui répondent aux différents défis liés à l'infrastructure de serveurs, comme l'accélération des calculs, l'orchestration des charges de travail, le déplacement des données, la décharge de l'infrastructure et la facilité de maintenance physique.

La valeur de la plateforme rackscale AMD Helios ne repose pas sur un seul composant. En tirant parti de chacune de ces technologies et en les faisant fonctionner comme un seul système coordonné, pris en charge par le software AMD ROCm, les clients peuvent facilement accéder à des performances d'IA incroyables qui évoluent en fonction de leurs besoins.

GPU AMD Instinct™ MI455X

Pour les clients qui construisent une infrastructure d'IA à grande échelle, la valeur de la plateforme rackscale AMD Helios réside dans ce qu'elle peut offrir en tant que système complet et reproductible : avec 72 GPU AMD Instinct™ MI455X fournissant jusqu'à 2,9 exaFLOPS FP4 ou 1,4 exaFLOPS FP8 de puissance de calcul, une mémoire HBM4 allant jusqu'à 31 To et une bande passante HBM atteignant 1,7 Po/s, une bande passante scale-up atteignant 260 To/s et une bande passante scale-out atteignant 43 To/s, AMD Helios assure l'efficacité des charges de travail d'inférence, d'entraînement distribué et d'ajustement à grande échelle.

Pour en savoir plus sur les GPU AMD Instinct MI455X, consultez notre guide AMD Helios 

CPU pour serveur AMD EPYC™ Série 9006

Les CPU pour serveur AMD EPYC™ Série 9006 assurent la puissance de traitement de la plateforme rackscale AMD Helios. Ils prennent en charge l'orchestration, les services système et les tâches de contrôle nécessaires au bon fonctionnement et à l'efficacité d'un vaste environnement d'accélération.

Cela est essentiel pour l'IA agentique, où plusieurs modèles, applications, outils et sources de données interagissent en permanence.

En savoir plus sur les CPU pour serveur AMD EPYC Série 9006 

Cartes réseau IA AMD Pensando™ Vulcano 800

Les cartes réseau IA AMD Pensando™ Vulcano 800 fournissent une connectivité scale-out Ethernet conforme aux normes pour étendre les charges de travail des racks et des clusters d'IA plus volumineux. À l'intérieur du rack, UALink over Ethernet relie les 72 GPU au sein d'un domaine d'accélération scale-up coordonné, et les cartes réseau Vulcano étendent ces performances au-delà du rack. Ainsi, les clients peuvent construire une infrastructure d'IA plus vaste et reproductible, sans devoir repenser le réseau séparément.

Avec la distribution des charges de travail d'inférence et d'entraînement,, la mise en réseau peut devenir un important goulot d'étranglement qui nuit aux performances du système. Les cartes réseau IA AMD Pensando assurent le déplacement efficace des données dans l'infrastructure, réduisant ainsi le risque que la communication devienne un facteur limitant.

Lire le blog sur les cartes réseau IA AMD Pensando Vulcano 800 

DPU AMD Pensando™ Salina

Les DPU AMD Pensando™ Salina déchargent les CPU hôtes de certains services de mise en réseau, de stockage et de sécurité. lLes CPU disposent ainsi de davantage de capacité pour assurer leur rôle d'orchestration principal tout en fournissant tandis qu'une couche dédiée assure la connexion de l'infrastructure d'IA aux réseaux et services front-end. Cette approche désagrégée peut améliorer l'efficacité de l'infrastructure en déplaçant les fonctions réseau définies par software sur du hardware de traitement des données dédié.

Cette séparation des rôles est particulièrement importante pour le cloud IA et l'infrastructure multi-locataire, où les opérateurs doivent gérer les ressources partagées, les services d'infrastructure et l'isolement des charges de travail sans placer toutes les tâches sur les CPU.

Lire le blog sur les DPU AMD Pensando Salina 

Une architecture basée sur des normes industrielles ouvertes

Le dernier composant de la plateforme rackscale AMD Helios est l'architecture physique sous-jacente aux calculs. Elle respecte un ensemble de normes ouvertes et repose sur des tiroirs de calcul reproductibles à quatre GPU, offrant ainsi une base normalisée pour le déploiement hyperscale et une grande facilité de maintenance pour les entreprises. Ces normes comprennent :

Conception de rack conforme Open Rack Wide/OCP

Scale-up UALoE

Scale-out Ethernet conforme UEC

Software AMD ROCm

Le respect de ces normes permet de transformer le calcul IA dense en infrastructure de production facile à déployer. Les éléments tels que l'alimentation, le refroidissement, la maintenance et le remplacement des composants sont traités au niveau du rack, ce qui signifie que les clients peuvent remplacer les installations système disparates par une conception d'architecture efficace et reproductible.

Lire le blog sur les progrès de l'infrastructure d'IA ouverte et évolutive grâce à la plateforme rackscale AMD Helios 

AMD Helios résout les défis de l'IA à grande échelle

On comprend mieux la valeur de la plateforme rackscale AMD Helios en s'intéressant aux résultats que les clients souhaitent tirer d'une infrastructure d'IA à grande échelle : rendement plus élevé de l'usine d'IA au niveau du rack, croissance ouverte du rack jusqu'au cluster, infrastructure productive, facilité de maintenance, sécurité et économies plus importantes à mesure que les déploiements passent des systèmes individuels aux plateformes de production.

Le défi : les GPU d'un rack IA ne peuvent pas fonctionner à leur plein potentiel s'ils doivent régulièrement attendre des instructions ou d'autres éléments du système. À grande échelle, cette lenteur des communications entre les GPU ou d'autres parties du rack forme un goulot d'étranglement qui retarde toutes les sorties du cluster.

La solution : chaque composant de la plateforme rackscale AMD Helios est conçu pour réduire le risque qu'une partie du système en ralentisse une autre, afin que les clients puissent exploiter au mieux la capacité de leurs accélérateurs et tirer davantage de valeur de leur infrastructure.

Le défi : un environnement d'IA fonctionnant à petite échelle risque de devenir de plus en plus complexe à mesure que les clients ajoutent des racks. En l'absence d'un plan de mise à l'échelle clair, chaque expansion risque d'introduire de nouveaux défis en matière de réseau, d'intégration et d'exploitation.

La solution : la plateforme rackscale AMD Helios permet de tirer le meilleur parti de la capacité d'accélération en traitant le rack comme un système coordonné plutôt qu'un ensemble de composants isolés. Sa conception réseau à deux couches s'appuie sur la connectivité scale-up UALoE à l'intérieur du rack pour faire fonctionner les 72 GPU comme un seul domaine d'accélération haut débit. Le scale-out Ethernet conforme aux normes étend ces performances à tous les racks, Les clients peuvent ainsi tirer davantage de capacité de production d'IA utile de l'infrastructure dans laquelle ils ont investi.

Le défi : une infrastructure d'IA dense ne peut pas être simplement installée comme des serveurs conventionnels. Les exigences en matière d'alimentation, de refroidissement, de mise en réseau, de remplacement des composants et de facilité de maintenance physique doivent être prises en compte dès le début. Concevoir chaque déploiement de A à Z prend plus de temps, et accroît la complexité et les risques à l'installation.

La solution : la plateforme rackscale AMD Helios repose sur 18 tiroirs de calcul reproductibles à quatre GPU. Elle est conforme aux normes Meta Open Rack Wide. Les éléments tels que l'alimentation, le refroidissement et la facilité de maintenance font partie intégrante de l'architecture du rack au lieu d'être définis après coup par le client, une fois les composants sélectionnés.

Ainsi, les clients bénéficient d'une base standardisée pour leurs plans de déploiement et d'expansion, ce qui évite d'avoir à concevoir des systèmes personnalisés et facilite la planification, le déploiement et l'expansion de l'infrastructure au fil du temps.

Le défi : l'infrastructure d'IA est coûteuse, mais tous les modèles, charges de travail ou besoins des clients ne nécessitent pas d'accéder 24 h sur 24 à un GPU ou rack entier. Sans allocation flexible, une partie précieuse de la capacité du système peut rester inexploitée ou être affectée de manière inefficace.

La solution : le partitionnement des GPU basé sur le hardware permet aux opérateurs de diviser les ressources disponibles en segments de calcul plus petits qui peuvent être attribués à différentes charges de travail et à différents utilisateurs. Ainsi, les hyperscalers et les fournisseurs de cloud IA peuvent allouer et isoler les ressources GPU de manière flexible pour les charges de travail d'inférence, d'entraînement et d'ajustement. Cela leur permet d'améliorer l'utilisation, de prendre en charge les environnements multi-locataires et de s'assurer que leur infrastructure d'IA peut s'adapter efficacement à mesure que les charges de travail passent des racks uniques aux grands clusters distribués.

La plateforme rackscale AMD Helios offre également une sécurité intégrée au hardware sur l'ensemble du rack, notamment l'identité et l'attestation au niveau des appareils, l'attestation d'exécution, le cryptage de la mémoire et des liens universels, l'évolutivité multi-GPU sécurisée et le partitionnement pour les configurations multi-locataires. Chacune de ces fonctionnalités est conçue pour aider les clients à protéger leurs données d'IA et la propriété intellectuelle de leurs modèles tout en prenant en charge une infrastructure partagée et multi-locataire.

La base du software AMD ROCm™

Le hardware définit les performances potentielles de l'infrastructure d'IA d'un client. Le software détermine la facilité et l'efficacité avec lesquelles les clients peuvent mettre ces performances en pratique.

AMD ROCm dote la plateforme rackscale AMD Helios d'une base software ouverte offrant aux clients les outils dont ils ont besoin pour déployer, gérer et optimiser l'inférence, l'entraînement et l'ajustement d'IA dans des environnements en rack et en cluster.

Le software AMD ROCm est compatible avec les modèles, frameworks et environnements d'exécution d'IA les plus utilisés, notamment PyTorch, TensorFlow, JAX, ONNX Runtime, vLLM, SGLang et Triton. Les progrès récents de l'écosystème incluent l'accès à plus de 2 millions de modèles et une prise en charge étendue des infrastructures d'IA open source et des moteurs d'inférence.

AMD ROCm étant basé sur des normes ouvertes, les clients bénéficient d'une plus grande flexibilité pour choisir les modèles, les outils et les environnements qu'ils utilisent. Les optimisations software permettent d'exploiter pleinement le hardware à mesure que les charges de travail d'IA qu'il exécute augmentent, pour maintenir les performances à grande échelle.

Pour les partenaires, cela signifie que la conversation avec le client doit aller au-delà de la seule question du hardware Les partenaires peuvent aider les clients à déterminer si leurs modèles et frameworks habituels sont pris en charge, quelles sont les tâches nécessaires pour déplacer les applications existantes, si les équipes disposent des compétences requises et comment la plateforme se connectera à leurs outils d'orchestration, de surveillance et de gestion existants.

Pour qui la plateforme rackscale AMD Helios est-elle conçue ?

La plateforme rackscale AMD Helios est conçue pour les entreprises qui exploitent une infrastructure d'IA à grande échelle. Bien que leurs opérations diffèrent, les clients à la recherche d'une IA à l'échelle du rack ont en commun les mêmes besoins de calcul haute densité, de mise en réseau évolutive, de fiabilité opérationnelle et de contrôle de l'infrastructure.

Opérateurs d'IA à grande échelle : hyperscalers, fournisseurs de cloud IA/NeoCloud, développeurs de modèles de pointe

Ces clients construisent des infrastructures d'IA capables de prendre en charge des services à l'échelle mondiale et une demande croissante dans le domaine de l'IA. Leurs charges de travail comprennent l'inférence à l'échelle du parc, l'entraînement distribué et l'ajustement à grande échelle, qui s'appuient souvent sur des clusters étendus plutôt que sur des racks isolés.

Pour ces clients, les principales préoccupations sont la densité des résultats en sortie, l'utilisation, la bande passante et le coût du passage d'un seul rack à des clusters plus importants. Ils accordent également une grande importance à la reproductibilité et la facilité de maintenance pour leurs parcs étendus.

La plateforme rackscale AMD Helios associe une capacité de calcul et de mémoire dense au niveau du rack à une mise en réseau scale-out ouverte et une architecture reproductible spécialement conçue pour ces types de déploiements.

Déploiements d'une IA d'entreprise et souveraine

Les équipes chargées des plateformes des centres de données et de l'IA souveraine permettent aux gouvernements, aux institutions publiques et aux industries d'importance stratégique de garder la maîtrise de leur infrastructure d'IA. Ce type de déploiement nécessite que les opérations soient effectuées sur site ou à l'intérieur des frontières nationales, tout en respectant les exigences relatives à la sécurité, à la gouvernance et à la capacité à long terme.

La plateforme rackscale AMD Helios allie le calcul, la mémoire, le réseau ouvert, la sécurité, le software ROCm et une conception de rack assurant une maintenance facile pour aider ces clients à conserver la maîtrise de leur infrastructure, leur flexibilité et leur liberté de choix à long terme.

Constructeurs OEM/ODM et d'écosystèmes

Ces clients jouent un rôle différent sur le marché de l'infrastructure d'IA : ils doivent transformer des conceptions avancées à l'échelle du rack en systèmes pouvant être construits, validés, livrés, entretenus et pris en charge de manière répétée pour leurs propres clients.

Pour ce public, la valeur de la plateforme rackscale AMD Helios ne réside pas seulement dans les performances du rack lui-même, mais dans le fait qu'AMD réunit le calcul, la mise en réseau, le software, la sécurité, l'alimentation, le refroidissement et la facilité de maintenance physique dans une infrastructure d'IA complète.

Les partenaires OEM/ODM et les constructeurs d'écosystèmes disposent ainsi d'une base plus claire pour développer des systèmes différenciés autour de la technologie AMD. AMD Helios permet de réduire le recours aux intégrations personnalisées tout en laissant aux partenaires la possibilité d'innover en matière de conception, de validation, de déploiement, ainsi que dans leur adaptation aux besoins spécifiques des clients.

La plateforme ouverte d'infrastructure d'IA proposée par les partenaires

Une infrastructure d'IA ne s'achète plus composant par composant. Pour les aider à passer de l'expérimentation de l'IA à la production à grande échelle, les clients recherchent désormais des solutions qui englobent le calcul, la mémoire, le réseau, les softwares, la sécurité et l'architecture de rack physique, et fonctionnent comme un seul système coordonné.

La plateforme rackscale AMD Helios offre aux partenaires une solution complète à présenter aux clients. Parce qu'elle associe chacune de ces puissantes technologies à des normes de rack ouvertes et au software AMD ROCm, elle constitue la solution idéale pour les clients qui se concentrent sur les résultats de l'IA, l'évolutivité et la fiabilité opérationnelle.

Pour en savoir plus sur la plateforme rackscale AMD Helios et la manière dont vous pouvez aider vos clients à adopter l'IA ou à progresser dans ce domaine, contactez votre représentant AMD ou rendez-vous sur AMD.com.

Visiter la page d'accueil de la plateforme rackscale AMD Helios

AMD Arena


Développez votre expertise grâce à des formations sur les solutions d'IA AMD, les CPU pour serveur AMD EPYC™, les GPU AMD Instinct™ et bien plus encore dans l'ensemble du portefeuille AMD.

Notes de bas de page
  1. Sur la base des calculs réalisés par AMD Performance Labs en juin 2026 afin de déterminer le pic de performance théorique en précision de la solution rackscale AMD Helios à l'aide des types de données de la matrice des pics FP16, BF16, INT8, Open Compute Project MXFP6, MXFP8, FP8 et MXFP4, par rapport au rack NVIDIA Vera Rubin NVL72 utilisant des types de données denses NVFP4 et FP8/FP6. Les résultats peuvent varier en fonction des configurations créées par les fabricants de systèmes. MI400-005.