Présentation

AMD CDNA™ est l'architecture de calcul dédiée sur laquelle sont basés les GPU et les APU AMD Instinct™. Elle intègre un packaging avancé qui unifie les technologies de chiplet AMD et une mémoire à haute bande passante (HBM), ainsi qu'une architecture Infinity Fabric à haut débit. Elle offre également la technologie avancée Matrix Core, qui prend en charge un ensemble complet de formats de données IA et HPC. Elle est donc conçue pour réduire les frais de transfert des données et améliorer l'efficacité énergétique.

Tableau comparatif des générations :

CDNA CDNA 2 CDNA 3 CDNA 4 CDNA 5
Technologie de processus FinFET 7 nm FinFET 6 nm FinFET 5 nm + 6 nm FinFET 3 nm + 6 nm FinFET 2 nm + 3 nm
Transistors 25,6 milliards Jusqu'à 58 milliards Jusqu'à 146 milliards Jusqu'à 185 milliards Jusqu'à 320 milliards
UC | Cœurs matriciels 120 | 440 Jusqu'à 220 | 880 Jusqu'à 304 | 1216 256 | 1024 256 (WGP)**
Type de mémoire 32 Go HBM2 Jusqu'à 128 Go HBM2E Jusqu'à 256 Go HBM3 | HBM3E 288 Go HBM3E 432 Go de mémoire HBM4
Bande passante mémoire (Pic) 1,2 To/s Jusqu'à 3,2 To/s Jusqu'à 6 To/s 8 To/s 23,3 Tbit/s
AMD Infinity Cache™ N/A N/A 256 Mo 256 Mo N/A
Cohérence GPU N/A Cache Cache et HBM Cache et HBM Cache et HBM
Types de données pris en charge INT4, INT8, BF16, FP16, FP32, FP64 INT4, INT8, BF16, FP16, FP32, FP64 Matrice : INT8, FP8, BF16, FP16, TF32, FP32, FP64
Vecteur : FP16, FP32, FP64
Parcimonie : INT8, FP8, BF16, FP16
Matrice : MXFP4, MXFP6, INT8, MXFP8, OCP FP8, BF16, FP16, TF32*, FP32, FP64
Vecteur : FP16, FP32, FP64
Parcimonie : OCP-FP8, INT8, FP16, BF16
OCP : MXFP4, MXFP6, MXFP8, FP8
Matrice : INT8, BF16, FP16, FP32, FP64
Vecteur : FP16, FP32, FP64
Parcimonie : INT8, FP16, BF16
Produits AMD Instinct™ Série MI100 AMD Instinct™ Série MI200 AMD Instinct™ Série MI300 AMD Instinct™ Série MI350 AMD Instinct™ Série MI400

* Prise en charge de TF32 par émulation software.
**L'architecture AMD CDNA™ 5 utilise des processeurs de groupe de travail (WGP) de pointe.

short top curved fade divider

Découvrez l'architecture AMD CDNA™ 5

AMD CDNA™ 5 est l'architecture de calcul dédiée sur laquelle sont basés les GPU AMD Instinct™ Série MI400. Elle offre des technologies de packaging avancées associées à des chiplets et conçues pour réduire les frais de déplacement des données et améliorer l'efficacité énergétique.

Le GPU AMD Instinct™ MI455X, spécialement conçu pour la nouvelle solution rackscale AMD Helios™ à 72 GPU, est le premier produit proposé, basé sur l'architecture AMD CDNA 5, doté de fonctionnalités améliorées pour l'évolutivité de l'IA moderne dans les déploiements d'IA de pointe. Le GPU AMD Instinct MI430X, destiné à l'IA souveraine et aux calculs hautes performances, devrait sortir en 2027 et pourrait intégrer différentes fonctionnalités de l'architecture AMD CDNA 5.

GPU AMD Instinct™ MI455X

AMD Instinct™ MI455 Series GPU

Packaging avancé

AMD CDNA 5 offre une architecture chiplet avancée qui répartit les fonctions de calcul, de mémoire, de cache et d'E/S entre des dies spécialisées afin d'optimiser indépendamment chaque fonction en termes de performances et de consommation.

Les dies de calcul liées hybrides 3D sont empilées et reliées par des interconnexions die-à-die à haute densité, ce qui améliore la densité de calcul et l'efficacité. AMD CDNA 5 intègre 432 Go de mémoire HBM4 de nouvelle génération répartis en 12 piles, avec une bande passante de 23,3 Tbit/s. Cette technologie utilise l'interconnexion AMD Infinity Fabric™ pour assurer des communications intra-boîtier à large bande passante et à faible temps de latence entre les dies de calcul, de mémoire et d'E/S sur le boîtier avancé CoWoS-L, afin de fournir l'évolutivité en mémoire et en bande passante requise pour les applications d'IA modernes.

Calcul amélioré

AMD CDNA 5 propose une nouvelle architecture de processeur de groupe de travail (WGP) offrant un débit par cycle d'horloge plus élevé aux GPU AMD Instinct™ Série MI400. Cette nouvelle architecture permet l'exécution de Wave32 pour réduire la surcharge de synchronisation et améliorer l'utilisation du SIMD, et intègre un moteur mathématique d'IA avancé avec de nouvelles instructions tanh et un débit transcendantal amélioré.

Des types de données d'IA avancés à faible précision (MXFP8, MXFP6, MXFP4) avec une échelle de blocs de 16/32 et une mise à l'échelle fractionnaire permettant d'atteindre un débit jusqu'à 4 fois supérieur à celui des GPU AMD Instinct de la génération précédente.1

AMD Instinct™ MI455 Series GPU
AMD Instinct™ MI455 Series GPU

Système de mémoire mis à niveau

Les GPU AMD Instinct Série MI400 repoussent les limites en matière de capacités mémoire en proposant une mémoire HBM4 de 432 Go, à la pointe du secteur, avec une bande passante de 23,3 Tbit/s par GPU, ainsi qu'une hiérarchie de cache et de mémoire améliorée pour les modèles de plus en plus volumineux, les fenêtres de contexte et les caches KV.

Les GPU AMD Instinct MI455X intégrés à la solution rackscale AMD Helios offrent un système de mémoire partagée par pod HBM4 de 31 To/s avec 72 GPU, des communications « all-to-all » et une connexion à un seul saut via une UALoE Fabric pour les charges de travail impliquant des modèles d'IA volumineux.

Structure et E/S unifiées

L'architecture AMD Infinity, associée à la technologie AMD Infinity Fabric™, permet une communication cohérente et à haut débit sur le même boîtier entre la technologie de chiplets GPU AMD, la mémoire HBM4 empilée, les caches L2 et les dies d'E/S, tant au sein d'un même appareil que sur des plateformes multi-appareils.

Chaque module EAM GPU AMD Instinct MI455X, conçu pour la solution rackscale AMD Helios à 72 GPU, comprend deux dies d'E/S améliorées équipées soit de 2 cartes réseau compatibles PCIe® 6, soit de 3 cartes réseau IA AMD. Chaque module EAM GPU intègre également 36 liaisons UALoE (bidirectionnelles) (x2) pour un scale-up à large bande passante dans les solutions rackscale AMD Helios.

AMD Instinct™ MI455 Series GPU
Abstract background

Efficacité améliorée

L'architecture AMD CDNA 5 améliore également l'efficacité du GPU en réduisant le trafic mémoire et les cycles d'inactivité pour améliorer les performances fournies. Parmi les innovations clés, citons le Tensor Data Mover (TDM) pour un LDS global asynchrone direct qui effectue des transferts sans passage par les registres, la fonctionnalité de multidiffusion L2 qui permet à une seule lecture en mémoire d'alimenter plusieurs WGP afin d'éliminer le trafic mémoire redondant, les barrières à noms distincts pour une synchronisation plus efficace, et le regroupement en clusters des WGP pour permettre à plusieurs WGP de coopérer sur les opérations matricielles.

short bottom curved fade divider

AMD CDNA™ 4

AMD CDNA™ 4 est l'architecture de calcul dédiée sur laquelle sont basés les GPU AMD Instinct™ Série MI350. Elle offre des technologies de packaging avancées associées à des chiplets et conçues pour réduire les frais de déplacement des données et améliorer l'efficacité énergétique.

AMD Instinct MI350 Series

GPU AMD Instinct Série MI350

AMD CDNA 3

AMD CDNA 3 est l'architecture de calcul dédiée sur laquelle sont basés les GPU AMD Instinct™ Série MI300. Elle offre des technologies de packaging avancées associées à des chiplets et conçues pour réduire les frais de déplacement des données et améliorer l'efficacité énergétique.

APU AMD Instinct MI300A

GPU AMD Instinct MI325X

Ajouter texte alternatif

AMD CDNA 2

L'architecture AMD CDNA 2 est conçue pour accélérer les charges de travail de calcul scientifique et les applications d'apprentissage automatique les plus exigeantes. Elle sert de base aux GPU AMD Instinct Série MI200.

AMD CDNA

AMD CDNA est une architecture dédiée pour le calcul basé sur GPU, conçue pour marquer les débuts du calcul de classe exascale. Elle sert de base aux GPU AMD Instinct Série MI100.

Ajouter texte alternatif

Accélérateurs AMD Instinct

Découvrez comment les GPU AMD Instinct établissent de nouvelles normes en matière d'IA générative, d'entraînement et de HPC.

Software AMD ROCm™

L'architecture AMD CDNA est prise en charge par AMD ROCm™, une pile software ouverte qui inclut un large éventail de modèles de programmation, d'outils, de compilateurs, de bibliothèques et d'exécutions pour les GPU AMD Instinct dédiés au développement de solutions d'IA et de HPC.

Notes de bas de page

*Certaines fonctionnalités décrites ci-dessus peuvent ne pas être disponibles pour tous les GPU AMD Instinct™ MI400.

1. Sur la base des calculs effectués par AMD Performance Labs (juin 2026) à l'aide d'un GPU AMD Instinct™ MI455X, pic de performance théorique en précision (FP32, FP16, BF16, MXFP6, MXFP8, FP8, MXFP4 matrice/vecteur), par rapport aux spécifications publiées pour les GPU AMD Instinct™ MI355X, MI350X, MI325X, MI300X, MI250X et MI100.1 Les résultats peuvent varier en fonction de la configuration du système et des types de données. MI400-006