Übersicht
Die AMD CDNA™ Architektur ist die dedizierte Computing-Architektur, die als Grundlage der AMD Instinct™ GPUs und APUs dient. Sie verfügt über ein fortschrittliches Gehäuse, das AMD Chiplet-Technologien und High-Bandwidth-Memory (HBM), eine Infinity Architecture Fabric mit hohem Durchsatz, vereint, und bietet fortschrittliche Matrix Core Technologie, die eine umfassende Reihe von KI- und HPC-Datenformaten unterstützt. So wird der Overhead für Datenbewegungen reduziert und die Energieeffizienz erhöht.
Vergleich der Generationen im Tabellenformat:
| CDNA | CDNA 2 | CDNA 3 | CDNA 4 | CDNA 5 | |
| Prozesstechnologie | 7 nm FinFET | 6 nm FinFET | 5 nm + 6 nm FinFET | 3 nm + 6 nm FinFET | 2 nm + 3 nm FinFET |
| Transistoren | 25,6 Milliarden | Bis zu 58 Milliarden | Bis zu 146 Milliarden | Bis zu 185 Milliarden | Bis zu 320 Milliarden |
| CUs | Matrixkerne | 120 | 440 | Bis zu 220 | 880 | Bis zu 304 | 1216 | 256 | 1024 | 256 (WGP)** |
| Speichertyp | 32 GB HBM2 | Bis zu 128 GB HBM2E | Bis zu 256 GB HBM3 | HBM3E | 288 GB HBM3E | 432 GB HBM4 |
| Speicherbandbreite (Spitze) | 1,2 TB/s | Bis zu 3,2 TB/s | Bis zu 6 TB/s | 8 TB/s | 23,3 TB/s |
| AMD Infinity Cache™ | k. A. | k. A. | 256 MB | 256 MB | k. A. |
| GPU-Kohärenz | k. A. | Cache | Cache und HBM | Cache und HBM | Cache und HBM |
| Unterstützung für Datentypen | INT4, INT8, BF16, FP16, FP32, FP64 | INT4, INT8, BF16, FP16, FP32, FP64 | Matrix: INT8, FP8, BF16, FP16, TF32, FP32, FP64 Vektor: FP16, FP32, FP64 Sparsity: INT8, FP8, BF16, FP16 |
Matrix: MXFP4, MXFP6, INT8, MXFP8, OCP FP8, BF16, FP16, TF32*, FP32, FP64 Vektor: FP16, FP32, FP64 Sparsity: OCP-FP8, INT8, FP16, BF16 |
OCP: MXFP4, MXFP6, MXFP8, FP8 Matrix: INT8, BF16, FP16, FP32, FP64 Vektor: FP16, FP32, FP64 Sparsity: INT8, FP16, BF16 |
| Produkte | AMD Instinct™ MI100-Serie | AMD Instinct™ MI200-Serie | AMD Instinct™ MI300-Serie | AMD Instinct™ MI350‑Serie | AMD Instinct™ MI400-Serie |
* TF32 wird von der Softwareemulation unterstützt.
** Die AMD CDNA™ 5 Architektur verwendet erweiterte Arbeitsgruppenprozessoren (WGP).
Wir stellen vor: Die AMD CDNA™ 5 Architektur
AMD CDNA™ 5 ist die dedizierte Computing-Architektur, die als Grundlage der AMD Instinct™ MI400-Serie GPUs dient. Sie beinhaltet ein fortschrittliches Paket mit Chiplet-Technologien – entwickelt, um den Overhead bei der Datenübertragung zu verringern und die Energieeffizienz zu verbessern.
Die AMD Instinct™ MI455X GPU, die speziell für die neue AMD Helios™ Rack-Scale-Lösung mit 72 GPUs entwickelt wurde, ist das erste Produkt, das basierend auf der AMD CDNA 5 Architektur mit erweiterten Funktionen für die moderne KI-Skalierung in Frontier-KI-Bereitstellungen eingeführt wurde. Die AMD Instinct MI430X GPU für souveräne KI und HPC soll 2027 veröffentlicht werden, wobei andere AMD CDNA 5 Funktionen aktiviert sein können.
AMD Instinct™ MI455X GPUs
Erweitertes Gehäuse
AMD CDNA 5 bietet eine fortschrittliche Chiplet-Architektur, die Rechen-, Speicher-, Cache- und E/A-Funktionen über spezielle Mikrochips partitioniert, um jede Funktion unabhängig für Performance und Energie zu optimieren.
Die 3D-hybrid-gebundenen Computing-Mikrochips werden gestapelt und über die hochdichten Mikrochip-zu-Mikrochip-Interconnects verbunden, um die Rechendichte und Effizienzen zu verbessern. AMD CDNA 5 integriert 432 GB HBM4-Speicher der nächsten Generation in 12 Stacks mit einer Bandbreite von 23,3 TB/s und verwendet das AMD Infinity Fabric™ Interconnect für eine über das Gehäuse stattfindende Kommunikation mit hoher Bandbreite und niedriger Latenz zwischen Computing, Speicher und E/A-Mikrochips auf dem CoWoS-L-erweiterten Gehäuse, um die Speicher- und Bandbreitenskalierung zu ermöglichen, die für moderne KI-Skalierung erforderlich ist.
Erweitertes Computing
AMD CDNA 5 bietet eine neue Arbeitsgruppenprozessor (WGP)-Architektur mit höherem Durchsatz pro Takt für AMD Instinct™ MI400-Serie GPUs. Die neue Architektur ermöglicht die Wave32-Ausführung für einen geringeren Synchronisationsaufwand und eine verbesserte SIMD-Auslastung und bietet eine fortschrittliche KI-Mathe-Engine mit neuen tanh-Anweisungen und einem verbesserten transzendentalen Durchsatz.
Fortschrittliche KI-Datentypen mit geringer Präzision MXFP8, MXFP6, MXFP4 mit Blockskalierung 16/32 und fraktionaler Skalierung mit bis zu 4-facher Durchsatzrate im Vergleich zu AMD Instinct GPUs der vorherigen Generation.1
Aktualisiertes Speichersystem
AMD Instinct MI400-Serie GPUs setzen neue Maßstäbe bei den Speicherfunktionen und bieten einen branchenführenden 432 GB HBM4 mit 23,3 TB/s Bandbreite pro GPU und eine verbesserte Cache- und Speicherhierarchie für wachsende Modelle, Kontextfenster und KV-Caches.
AMD Instinct MI455X GPUs in der AMD Helios Rack-Scale-Lösung bieten ein 31 TB HBM4 Shared POD-Speichersystem mit 72 GPUs, All-to-All-Kommunikation und Single-Hop unter Verwendung eines UALoE-Fabric für große KI-Modell-Workloads.
Vereinheitlichtes Fabric und E/A
Die AMD Infinity Architektur ermöglicht zusammen mit der AMD Infinity Fabric™ Technologie eine kohärente, integrierte Kommunikation mit hohem Durchsatz zwischen der AMD GPU Chiplet-Technologie, dem gestapelten HBM4-Speicher, L2-Caches und E/A-Mikrochips in einzelnen Geräten und auf Plattformen mit mehreren Geräten.
Jedes AMD Instinct MI455X GPU EAM, das für die 72 GPU AMD Helios Rack-Scale-Lösung entwickelt wurde, enthält zwei erweiterte E/A-Mikrochips mit entweder 2 PCIe® 6-kompatiblen NICs oder 3 AMD AI NICs. Jedes GPU EAM enthält außerdem 36 (bidirektionale) UALoE-Links (x2) für eine Skalierung mit hoher Bandbreite in AMD Helios Rack-Scale-Lösungen.
Verbesserte Effizienzen
Die AMD CDNA 5 Architektur sorgt zudem für verbesserte GPU-Effizienzen, da der Speicher-Traffic und die Leerlaufzyklen reduziert werden, um die bereitgestellte Performance zu erhöhen. Zu den wichtigsten Innovationen gehören ein Tensor Data Mover (TDM) für direkte asynchrone globale LDS, die ohne Register Staging übertragen werden, eine L2-Multicast-Funktion, die einen Speicherabruf zur Bereitstellung von Multi-WGPs ermöglicht und damit redundanten Speicher-Traffic vermeidet, Split-benannte Barrieren für eine effizientere Synchronisierung und WGP-Clustering für die Zusammenarbeit mit mehreren WGPs bei Matrix-Operationen.
AMD CDNA™ 4
AMD CDNA™ 4 ist die dedizierte Computing-Architektur, die als Grundlage der AMD Instinct™ MI350-Serie GPUs dient. Sie beinhaltet ein fortschrittliches Paket mit Chiplet-Technologien – entwickelt, um den Overhead bei der Datenübertragung zu verringern und die Energieeffizienz zu verbessern.
AMD Instinct MI350-Serie GPUs
AMD CDNA 3
Die AMD CDNA 3 Architektur ist die dedizierte Computing-Architektur, die als Grundlage der AMD Instinct™ MI300-Serie GPUs dient. Sie beinhaltet ein fortschrittliches Paket mit Chiplet-Technologien – entwickelt, um den Overhead bei der Datenübertragung zu verringern und die Energieeffizienz zu verbessern.
AMD Instinct MI300A APU
AMD Instinct MI325X GPU
AMD CDNA 2
Die AMD CDNA 2 Architektur ist für die anspruchsvollsten wissenschaftlichen Computing-Auslastungen und Anwendungen für maschinelles Lernen konzipiert. Sie basiert auf den AMD Instinct MI200-Serie GPUs.
AMD CDNA
Die AMD CDNA Architektur ist eine dedizierte Architektur für GPU-basiertes Computing, die entwickelt wurde, um die Ära des Exascale-Computings einzuläuten. Sie basiert auf den AMD Instinct MI100-Serie GPUs.
AMD Instinct Beschleuniger
Erfahren Sie, wie AMD Instinct GPUs neue Standards für generative KI, Training und HPC setzen.
AMD ROCm™ Software
Die AMD CDNA Architektur wird durch die AMD ROCm™ Software unterstützt, einen offenen Software-Stack, der zahlreiche Programmiermodelle, Tools, Compiler, Bibliotheken und Laufzeiten für die Entwicklung von KI- und HPC-Lösungen für AMD Instinct GPUs beinhaltet.
Fußnoten
* Einige der oben beschriebenen Funktionen sind möglicherweise nicht für alle AMD Instinct™ MI400-Serie GPUs verfügbar.
1. Basierend auf Berechnungen des AMD Leistungslabors (Juni 2026) unter Verwendung einer AMD Instinct™ MI455X GPU, der theoretischen Spitzenpräzisions-Performance (FP32, FP16, BF16, MXFP6, MXFP8, FP8, MXFP4 Matrix/Vector) im Vergleich zu den veröffentlichten Spezifikationen für AMD Instinct™ MI355X, MI350X, MI325X, MI300X, MI250X und MI100 GPUs. Die Ergebnisse können je nach Systemkonfiguration und Datentyp variieren. MI400-006.
* Einige der oben beschriebenen Funktionen sind möglicherweise nicht für alle AMD Instinct™ MI400-Serie GPUs verfügbar.
1. Basierend auf Berechnungen des AMD Leistungslabors (Juni 2026) unter Verwendung einer AMD Instinct™ MI455X GPU, der theoretischen Spitzenpräzisions-Performance (FP32, FP16, BF16, MXFP6, MXFP8, FP8, MXFP4 Matrix/Vector) im Vergleich zu den veröffentlichten Spezifikationen für AMD Instinct™ MI355X, MI350X, MI325X, MI300X, MI250X und MI100 GPUs. Die Ergebnisse können je nach Systemkonfiguration und Datentyp variieren. MI400-006.