Übersicht

Die AMD CDNA™ Architektur ist die dedizierte Computing-Architektur, die als Grundlage der AMD Instinct™ GPUs und APUs dient. Sie verfügt über ein fortschrittliches Gehäuse, das AMD Chiplet-Technologien und High-Bandwidth-Memory (HBM), eine Infinity Architecture Fabric mit hohem Durchsatz, vereint, und bietet fortschrittliche Matrix Core Technologie, die eine umfassende Reihe von KI- und HPC-Datenformaten unterstützt. So wird der Overhead für Datenbewegungen reduziert und die Energieeffizienz erhöht.

Vergleich der Generationen im Tabellenformat:

CDNA CDNA 2 CDNA 3 CDNA 4 CDNA 5
Prozesstechnologie 7 nm FinFET 6 nm FinFET 5 nm + 6 nm FinFET 3 nm + 6 nm FinFET 2 nm + 3 nm FinFET
Transistoren 25,6 Milliarden Bis zu 58 Milliarden Bis zu 146 Milliarden Bis zu 185 Milliarden Bis zu 320 Milliarden
CUs | Matrixkerne 120 | 440 Bis zu 220 | 880 Bis zu 304 | 1216 256 | 1024 256 (WGP)**
Speichertyp 32 GB HBM2 Bis zu 128 GB HBM2E Bis zu 256 GB HBM3 | HBM3E 288 GB HBM3E 432 GB HBM4
Speicherbandbreite (Spitze) 1,2 TB/s Bis zu 3,2 TB/s Bis zu 6 TB/s 8 TB/s 23,3 TB/s
AMD Infinity Cache™ k. A. k. A. 256 MB 256 MB k. A.
GPU-Kohärenz k. A. Cache Cache und HBM Cache und HBM Cache und HBM
Unterstützung für Datentypen INT4, INT8, BF16, FP16, FP32, FP64 INT4, INT8, BF16, FP16, FP32, FP64 Matrix: INT8, FP8, BF16, FP16, TF32, FP32, FP64
Vektor: FP16, FP32, FP64
Sparsity: INT8, FP8, BF16, FP16
Matrix: MXFP4, MXFP6, INT8, MXFP8, OCP FP8, BF16, FP16, TF32*, FP32, FP64
Vektor: FP16, FP32, FP64
Sparsity: OCP-FP8, INT8, FP16, BF16
OCP: MXFP4, MXFP6, MXFP8, FP8
Matrix: INT8, BF16, FP16, FP32, FP64
Vektor: FP16, FP32, FP64
Sparsity: INT8, FP16, BF16
Produkte AMD Instinct™ MI100-Serie AMD Instinct™ MI200-Serie AMD Instinct™ MI300-Serie AMD Instinct™ MI350‑Serie AMD Instinct™ MI400-Serie

* TF32 wird von der Softwareemulation unterstützt.
** Die AMD CDNA™ 5 Architektur verwendet erweiterte Arbeitsgruppenprozessoren (WGP).

short top curved fade divider

Wir stellen vor: Die AMD CDNA™ 5 Architektur

AMD CDNA™ 5 ist die dedizierte Computing-Architektur, die als Grundlage der AMD Instinct™ MI400-Serie GPUs dient. Sie beinhaltet ein fortschrittliches Paket mit Chiplet-Technologien – entwickelt, um den Overhead bei der Datenübertragung zu verringern und die Energieeffizienz zu verbessern.

Die AMD Instinct™ MI455X GPU, die speziell für die neue AMD Helios™ Rack-Scale-Lösung mit 72 GPUs entwickelt wurde, ist das erste Produkt, das basierend auf der AMD CDNA 5 Architektur mit erweiterten Funktionen für die moderne KI-Skalierung in Frontier-KI-Bereitstellungen eingeführt wurde. Die AMD Instinct MI430X GPU für souveräne KI und HPC soll 2027 veröffentlicht werden, wobei andere AMD CDNA 5 Funktionen aktiviert sein können.

AMD Instinct™ MI455X GPUs

AMD Instinct™ MI455 Series GPU

Erweitertes Gehäuse

AMD CDNA 5 bietet eine fortschrittliche Chiplet-Architektur, die Rechen-, Speicher-, Cache- und E/A-Funktionen über spezielle Mikrochips partitioniert, um jede Funktion unabhängig für Performance und Energie zu optimieren.

Die 3D-hybrid-gebundenen Computing-Mikrochips werden gestapelt und über die hochdichten Mikrochip-zu-Mikrochip-Interconnects verbunden, um die Rechendichte und Effizienzen zu verbessern. AMD CDNA 5 integriert 432 GB HBM4-Speicher der nächsten Generation in 12 Stacks mit einer Bandbreite von 23,3 TB/s und verwendet das AMD Infinity Fabric™ Interconnect für eine über das Gehäuse stattfindende Kommunikation mit hoher Bandbreite und niedriger Latenz zwischen Computing, Speicher und E/A-Mikrochips auf dem CoWoS-L-erweiterten Gehäuse, um die Speicher- und Bandbreitenskalierung zu ermöglichen, die für moderne KI-Skalierung erforderlich ist.

Erweitertes Computing

AMD CDNA 5 bietet eine neue Arbeitsgruppenprozessor (WGP)-Architektur mit höherem Durchsatz pro Takt für AMD Instinct™ MI400-Serie GPUs. Die neue Architektur ermöglicht die Wave32-Ausführung für einen geringeren Synchronisationsaufwand und eine verbesserte SIMD-Auslastung und bietet eine fortschrittliche KI-Mathe-Engine mit neuen tanh-Anweisungen und einem verbesserten transzendentalen Durchsatz.

Fortschrittliche KI-Datentypen mit geringer Präzision MXFP8, MXFP6, MXFP4 mit Blockskalierung 16/32 und fraktionaler Skalierung mit bis zu 4-facher Durchsatzrate im Vergleich zu AMD Instinct GPUs der vorherigen Generation.1

AMD Instinct™ MI455 Series GPU
AMD Instinct™ MI455 Series GPU

Aktualisiertes Speichersystem

AMD Instinct MI400-Serie GPUs setzen neue Maßstäbe bei den Speicherfunktionen und bieten einen branchenführenden 432 GB HBM4 mit 23,3 TB/s Bandbreite pro GPU und eine verbesserte Cache- und Speicherhierarchie für wachsende Modelle, Kontextfenster und KV-Caches.

AMD Instinct MI455X GPUs in der AMD Helios Rack-Scale-Lösung bieten ein 31 TB HBM4 Shared POD-Speichersystem mit 72 GPUs, All-to-All-Kommunikation und Single-Hop unter Verwendung eines UALoE-Fabric für große KI-Modell-Workloads.

Vereinheitlichtes Fabric und E/A

Die AMD Infinity Architektur ermöglicht zusammen mit der AMD Infinity Fabric™ Technologie eine kohärente, integrierte Kommunikation mit hohem Durchsatz zwischen der AMD GPU Chiplet-Technologie, dem gestapelten HBM4-Speicher, L2-Caches und E/A-Mikrochips in einzelnen Geräten und auf Plattformen mit mehreren Geräten.

Jedes AMD Instinct MI455X GPU EAM, das für die 72 GPU AMD Helios Rack-Scale-Lösung entwickelt wurde, enthält zwei erweiterte E/A-Mikrochips mit entweder 2 PCIe® 6-kompatiblen NICs oder 3 AMD AI NICs. Jedes GPU EAM enthält außerdem 36 (bidirektionale) UALoE-Links (x2) für eine Skalierung mit hoher Bandbreite in AMD Helios Rack-Scale-Lösungen.

AMD Instinct™ MI455 Series GPU
Abstract background

Verbesserte Effizienzen

Die AMD CDNA 5 Architektur sorgt zudem für verbesserte GPU-Effizienzen, da der Speicher-Traffic und die Leerlaufzyklen reduziert werden, um die bereitgestellte Performance zu erhöhen. Zu den wichtigsten Innovationen gehören ein Tensor Data Mover (TDM) für direkte asynchrone globale LDS, die ohne Register Staging übertragen werden, eine L2-Multicast-Funktion, die einen Speicherabruf zur Bereitstellung von Multi-WGPs ermöglicht und damit redundanten Speicher-Traffic vermeidet, Split-benannte Barrieren für eine effizientere Synchronisierung und WGP-Clustering für die Zusammenarbeit mit mehreren WGPs bei Matrix-Operationen.

short bottom curved fade divider

AMD CDNA™ 4

AMD CDNA™ 4 ist die dedizierte Computing-Architektur, die als Grundlage der AMD Instinct™ MI350-Serie GPUs dient. Sie beinhaltet ein fortschrittliches Paket mit Chiplet-Technologien – entwickelt, um den Overhead bei der Datenübertragung zu verringern und die Energieeffizienz zu verbessern.

AMD Instinct MI350 Series

AMD Instinct MI350-Serie GPUs

AMD CDNA 3

Die AMD CDNA 3 Architektur ist die dedizierte Computing-Architektur, die als Grundlage der AMD Instinct™ MI300-Serie GPUs dient. Sie beinhaltet ein fortschrittliches Paket mit Chiplet-Technologien – entwickelt, um den Overhead bei der Datenübertragung zu verringern und die Energieeffizienz zu verbessern.

AMD Instinct MI300A APU

AMD Instinct MI325X GPU

Alternativtext hinzufügen

AMD CDNA 2

Die AMD CDNA 2 Architektur ist für die anspruchsvollsten wissenschaftlichen Computing-Auslastungen und Anwendungen für maschinelles Lernen konzipiert. Sie basiert auf den AMD Instinct MI200-Serie GPUs.

AMD CDNA

Die AMD CDNA Architektur ist eine dedizierte Architektur für GPU-basiertes Computing, die entwickelt wurde, um die Ära des Exascale-Computings einzuläuten. Sie basiert auf den AMD Instinct MI100-Serie GPUs.

Alternativtext hinzufügen

AMD Instinct Beschleuniger

Erfahren Sie, wie AMD Instinct GPUs neue Standards für generative KI, Training und HPC setzen.

AMD ROCm™ Software

Die AMD CDNA Architektur wird durch die AMD ROCm™ Software unterstützt, einen offenen Software-Stack, der zahlreiche Programmiermodelle, Tools, Compiler, Bibliotheken und Laufzeiten für die Entwicklung von KI- und HPC-Lösungen für AMD Instinct GPUs beinhaltet.

Fußnoten

* Einige der oben beschriebenen Funktionen sind möglicherweise nicht für alle AMD Instinct™ MI400-Serie GPUs verfügbar.

1. Basierend auf Berechnungen des AMD Leistungslabors (Juni 2026) unter Verwendung einer AMD Instinct™ MI455X GPU, der theoretischen Spitzenpräzisions-Performance (FP32, FP16, BF16, MXFP6, MXFP8, FP8, MXFP4 Matrix/Vector) im Vergleich zu den veröffentlichten Spezifikationen für AMD Instinct™ MI355X, MI350X, MI325X, MI300X, MI250X und MI100 GPUs. Die Ergebnisse können je nach Systemkonfiguration und Datentyp variieren. MI400-006.