KI-Infrastruktur, eine Herausforderung auf Systemebene
Das Wachstum der generativen und agentischen KI führt zu einer steigenden Nachfrage in der Infrastruktur von Unternehmen. Inferenz ist nun der größte KI-Workload, Training wächst weiter, und agentische KI führt zu einem unglaublichen Ausmaß an Computing bei Inferenz, Orchestrierung und Datenbewegung. Diese Workloads hängen von mehr als nur der Beschleuniger-Performance ab, so wichtig diese auch sein mag.
CPUs müssen die Workloads koordinieren, die Vernetzung muss die Daten in Bewegung halten, die Software muss die Nutzung gewährleisten und das physische Rack selbst muss alles von der Stromversorgung über die Kühlung bis hin zu Verfügbarkeit und Funktionsfähigkeit im großen Maßstab unterstützen.
Wenn die Bereitstellungen der Kunden wachsen, bewerten sie nicht mehr einzelne GPUs isoliert. Sie bewerten die Ausgabe und die Effizienz des gesamten Systems. Da sich Kunden immer stärker auf Workflows mit mehreren Agenten konzentrieren, nimmt diese Anforderung nur noch weiter zu, weil miteinander verbundene Modelle, Anwendungen, Tools und Daten alle nahtlos zusammenarbeiten müssen.
Wenn Ihre Kunden ihre KI-Infrastruktur ausbauen, können fragmentierte Designs auf Komponentenebene zu zusätzlicher Integration, Vernetzung und betrieblicher Komplexität führen. Die AMD Helios™ Rack-Scale-Plattform trägt dazu bei, dieses Problem zu lösen, indem sie Computing, Speicher, Vernetzung, Software, Stromversorgung, Kühlung, Sicherheit und Funktionsfähigkeit in einer gemeinsam entwickelten Rack-Scale-Plattform zusammenbringt.
Speziell entwickelte Plattform für Hyperscaling und souveräne KI
Die AMD Helios Rack-Scale-Plattform ist vollständig integriert und speziell entwickelt für hochvolumige Inferenz, Training von Frontier-Modellen, Feinabstimmung, souveräne KI und agentische KI. Die AMD Helios Rack-Scale-Plattform kombiniert die Leistung der AMD Instinct™ GPUs, AMD EPYC™ Server-CPUs, AMD Pensando™ NICs und DPUs, AMD ROCm™ Software und eine offene Rack-Architektur, die auf Meta Open Rack Wide Standards abgestimmt ist, und liefert eine All-in-One-Lösung für Kunden, die ihre KI-Infrastruktur kickstarten oder ein Upgrade dafür durchführen wollen.
Sie ist weit mehr als ein einfaches Rack für die GPU-Nutzung und dient als Grundlage für branchenführendes Computing.1 So können Kunden Hyperscale-Designs in bereitstellbare produktive Plattformen umwandeln.
Anstatt die optimale Lösung für Kunden und ihre KI-Anforderungen konfigurieren zu müssen, können Partner die AMD Helios Rack-Scale-Plattform nutzen, um die besten Technologien von AMD miteinander zu kombinieren und so ein in sich geschlossenes System zu schaffen, das für hochvolumige Inferenz, Training von Frontier-Modellen, Feinabstimmung und agentische KI über Hyperscale, KI-Cloud/NeoCloud, souveräne KI und große Unternehmens-KI-Infrastrukturbereitstellungen hinweg optimiert ist.
Die Bausteine der AMD Helios Rack-Scale-Plattform
Die AMD Helios Rack-Scale-Plattform bringt einige wichtige AMD Bausteine zusammen, die unterschiedliche Teile der Herausforderungen im Bereich der Serverinfrastruktur angehen, vom beschleunigten Computing über die Workload-Orchestrierung bis hin zur Datenbewegung, Entlastung der Infrastruktur und der physischen Funktionsfähigkeit.
Der Wert der AMD Helios Rack-Scale-Plattform ergibt sich nicht aus einer Komponente allein. Indem sie jede dieser Technologien einsetzen und so konzipieren, dass sie als ein aufeinander abgestimmtes System funktionieren – und durch die AMD ROCm Software unterstützt werden –, erhalten Kunden einfachen Zugang zu unglaublicher KI-Performance, die sich je nach Bedarf skalieren lässt.
AMD Instinct™ MI455X GPUs
Für Kunden, die eine KI-Infrastruktur im großen Maßstab aufbauen, zeigt sich der Wert der AMD Helios Rack-Scale-Plattform darin, was sie als vollständiges, wiederholbares System bieten kann: 72 AMD Instinct™ MI455X GPUs liefern bis zu 2,9 exaFLOPS FP4 oder 1,4 exaFLOPS FP8 Computing und werden durch bis zu 31 TB HBM4 unterstützt. Mit bis zu 1,7 PB/s HBM-Bandbreite, bis zu 260 TB/s Scale-up-Bandbreite und bis zu 43 TB/s Scale-out-Bandbreite sorgt AMD Helios dafür, dass Inferenz, verteiltes Training und umfangreiche Feinabstimmungs-Workloads effizient bleiben.
Mehr erfahren über AMD Instinct MI455X GPUs in unserem AMD Helios Leitfaden
AMD EPYC™ 9006-Serie Server-CPUs
AMD EPYC™ 9006-Serie Server-CPUs bieten die Verarbeitungsgrundlage für die AMD Helios Rack-Scale-Plattform, die die nötige Orchestrierung, Systemdienste und Steuerungsaufgaben für den effizienten Betrieb einer großen Beschleunigerumgebung unterstützt.
Dies ist entscheidend für agentische KI, bei der mehrere Modelle, Anwendungen, Tools und Datenquellen fortlaufend interagieren.
Mehr erfahren über AMD EPYC 9006-Serie Server-CPUs
AMD Pensando™ Vulcano 800 AI NICs
AMD Pensando™ Vulcano 800 AI NICs bieten die auf Standards basierende Ethernet-Scale-out-Konnektivität, um Workloads über Racks und größere KI-Cluster hinweg zu erweitern. Innerhalb des Racks verbindet UALink über Ethernet die 72 GPUs als eine koordinierte Scale-up-Beschleunigerdomäne, während Vulcano NICs diese Performance auch außerhalb des Racks gewährleisten, damit Kunden eine größere, wiederholbare KI-Infrastruktur aufbauen können, ohne die Vernetzung als eigenständige Neugestaltung zu behandeln.
Da sich Inferenz- und Trainings-Workloads immer weiter verteilen, kann die Vernetzung zu einem erheblichen Engpass bei der effektiven System-Performance werden. AMD Pensando AI NICs sorgen dafür, dass die Daten effektiv in der Infrastruktur bewegt werden, sodass das Risiko verringert wird, dass die Kommunikation zu einem limitierenden Faktor wird.
Blog über AMD Pensando Vulcano 800 AI NICs lesen
AMD Pensando™ Salina DPUs
AMD Pensando™ Salina DPUs entlasten die Host-CPUs von bestimmten Vernetzungs-, Speicher- und Sicherheitsdiensten, wodurch den CPUs mehr Kapazität für ihre primäre Orchestrierungsrolle zur Verfügung gestellt und eine dedizierte Ebene bereitgestellt wird, um die KI-Infrastruktur mit den Frontend-Netzwerken und -Diensten zu verbinden. Dieser disaggregierte Ansatz kann die Infrastruktureffizienz verbessern, indem softwaredefinierte Vernetzungsfunktionen auf dedizierte Datenverarbeitungshardware verteilt wird.
Diese Rollenverteilung ist besonders wichtig für die KI-Cloud- und Multi-Tenant-Infrastruktur, in der Betreiber gemeinsam genutzte Ressourcen, Infrastrukturdienste und Workload-Isolierung verwalten müssen, ohne jede Aufgabe auf die CPUs zu verlagern.
Blog über AMD Pensando Salina DPUs lesen
Eine Architektur, die auf offenen Branchenstandards beruht
Der letzte Baustein der AMD Helios Rack-Scale-Plattform ist die physische Architektur rund um das Computing. Diese ist abgestimmt auf eine Reihe von offenen Standards und basiert auf wiederholbaren Compute-Trays mit vier GPUs, die eine standardkonforme Grundlage für die Hyperscale-Bereitstellung und Funktionsfähigkeit für Unternehmenskunden gewährleisten. Zu diesen Standards gehören:
Open Rack Wide- / OCP-konformes Rack-Design
UALoE Scale-up
UEC-konformes Ether Scale-out
AMD ROCm Software
Die Einhaltung dieser Standards sorgt dafür, dass dichtes KI-Computing in eine bereitstellbare produktive Infrastruktur umgewandelt wird; Elemente wie Stromversorgung, Kühlung, Wartung und Komponentenaustausch werden auf Rack-Ebene betrachtet, sodass Kunden von einmaligen Systeminstallationen zu einem wiederholbaren, effizienten Architekturdesign übergehen können.
AMD Helios löst Herausforderungen der KI im großen Maßstab
Der Wert der AMD Helios Rack-Scale-Plattform lässt sich am besten anhand der Ergebnisse verstehen, die Kunden von einer KI-Infrastruktur in großem Maßstab erwarten: Höhere KI-Fabrik-Ergebnisse auf Rack-Ebene, offenes Rack-zu-Cluster-Wachstum, produktive Infrastruktur, Funktionsfähigkeit, Sicherheit und bessere Wirtschaftlichkeit, wenn Bereitstellungen von einzelnen Systemen auf produktive Plattformen verlagert werden.
Die Herausforderung: GPUs in einem KI-Rack können ihren vollen Wert nicht entfalten, wenn sie regelmäßig darauf warten, dass Anweisungen oder andere Systemkomponenten nachziehen. Im großen Maßstab wird diese langsame Kommunikation zwischen den GPUs oder anderen Teilen des Racks zu einem Engpass, der die gesamte Ausgabe des Clusters verlangsamt.
Die Lösung: Jede Komponente in der AMD Helios Rack-Scale-Plattform ist darauf ausgelegt, das Risiko zu mindern, dass ein Teil des Systems einen anderen Teil zurückhält. So können Kunden einen größeren Teil ihrer Beschleunigerkapazität produktiv halten und bessere Ergebnisse aus der Infrastruktur erzielen, in die sie investiert haben.
Die Herausforderung: Eine KI-Umgebung, die im kleinen Maßstab funktioniert, wird vermutlich immer komplexer werden, wenn Kunden weitere Racks hinzufügen. Ohne einen klaren Skalierungsplan besteht bei jeder Erweiterung das Risiko, dass neue Herausforderungen hinsichtlich Vernetzung, Integration und Betrieb geschaffen werden.
Die Lösung: Mit der AMD Helios Rack-Scale-Plattform bleibt die Beschleunigerkapazität produktiv, indem das Rack als ein koordiniertes System und nicht als eine Reihe isolierter Komponenten behandelt wird. Ihr Netzwerkdesign mit zwei Ebenen verwendet die UALoE Scale-up-Konnektivität innerhalb des Racks, damit die 72 GPUs als eine einzige Hochgeschwindigkeits-Beschleunigerdomäne funktionieren, während das auf Standards basierende Ethernet Scale-out diese Performance über die Racks hinweg gewährleistet, sodass Kunden bessere KI-Fabrik-Ergebnisse aus der Infrastruktur erzielen, in die sie investiert haben.
Die Herausforderung: Eine dichte KI-Infrastruktur kann nicht einfach wie herkömmliche Server installiert werden. Die Anforderungen an Stromversorgung, Kühlung, Vernetzung, Komponentenaustausch und physische Funktionsfähigkeit müssen von Anfang an berücksichtigt werden. Jede Bereitstellung von Grund auf neu zu konzipieren, bedeutet einen hohen Zeitaufwand, Komplexität und Risiko bei der Installation.
Die Lösung: Die AMD Helios Rack-Scale-Plattform basiert auf 18 wiederholbaren Computing-Trays mit vier GPUs und ist auf die Meta Open Rack Wide Standards abgestimmt. Elemente wie Stromversorgung, Kühlung und Funktionsfähigkeit werden als Teil der Rack-Architektur betrachtet und müssen nicht vom Kunden nach der Auswahl der Komponenten selbst festgelegt werden.
So erhalten Kunden eine standardisierte Grundlage für ihre Bereitstellungs- und Erweiterungspläne, wodurch der Aufwand für die kundenspezifische Systementwicklung reduziert wird und sich die Infrastruktur im Laufe der Zeit einfacher planen, bereitstellen und erweitern lässt.
Die Herausforderung: Die KI-Infrastruktur ist teuer, aber nicht jedes Modell, jeder Workload oder jeder Kunde benötigt rund um die Uhr Zugriff auf die gesamte GPU oder das Rack. Ohne flexible Zuordnung kann wertvolle Systemkapazität ungenutzt bleiben oder ineffizient zugewiesen sein.
Die Lösung: Durch die hardwarebasierte GPU-Partitionierung können Betreiber die verfügbaren Ressourcen in kleinere Rechensegmente aufteilen, die auf unterschiedliche Workloads und Benutzer abgestimmt werden können. Dies bietet Hyperscalern und KI-Cloud-Anbietern die Möglichkeit, GPU-Ressourcen über Inferenz-, Trainings- und Feinabstimmungs-Workloads hinweg flexibel zuzuordnen und zu isolieren. So können sie die Nutzung optimieren, Multi-Tenant-Umgebungen unterstützen und sicherstellen, dass sich ihre KI-Infrastruktur effizient anpassen kann, wenn Workloads von einzelnen Racks zu großen verteilten Clustern skalieren.
Die AMD Helios Rack-Scale-Plattform bietet auch hardwarebasierte Sicherheit über das Rack hinweg, einschließlich Identität und Attestierung auf Chipebene, Laufzeitattestierung, Speicherverschlüsselung, Verschlüsselung von Universal-Links, sichere Multi-GPU-Skalierung und Partitionierung für Multi-Tenant-Konfigurationen. Jede dieser Funktionen ist darauf ausgelegt, dass Kunden ihre KI-Daten und das geistige Eigentum an ihren Modellen schützen, während die gemeinsam genutzte und Multi-Tenant-Infrastruktur unterstützt wird.
Die Grundlage der AMD ROCm™ Software
Hardware bestimmt die potenzielle Performance der KI-Infrastruktur eines Kunden. Software legt fest, wie einfach und effektiv Kunden diese Performance für sich nutzen können.
Die AMD ROCm Software bietet die offene Softwaregrundlage für die AMD Helios Rack-Scale-Plattform und liefert Kunden die Tools, die sie benötigen, um KI-Inferenz, Training und Feinabstimmung über Rack-Scale- und Clusterumgebungen hinweg bereitzustellen, zu verwalten und zu optimieren.
AMD ROCm Software funktioniert mit gängigen KI-Modellen, Frameworks und Laufzeiten, einschließlich PyTorch, TensorFlow, JAX, ONNX Runtime, vLLM, SGLang und Triton. Zu den aktuellen Ökosystemfortschritten gehören der Zugriff auf mehr als 2 Millionen Modelle und erweiterte Unterstützung über Open-Source-KI-Frameworks und Inferenz-Engines hinweg.
Da AMD ROCm auf offenen Standards basiert, können Kunden bei der Wahl der von ihnen genutzten Modelle, Tools und Umgebungen mehr Flexibilität bewahren, während die Softwareoptimierungen dafür sorgen, dass die Hardware, die KI-Workloads ausführt, produktiv bleibt, auch wenn die Workloads zunehmen, was eine effiziente Performance im großen Maßstab unterstützt.
Für Partner bedeutet dies, dass sich die Kundengespräche nicht nur auf die Hardware beziehen sollten. Partner können Kunden dabei helfen, zu bewerten, ob ihre bevorzugten Modelle und Frameworks unterstützt werden, welcher Aufwand möglicherweise erforderlich ist, um bestehende Anwendungen zu verschieben, ob Teams die notwendigen Qualifikationen haben und wie sich die Plattform in die bestehende Orchestrierung, Überwachung und Verwaltungstools einbinden lässt.
Zielgruppen der AMD Helios Rack-Scale-Plattform
Die AMD Helios Rack-Scale-Plattform wurde für Organisationen entwickelt, die eine KI‑Infrastruktur im großen Maßstab betreiben. Auch wenn sich die Abläufe unterscheiden, haben Kunden, die Rack-Scale-KI nutzen möchten, alle denselben Bedarf an Computing mit hoher Dichte, skalierbarer Vernetzung und zuverlässigem Betrieb und Kontrolle über ihre Infrastruktur.
Große KI-Betreiber: Hyperscaler, KI-Cloud/NeoCloud-Anbieter, Entwickler von Frontier-Modellen
Dieses Publikum baut KI-Fabriken, um weltweite Dienste und die rasch wachsende Nachfrage im Bereich der KI zu unterstützen. Ihre Workloads umfassen Inferenz auf Flottenebene, verteiltes Training und groß angelegte Feinabstimmung, was oft über umfangreiche Cluster hinweg statt auf einzelnen Racks erfolgt.
Für solche Kunden liegt das Hauptaugenmerk auf der Ausgabedichte, Nutzung, Bandbreite und den wirtschaftlichen Aspekten der Skalierung von einzelnen Racks auf größere Cluster; sie legen Wert auf Wiederholbarkeit und Funktionsfähigkeit in sehr großen Flotten.
Die AMD Helios Rack-Scale-Plattform kombiniert dichtes Computing auf Rack-Ebene und Speicherkapazität mit offener Scale-out-Vernetzung und wiederholbarer Architektur, die speziell für diese Art von Bereitstellungen konzipiert ist.
Souveräne und Unternehmens-KI-Bereitstellungen
Souveräne KI und Teams für Rechenzentrumsplattformen bieten Behörden, öffentlichen Einrichtungen und systemrelevanten Branchen Kontrolle über ihre KI-Infrastruktur. Diese Art der Bereitstellung erfordert, dass der Betrieb lokal oder innerhalb der Landesgrenzen erfolgt und Anforderungen in Bezug auf Sicherheit, Governance und langfristige Kapazität erfüllt werden.
Die AMD Helios Rack-Scale-Plattform kombiniert Computing, Speicher, offene Vernetzung, Sicherheit, ROCm Software und praktisches Rack-Design, um dieser Kundengruppe dabei zu helfen, die Kontrolle, Flexibilität und langfristige Infrastrukturwahl zu behalten.
OEM/ODM und Ökosystemhersteller
Diese Kunden spielen eine andere Rolle auf dem KI-Infrastrukturmarkt: Sie müssen fortschrittliche Rack-Scale-Designs in Systeme umwandeln, die für Kunden wiederholt aufgebaut, validiert, geliefert, gewartet und unterstützt werden können.
Für dieses Publikum ist der Wert der AMD Helios Rack-Scale-Plattform nicht einfach die Performance des Racks selbst, sondern die Tatsache, dass AMD Computing, Vernetzung, Software, Sicherheit, Stromversorgung, Kühlung und physische Funktionsfähigkeit miteinander in einer vollständigen KI-Fabrik-Vorlage kombiniert hat.
So erhalten OEM/ODM-Partner und Ökosystemhersteller eine klarere Grundlage für die Entwicklung differenzierter Systeme rund um die AMD Technologie. AMD Helios trägt dazu bei, die Menge der erforderlichen benutzerdefinierten Integrationen zu reduzieren und Partnern dabei Spielraum für Innovationen bei Systemdesign, Validierung, Bereitstellung und kundenspezifischer Implementierung zu lassen.
Die offene KI-Fabrikplattform, die Partner bieten können
Beim Thema KI-Infrastruktur gehen die Kaufgespräche mittlerweile über einzelne Komponenten hinaus. Kunden suchen nun nach Lösungen, die das Spektrum von Computing, Speicher, Vernetzung, Software, Sicherheit und physischer Rackarchitektur umfassen – und wie sie alles als ein koordiniertes System betreiben –, um von KI-Experimenten zur produktiven Nutzung im großen Maßstab übergehen zu können.
Mit der AMD Helios Rack-Scale-Plattform erhalten Partner eine vollständige Lösung, die sie ihren Kunden präsentieren können. Da jede dieser leistungsstarken Technologien mit offenen Rack-Standards und AMD ROCm Software kombiniert wird, stellt die Plattform eine unglaubliche Lösung für jeden Kunden dar, dessen Fokus auf KI-Ergebnissen, Skalierbarkeit und betrieblicher Zuverlässigkeit liegt.
Um mehr über die AMD Helios Rack-Scale-Plattform und darüber zu erfahren, wie Sie Ihre Kunden beim Einstieg in den KI-Bereich oder bei deren Weiterentwicklung in diesem Bereich unterstützen können, wenden Sie sich an Ihren AMD Ansprechpartner oder besuchen Sie AMD.com.
AMD Arena
Bauen Sie sich Fachwissen auf, mit Schulungen zu KI-Lösungen von AMD, AMD EPYC™ Server-CPUs, AMD Instinct™ GPUs und vielem mehr über das gesamte AMD Portfolio hinweg.
Anmelden
Erhalten Sie monatliche Updates zu den neuesten Produkten, Schulungen und „Meet the Experts“-Online-Seminaren von AMD.
Verwandte Artikel
Fußnoten
- Basierend auf Berechnungen des AMD Leistungslabors im Juni 2026 zur Ermittlung der theoretischen Spitzenpräzision-Performance der AMD Helios Rack-Scale-Lösung unter Verwendung der Peak-Matrix-Datentypen FP16, BF16, INT8, Open Compute Project MXFP6, MXFP8, FP8 und MXFP4 im Vergleich zu dem NVIDIA Vera Rubin NVL72 Rack unter Verwendung der dichten Datentypen NVFP4 und FP8/FP6. Systemhersteller wählen möglicherweise andere Konfigurationen, was zu anderen Ergebnissen führen kann. MI400-005.
- Basierend auf Berechnungen des AMD Leistungslabors im Juni 2026 zur Ermittlung der theoretischen Spitzenpräzision-Performance der AMD Helios Rack-Scale-Lösung unter Verwendung der Peak-Matrix-Datentypen FP16, BF16, INT8, Open Compute Project MXFP6, MXFP8, FP8 und MXFP4 im Vergleich zu dem NVIDIA Vera Rubin NVL72 Rack unter Verwendung der dichten Datentypen NVFP4 und FP8/FP6. Systemhersteller wählen möglicherweise andere Konfigurationen, was zu anderen Ergebnissen führen kann. MI400-005.