Was ist ein KI-Netzwerk?

Als KI-Netzwerk wird die High-Performance-Struktur bezeichnet, die KI flächendeckend unterstützt. Es verbindet GPUs, Beschleuniger und Systeme und bietet den Durchsatz, die Synchronisierung und die gleichbleibende Performance, die wachsende Trainings-, Inferenz- und agentische KI-Workloads erfordern.

Die kritische Realität

Mit zunehmender Skalierbarkeit und Komplexität von KI-Workloads hängt die Systemleistung zunehmend vom Netzwerk ab. Vom Frontend-Netzwerk bis hin zur Skalierung und Erweiterung von Strukturen bestimmt jede Schicht die Effizienz der Performance von KI-Infrastrukturen.

Flächendeckende Performance beginnt beim Netzwerk

Data center with glowing lights

Leistungsstark

Für die volle Auslastung von Frontier-KI-Modellen wird ein Netzwerk benötigt, das Daten zu und zwischen den Beschleunigern mit hoher Bandbreite und niedriger Latenz verschiebt.

Abstract teal and orange light streaks overlaid with scrolling source code, suggesting data flow or AI processing

Programmierbar

KI-Protokolle ändern sich schnell. Mit einem programmierbaren Netzwerk bleibt die Infrastruktur flexibel und ist bereit für alles, was die Zukunft bringen mag.

Teal and orange network lines and nodes connected across a dark textured surface, symbolizing data connectivity

Offen

Mit offenen Systemen bleibt die Entscheidungsfreiheit bei den Unternehmen, wodurch diese flexible Infrastrukturen aufbauen und eine bessere Kostenoptimierung in jeder Größenklasse durchführen können.

Die 7 Architekturprinzipien skalierbarer KI-Netzwerke

Wie sich strategische Netzwerkentscheidungen auf die KI-Gesamtleistung, die Infrastrukturkosten, die Skalierbarkeit und das zukünftige Wachstum auswirken.

erforderlich

Frontend: Datenversorgung für die KI-Fabrik

Das Frontend-Netzwerk verbindet Benutzer und Daten für eine flächendeckend zuverlässige Datenerfassung mit der KI-Infrastruktur.

Es sorgt für eine zeitgleiche Beschleunigung von Speicher-, Sicherheits- und Netzwerkdiensten bei gleichzeitigem Schutz der Rechenressourcen für KI-Workloads.

Schlüsseltechnologie:

Skalierung: Einheitliche KI-Systeme

Mit UALoE und eng gekoppelter Software kann ein hochskalierbarer Bereich geschaffen werden, in dem viele GPUs als eine einzige Rechenressource zusammenwirken, die ein Netzwerk mit hoher Bandbreite bereitstellt, das Tensor-Parallelität, große Modelle sowie ausfallsichere und effiziente Workloads unterstützt.

Die Vereinigung von 72 GPUs bietet eine ausfallsichere Netzwerkverbindung mit alternativen Verbindungen, automatischer Fehlerbehebung und Isolierung von Workloads für einen unterbrechungsfreien Betrieb.

Schlüsseltechnologie:

Erweiterung und horizontale Skalierung: Verteilte KI

Mit einem erweiterbaren Netzwerk können die erforderliche Bandbreite, die Effizienz und die Ausfallsicherheit von Training und Inferenz über mehrere Rechenzentren hinweg größtmöglich flächendeckend verteilt werden.

Erweiterbare Netzwerke beschleunigen die über Racks, Rechenzentren und Regionen hinweg verteilte KI mit vorhersehbarer Performance, schneller Wiederherstellung und noch geringeren Infrastrukturkosten.

Schlüsseltechnologie:

Anwendungsfälle

Modelltraining

Herausforderung

Für das Training von Modellen mit Milliarden von Parametern wird eine präzise Synchronisation mit niedriger Latenz über Hunderttausende von GPUs hinweg benötigt.

Lösung

Beschleunigung des Trainings und Verbesserung der Clusterauslastung durch kollektive Kommunikation mit ultrageringer Latenz.

Radiating teal and orange light streaks with sparkling particles, suggesting high-speed data transfer

Verteilte Inferenz

Herausforderung

Für die Antwort auf Millionen von Inferenzanfragen in Echtzeit wird eine gleichbleibende Performance mit geringer Latenz auch bei unvorhersehbar hoher Nachfrage benötigt.

Lösung

Schnelle Inferenzantworten selbst bei schwankender Nachfrage mithilfe deterministischer Netzwerke mit geringer Latenz.

Abstract background

Agentische KI

Herausforderung

Für agentische KI-Workloads wird eine zuverlässige, kontinuierliche Koordination zwischen mehreren komplexen Diensten benötigt.

Lösung

Effiziente Ausführung, Kommunikation mit geringer Latenz und verbesserte Auslastung in flächendeckend angelegten KI-Workflows mithilfe beschleunigter Infrastrukturdienste.

Teal and orange particle mesh forming a flowing wave over blurred cityscape lights

Bedeutung von erweiterbaren Systemen für den Einsatz von KI in Live-Umgebungen

Durch die Erweiterung von KI über einzelne Knoten hinaus vereinigt ein erweiterbares Netzwerk zahlreiche GPUs zu einer einzigen Rechenressource und gewährleistet so eine hohe Verfügbarkeit, mit der Trainings- und agentische Workloads selbst bei Netzwerkausfällen weiterlaufen können.

Weil diese KI-Workloads oft sehr empfindlich auf Neustarts reagieren, muss das erweiterbare Netzwerk die erforderliche Ausfallsicherheit bieten, damit es nach Ausfällen ohne Verzögerung aktiver Aufträge oder Fortschrittsverluste schnell wiederhergestellt werden kann.

AMD Portfolio für KI-Netzwerke

AMD bietet ein breites Portfolio an KI-Netzwerktechnologien an, das speziell auf die Anforderungen moderner KI-Infrastrukturen hinsichtlich Performance, Skalierbarkeit und Ausfallsicherheit zugeschnitten ist.

AMD Software-Stack für KI-Netzwerke

Mit seinem ausgereiften, generationenübergreifenden Software-Stack ermöglicht die Helios-Management-Software mithilfe von Zustandsüberwachung, Telemetrie, RAS und Automatisierung einen intelligenten Betrieb für eine gesunde Struktur.

Abstract blue digital circuit pathway with glowing light source and pixel-like data patterns

AMD Pensando™ DPUs

Parallele Ausführung von Netzwerk-, Sicherheits- und Speicherdiensten zur Gewährleistung deterministischer Performance und effizienter Ressourcennutzung in Cloud- und KI-Bereitstellungen.

AMD Helios Rackscale

AMD Helios Rack-Scale-Lösung: Führende Rack-Performance für Hyperscale AI1

Die AMD Helios Rack-Scale-Lösung ist eine vollständig integrierte KI-Infrastruktur, die die neuesten AMD Instinct™ GPUs, AMD EPYC™ Server-CPUs sowie die AMD Pensando™ Netzwerktechnologie zusammenführt. Sie wurde auf Basis offener Industriestandards entwickelt und ermöglicht flächendeckende Inferenz sowie Training und Feinkalibrierung von Frontier-Modellen.

Offenes Ökosystem und offene Standards

Für die Weiterentwicklung der KI arbeitet AMD mit führenden Organisationen der Branche zusammen.

Open Compute Project logo
Ultra Accelerator Link logo
Ultra Ethernet Consortium logo

FAQ

Häufig gestellte Fragen

KI-Netzwerke sind für die synchronisierte, datenintensive GPU-Kommunikation optimiert und kommen sowohl in skalierbaren als auch in erweiterbaren Architekturen zum Einsatz. Sie bieten zusätzlich intelligentes Engpassmanagement, schnelle Wiederherstellung und umfassende Überwachungsmöglichkeiten, die für herkömmliche Workloads nicht erforderlich sind.

Eine KI-Netzwerkkarte (AI NIC) bietet programmierbare Logik und dedizierte Beschleunigungsfunktionen zur Optimierung der GPU-zu-GPU-Kommunikation und trägt so zur Verringerung der Latenz sowie zur Verbesserung der flächendeckenden Zuverlässigkeit bei.

Skalierbar bezieht sich auf die Maximierung der Performance in Knoten oder eng gekoppelten Systemen. Erweiterbar bezieht sich auf die Skalierung über Cluster und Pods innerhalb eines Rechenzentrums hinweg. Horizontal skalierbare Architekturen ermöglichen das einheitliche Management und die Orchestrierung über mehrere, geografisch verteilte Rechenzentren hinweg, sodass diese als ein einheitliches System betrieben werden können.

AMD setzt auf bewährte Ethernet-Standards und pflegt ein umfangreiches Partner-Ökosystem zur Gewährleistung der Interoperabilität bei gleichzeitiger Flexibilität der Anbieter.

UALoE (Ultra Accelerator Link over Ethernet) wird in Rack-Scale-Systemen für skalierbare Netzwerkstrukturen eingesetzt. Dadurch können viele GPUs als ein einheitliches System zusammen betrieben werden. UALoE bietet die Performance eng gekoppelter GPUs bei gleichzeitiger Gewährleistung der für den Einsatz von KI in Live-Umgebungen erforderlichen Zuverlässigkeit und Offenheit – und das alles auf Basis von Ethernet-Standards für Flexibilität auch in der Zukunft.

Der AMD Software-Stack umfasst den AMD Cluster Controller (ACC) für automatisierten Day-0-/Day-2-Betrieb, den AMD Fabric Manager (AFM) für die Partitionierung und Isolierung von GPUs und das AMD Fabric Operating System (AFOS) für einen zuverlässigen Switch-Betrieb. Gemeinsam tragen sie zur Eliminierung manueller Konfigurationsschritte bei und machen den Betrieb flächendeckender KI-Cluster beim Einsatz in Live-Umgebungen möglich.

Kontakt

Kontaktieren Sie einen Vertriebsmitarbeiter von AMD.

Fußnoten
  1. Berechnungen durchgeführt vom AMD Leistungslabor im Juni 2025 basierend auf den prognostizierten Spezifikationen hinsichtlich der Speicherkapazität/Bandbreite sowie der Skalierungs-/Erweiterungsbandbreite des AMD Instinct™ MI455X 72xGPU „Helios“ KI-Racks im Vergleich zum offiziell angekündigten NVIDIA „Vera Rubin“ 72xGPU „Oberon“-KI-Rack. Serverhersteller wählen möglicherweise andere Konfigurationen, was zu anderen Ergebnissen führen kann. MI350-045A.
    Berechnungen durchgeführt vom AMD Leistungslabor im September 2025 basierend auf den Datentypen FP8/FP4 und den prognostizierten Spezifikationen für das AMD Instinct™ MI455X 72xGPU „Helios“-KI-Rack im Vergleich zu den offiziell bekannt gegebenen Spezifikationen für das NVIDIA „Vera Rubin“ 72xGPU „Oberon“-KI-Rack. Die tatsächlichen Ergebnisse auf Basis von Chips aus der Produktion können abweichen. Serverhersteller wählen möglicherweise andere Konfigurationen, was zu anderen Ergebnissen führen kann. MI350-046B.