AMD Pensando™ DPUs
Parallele Ausführung von Netzwerk-, Sicherheits- und Speicherdiensten zur Gewährleistung deterministischer Performance und effizienter Ressourcennutzung in Cloud- und KI-Bereitstellungen.
Wie die AMD Netzwerktechnologie die KI-Performance steigert
Als KI-Netzwerk wird die High-Performance-Struktur bezeichnet, die KI flächendeckend unterstützt. Es verbindet GPUs, Beschleuniger und Systeme und bietet den Durchsatz, die Synchronisierung und die gleichbleibende Performance, die wachsende Trainings-, Inferenz- und agentische KI-Workloads erfordern.
Für die volle Auslastung von Frontier-KI-Modellen wird ein Netzwerk benötigt, das Daten zu und zwischen den Beschleunigern mit hoher Bandbreite und niedriger Latenz verschiebt.
KI-Protokolle ändern sich schnell. Mit einem programmierbaren Netzwerk bleibt die Infrastruktur flexibel und ist bereit für alles, was die Zukunft bringen mag.
Mit offenen Systemen bleibt die Entscheidungsfreiheit bei den Unternehmen, wodurch diese flexible Infrastrukturen aufbauen und eine bessere Kostenoptimierung in jeder Größenklasse durchführen können.
Wie sich strategische Netzwerkentscheidungen auf die KI-Gesamtleistung, die Infrastrukturkosten, die Skalierbarkeit und das zukünftige Wachstum auswirken.
Das Frontend-Netzwerk verbindet Benutzer und Daten für eine flächendeckend zuverlässige Datenerfassung mit der KI-Infrastruktur.
Es sorgt für eine zeitgleiche Beschleunigung von Speicher-, Sicherheits- und Netzwerkdiensten bei gleichzeitigem Schutz der Rechenressourcen für KI-Workloads.
Schlüsseltechnologie:
Mit UALoE und eng gekoppelter Software kann ein hochskalierbarer Bereich geschaffen werden, in dem viele GPUs als eine einzige Rechenressource zusammenwirken, die ein Netzwerk mit hoher Bandbreite bereitstellt, das Tensor-Parallelität, große Modelle sowie ausfallsichere und effiziente Workloads unterstützt.
Die Vereinigung von 72 GPUs bietet eine ausfallsichere Netzwerkverbindung mit alternativen Verbindungen, automatischer Fehlerbehebung und Isolierung von Workloads für einen unterbrechungsfreien Betrieb.
Schlüsseltechnologie:
Mit einem erweiterbaren Netzwerk können die erforderliche Bandbreite, die Effizienz und die Ausfallsicherheit von Training und Inferenz über mehrere Rechenzentren hinweg größtmöglich flächendeckend verteilt werden.
Erweiterbare Netzwerke beschleunigen die über Racks, Rechenzentren und Regionen hinweg verteilte KI mit vorhersehbarer Performance, schneller Wiederherstellung und noch geringeren Infrastrukturkosten.
Schlüsseltechnologie:
Modelltraining
Für das Training von Modellen mit Milliarden von Parametern wird eine präzise Synchronisation mit niedriger Latenz über Hunderttausende von GPUs hinweg benötigt.
Beschleunigung des Trainings und Verbesserung der Clusterauslastung durch kollektive Kommunikation mit ultrageringer Latenz.
Verteilte Inferenz
Für die Antwort auf Millionen von Inferenzanfragen in Echtzeit wird eine gleichbleibende Performance mit geringer Latenz auch bei unvorhersehbar hoher Nachfrage benötigt.
Schnelle Inferenzantworten selbst bei schwankender Nachfrage mithilfe deterministischer Netzwerke mit geringer Latenz.
Agentische KI
Für agentische KI-Workloads wird eine zuverlässige, kontinuierliche Koordination zwischen mehreren komplexen Diensten benötigt.
Effiziente Ausführung, Kommunikation mit geringer Latenz und verbesserte Auslastung in flächendeckend angelegten KI-Workflows mithilfe beschleunigter Infrastrukturdienste.
Durch die Erweiterung von KI über einzelne Knoten hinaus vereinigt ein erweiterbares Netzwerk zahlreiche GPUs zu einer einzigen Rechenressource und gewährleistet so eine hohe Verfügbarkeit, mit der Trainings- und agentische Workloads selbst bei Netzwerkausfällen weiterlaufen können.
Weil diese KI-Workloads oft sehr empfindlich auf Neustarts reagieren, muss das erweiterbare Netzwerk die erforderliche Ausfallsicherheit bieten, damit es nach Ausfällen ohne Verzögerung aktiver Aufträge oder Fortschrittsverluste schnell wiederhergestellt werden kann.
AMD bietet ein breites Portfolio an KI-Netzwerktechnologien an, das speziell auf die Anforderungen moderner KI-Infrastrukturen hinsichtlich Performance, Skalierbarkeit und Ausfallsicherheit zugeschnitten ist.
Mit seinem ausgereiften, generationenübergreifenden Software-Stack ermöglicht die Helios-Management-Software mithilfe von Zustandsüberwachung, Telemetrie, RAS und Automatisierung einen intelligenten Betrieb für eine gesunde Struktur.
Die AMD Helios Rack-Scale-Lösung ist eine vollständig integrierte KI-Infrastruktur, die die neuesten AMD Instinct™ GPUs, AMD EPYC™ Server-CPUs sowie die AMD Pensando™ Netzwerktechnologie zusammenführt. Sie wurde auf Basis offener Industriestandards entwickelt und ermöglicht flächendeckende Inferenz sowie Training und Feinkalibrierung von Frontier-Modellen.
Für die Weiterentwicklung der KI arbeitet AMD mit führenden Organisationen der Branche zusammen.
FAQ
KI-Netzwerke sind für die synchronisierte, datenintensive GPU-Kommunikation optimiert und kommen sowohl in skalierbaren als auch in erweiterbaren Architekturen zum Einsatz. Sie bieten zusätzlich intelligentes Engpassmanagement, schnelle Wiederherstellung und umfassende Überwachungsmöglichkeiten, die für herkömmliche Workloads nicht erforderlich sind.
Eine KI-Netzwerkkarte (AI NIC) bietet programmierbare Logik und dedizierte Beschleunigungsfunktionen zur Optimierung der GPU-zu-GPU-Kommunikation und trägt so zur Verringerung der Latenz sowie zur Verbesserung der flächendeckenden Zuverlässigkeit bei.
Skalierbar bezieht sich auf die Maximierung der Performance in Knoten oder eng gekoppelten Systemen. Erweiterbar bezieht sich auf die Skalierung über Cluster und Pods innerhalb eines Rechenzentrums hinweg. Horizontal skalierbare Architekturen ermöglichen das einheitliche Management und die Orchestrierung über mehrere, geografisch verteilte Rechenzentren hinweg, sodass diese als ein einheitliches System betrieben werden können.
AMD setzt auf bewährte Ethernet-Standards und pflegt ein umfangreiches Partner-Ökosystem zur Gewährleistung der Interoperabilität bei gleichzeitiger Flexibilität der Anbieter.
UALoE (Ultra Accelerator Link over Ethernet) wird in Rack-Scale-Systemen für skalierbare Netzwerkstrukturen eingesetzt. Dadurch können viele GPUs als ein einheitliches System zusammen betrieben werden. UALoE bietet die Performance eng gekoppelter GPUs bei gleichzeitiger Gewährleistung der für den Einsatz von KI in Live-Umgebungen erforderlichen Zuverlässigkeit und Offenheit – und das alles auf Basis von Ethernet-Standards für Flexibilität auch in der Zukunft.
Der AMD Software-Stack umfasst den AMD Cluster Controller (ACC) für automatisierten Day-0-/Day-2-Betrieb, den AMD Fabric Manager (AFM) für die Partitionierung und Isolierung von GPUs und das AMD Fabric Operating System (AFOS) für einen zuverlässigen Switch-Betrieb. Gemeinsam tragen sie zur Eliminierung manueller Konfigurationsschritte bei und machen den Betrieb flächendeckender KI-Cluster beim Einsatz in Live-Umgebungen möglich.
Kontaktieren Sie einen Vertriebsmitarbeiter von AMD.