AMD Pensando™ DPU
ネットワーキング、セキュリティ、ストレージの各サービスが同時に実行され、クラウドと AI の導入環境全体で確定的なパフォーマンスと効率的なリソース使用率を実現します。
AMD のネットワーキング テクノロジが AI のパフォーマンスをどのように向上させるかについて説明します。
AI ネットワーキングとは、大規模な AI を強化する高性能ファブリックです。GPU、アクセラレータ、システムを接続し、トレーニング、推論、およびエージェント型 AI ワークロードの需要が増加するにつれ必要とされるスループット、同期、パフォーマンスの一貫性を実現します。
最新の AI モデルは、データをフル活用できるよう広帯域幅と低レイテンシを備えた、アクセラレータ間でデータを高速かつ低レイテンシで移動させるネットワークが必要です。
AI のプロトコルは速いペースで変化しています。ネットワークがプログラマブルであれば、インフラストラクチャの柔軟性が維持され、将来に備えることができます。
オープン システムは、組織に選択肢を与え、柔軟なインフラストラクチャ構築とあらゆる規模でのコスト最適化を可能にします。
戦略的なネットワーキングの選択が、AI の全体的なパフォーマンス、インフラストラクチャ コスト、拡張性、将来の成長にどのように影響するかをご確認ください。
フロントエンド ネットワーキングは、ユーザーとデータを AI インフラストラクチャに接続し、信頼性の高い大規模なデータ供給を実行します。
AI ワークロードの演算リソースを維持しながら、ストレージ、セキュリティ、およびネットワーキング サービスを同時に高速化します。
主要テクノロジ:
UALoE と緊密に連携するソフトウェアにより、テンソル並列処理、大規模モデル、耐障害性と効率性に優れたワークロードをサポートする広帯域幅ネットワーキングが実現するため、多数の GPU が 1 つの演算リソースとして機能するスケールアップ ドメインが可能になります。
72 個の GPU を統合し、運用の継続性を維持するための代替接続、自動障害応答、ワークロードの分離により、復元力のあるネットワーキングを提供します。
主要テクノロジ:
スケールアウト ネットワーキングは、大規模なトレーニングと推論を複数のデータセンターに分散するための帯域幅、効率性、および堅牢性を提供します。
予測可能なパフォーマンス、迅速なリカバリ、インフラストラクチャ コストの削減により、ラック、データセンター、地域にまたがる分散型 AI を高速化します。
主要テクノロジ:
モデル トレーニング
10 億パラメーター モデルのトレーニングには、数十万個の GPU 間で正確かつ低レイテンシの同期が必要です。
超低レイテンシの集団通信により、トレーニングを促進し、クラスターの使用率を向上させます。
分散型推論処理
数百万件もの推論要求にリアルタイムで対応するには、予測不可能な需要があっても一貫した低レイテンシのパフォーマンスを発揮することが求められます。
低レイテンシで確定的なネットワーキングは、要求が変動しても、推論応答を高速かつ一貫した状態に維持します。
エージェント型 AI
エージェント型 AI ワークロードは、複数の複雑なサービス間の継続的な調整に依存しています。
インフラストラクチャ サービスの高速化により、効率的な実行、低レイテンシの通信、大規模な AI ワークフロー全体での使用率の向上が可能になります。
AMD は、最新の AI インフラストラクチャのパフォーマンス、拡張性、耐障害性の要求に対応するよう設計された、AI ネットワーキング テクノロジの幅広いポートフォリオを提供しています。
複数世代にわたり完成度を上げてきたソフトウェア スタックを備えた Helios Management Software は、ヘルス モニタリング、テレメトリ、RAS、自動化を通じて、インテリジェントなファブリックの健全な運用を実現します。
AMD Helios ラックスケール ソリューション設計は、最新の AMD Instinct™ GPU、AMD EPYC™ サーバー向け CPU、および AMD Pensando™ ネットワーキングを組み合わせた完全統合型 AI インフラストラクチャであり、オープンな業界標準を使用して設計されており、大規模な推論、最先端モデル トレーニング、ファインチューニングを可能にします。
AMD は業界の大手組織と協力して AI の進歩を支援しています。
FAQ (よくある質問)
AI ネットワーキングは、スケールアップおよびスケールアウト アーキテクチャで実行される同期化された大容量 GPU 通信に最適化されており、従来のワークロードでは必要とされない、インテリジェントな輻輳管理、高速リカバリ、および詳細な可観測性を提供します。
AI NIC は、GPU 間の通信を最適化し、レイテンシを低減し、大規模なスケールでの信頼性を向上させるプログラマブル ロジックと専用アクセラレーションを追加します。
スケールアップとは、ノード内または密結合システム内のパフォーマンスを最大化することです。スケールアウトとは、データセンター内のクラスターやポッドにまたがり拡大することです。スケールアクロスとは、地理的に分散した複数のデータセンターの統合的な管理とオーケストレーションを可能にすることで、単一の統合システムとして運用できます。
AMD は、実績のあるイーサネット規格を基にしており、パートナー エコシステムとの広範な関係を維持することで、相互運用性を確保しつつ、ベンダーの柔軟性を維持しています。
UALoE (Ultra Accelerator Link over Ethernet) は、スケールアップ ネットワーク ファブリック用のラックスケール システムで使用されます。これにより、多くの GPU が 1 つの統合システムとして動作できるようになります。本番環境対応の AI に必要な信頼性とオープン性を維持しながら、密結合 GPU のパフォーマンスを提供します。これらはすべてイーサネット規格に基づいて構築され、将来に備えて柔軟性を確保しています。
AMD のソフトウェアスタックには、自動化されたデイ ゼロ/デイ ツー運用のための AMD Cluster Controller (ACC)、GPU のパーティション化と分離用の AMD Fabric Manager (AFM)、信頼性の高いスイッチ オペレーション用の AMD Fabric Operating System (AFOS) が含まれています。これらを組み合わせることで、手作業による構成を排除し、大規模な AI クラスターを本番環境で実用的に運用できるようになります。
AMD 営業担当者にお問い合わせください。