AI ネットワーキングとは?

AI ネットワーキングとは、大規模な AI を強化する高性能ファブリックです。GPU、アクセラレータ、システムを接続し、トレーニング、推論、およびエージェント型 AI ワークロードの需要が増加するにつれ必要とされるスループット、同期、パフォーマンスの一貫性を実現します。

意識しなければならない現実

AI ワークロードの規模と複雑さが増すにつれて、システム パフォーマンスはネットワーキングにますます依存するようになります。フロントエンド ネットワーキングからスケールアップ/スケールアウト ファブリックまで、各レイヤーは AI インフラストラクチャのパフォーマンスの効率性を左右します。

大規模なパフォーマンス向上はネットワーキングから始まる

Data center with glowing lights

高性能

最新の AI モデルは、データをフル活用できるよう広帯域幅と低レイテンシを備えた、アクセラレータ間でデータを高速かつ低レイテンシで移動させるネットワークが必要です。

Abstract teal and orange light streaks overlaid with scrolling source code, suggesting data flow or AI processing

プログラマブル

AI のプロトコルは速いペースで変化しています。ネットワークがプログラマブルであれば、インフラストラクチャの柔軟性が維持され、将来に備えることができます。

Teal and orange network lines and nodes connected across a dark textured surface, symbolizing data connectivity

オープン

オープン システムは、組織に選択肢を与え、柔軟なインフラストラクチャ構築とあらゆる規模でのコスト最適化を可能にします。

スケーラブルな AI ネットワーキングの 7 つのアーキテクチャ原則

戦略的なネットワーキングの選択が、AI の全体的なパフォーマンス、インフラストラクチャ コスト、拡張性、将来の成長にどのように影響するかをご確認ください。

必要

フロントエンド: AI ファクトリへのデータ供給

フロントエンド ネットワーキングは、ユーザーとデータを AI インフラストラクチャに接続し、信頼性の高い大規模なデータ供給を実行します。

AI ワークロードの演算リソースを維持しながら、ストレージ、セキュリティ、およびネットワーキング サービスを同時に高速化します。

主要テクノロジ:

スケールアップ: 統合 AI システム

UALoE と緊密に連携するソフトウェアにより、テンソル並列処理、大規模モデル、耐障害性と効率性に優れたワークロードをサポートする広帯域幅ネットワーキングが実現するため、多数の GPU が 1 つの演算リソースとして機能するスケールアップ ドメインが可能になります。

72 個の GPU を統合し、運用の継続性を維持するための代替接続、自動障害応答、ワークロードの分離により、復元力のあるネットワーキングを提供します。

主要テクノロジ:

スケールアウトとスケールアクロス: 分散 AI

スケールアウト ネットワーキングは、大規模なトレーニングと推論を複数のデータセンターに分散するための帯域幅、効率性、および堅牢性を提供します。

予測可能なパフォーマンス、迅速なリカバリ、インフラストラクチャ コストの削減により、ラック、データセンター、地域にまたがる分散型 AI を高速化します。

主要テクノロジ:

ユース ケース

モデル トレーニング

課題

10 億パラメーター モデルのトレーニングには、数十万個の GPU 間で正確かつ低レイテンシの同期が必要です。

ソリューション

超低レイテンシの集団通信により、トレーニングを促進し、クラスターの使用率を向上させます。

Radiating teal and orange light streaks with sparkling particles, suggesting high-speed data transfer

分散型推論処理

課題

数百万件もの推論要求にリアルタイムで対応するには、予測不可能な需要があっても一貫した低レイテンシのパフォーマンスを発揮することが求められます。

ソリューション

低レイテンシで確定的なネットワーキングは、要求が変動しても、推論応答を高速かつ一貫した状態に維持します。

Abstract background

エージェント型 AI

課題

エージェント型 AI ワークロードは、複数の複雑なサービス間の継続的な調整に依存しています。

ソリューション

インフラストラクチャ サービスの高速化により、効率的な実行、低レイテンシの通信、大規模な AI ワークフロー全体での使用率の向上が可能になります。

Teal and orange particle mesh forming a flowing wave over blurred cityscape lights

本番環境対応 AI 向けスケールアップ システムの重要性

AI は個々のノードを超えて拡張できるため、スケールアップ ネットワーキングは多数の GPU を 1 つの演算リソースに結び付け、ネットワーク障害時にトレーニングとエージェント型ワークロードの実行を継続させることが可能な高可用性を提供します。

こうした AI ワークロードは再起動の影響を受けることが多いため、スケールアップ ネットワークは、アクティブなジョブの停止や進捗遅れが累積することなく、ネットワークの中断から迅速に回復するための耐障害性を提供する必要があります。

AMD の AI ネットワーキング ポートフォリオ

AMD は、最新の AI インフラストラクチャのパフォーマンス、拡張性、耐障害性の要求に対応するよう設計された、AI ネットワーキング テクノロジの幅広いポートフォリオを提供しています。

AMD の AI ネットワーキング ソフトウェア スタック

複数世代にわたり完成度を上げてきたソフトウェア スタックを備えた Helios Management Software は、ヘルス モニタリング、テレメトリ、RAS、自動化を通じて、インテリジェントなファブリックの健全な運用を実現します。

Abstract blue digital circuit pathway with glowing light source and pixel-like data patterns

AMD Pensando™ DPU

ネットワーキング、セキュリティ、ストレージの各サービスが同時に実行され、クラウドと AI の導入環境全体で確定的なパフォーマンスと効率的なリソース使用率を実現します。

AMD AI NIC™

高速化と拡張性に優れた集合型 AI インフラストラクチャを大規模に実現するように設計された高性能 AI NIC。

AMD Helios Rackscale

AMD Helios のラックスケール ソリューション: ハイパースケール AI 向けの業界をリードするラック パフォーマンス1

AMD Helios ラックスケール ソリューション設計は、最新の AMD Instinct™ GPU、AMD EPYC™ サーバー向け CPU、および AMD Pensando™ ネットワーキングを組み合わせた完全統合型 AI インフラストラクチャであり、オープンな業界標準を使用して設計されており、大規模な推論、最先端モデル トレーニング、ファインチューニングを可能にします。

オープン エコシステムと規格

AMD は業界の大手組織と協力して AI の進歩を支援しています。

Open Compute Project logo
Ultra Accelerator Link logo
Ultra Ethernet Consortium logo

FAQ (よくある質問)

よくある質問 (FAQ)

AI ネットワーキングは、スケールアップおよびスケールアウト アーキテクチャで実行される同期化された大容量 GPU 通信に最適化されており、従来のワークロードでは必要とされない、インテリジェントな輻輳管理、高速リカバリ、および詳細な可観測性を提供します。

AI NIC は、GPU 間の通信を最適化し、レイテンシを低減し、大規模なスケールでの信頼性を向上させるプログラマブル ロジックと専用アクセラレーションを追加します。

スケールアップとは、ノード内または密結合システム内のパフォーマンスを最大化することです。スケールアウトとは、データセンター内のクラスターやポッドにまたがり拡大することです。スケールアクロスとは、地理的に分散した複数のデータセンターの統合的な管理とオーケストレーションを可能にすることで、単一の統合システムとして運用できます。

AMD は、実績のあるイーサネット規格を基にしており、パートナー エコシステムとの広範な関係を維持することで、相互運用性を確保しつつ、ベンダーの柔軟性を維持しています。

UALoE (Ultra Accelerator Link over Ethernet) は、スケールアップ ネットワーク ファブリック用のラックスケール システムで使用されます。これにより、多くの GPU が 1 つの統合システムとして動作できるようになります。本番環境対応の AI に必要な信頼性とオープン性を維持しながら、密結合 GPU のパフォーマンスを提供します。これらはすべてイーサネット規格に基づいて構築され、将来に備えて柔軟性を確保しています。

AMD のソフトウェアスタックには、自動化されたデイ ゼロ/デイ ツー運用のための AMD Cluster Controller (ACC)、GPU のパーティション化と分離用の AMD Fabric Manager (AFM)、信頼性の高いスイッチ オペレーション用の AMD Fabric Operating System (AFOS) が含まれています。これらを組み合わせることで、手作業による構成を排除し、大規模な AI クラスターを本番環境で実用的に運用できるようになります。

お問い合わせ

AMD 営業担当者にお問い合わせください。

脚注
  1. 2025 年 6 月に AMD パフォーマンス ラボで実施された計算は、AMD Instinct™ MI455X 72xGPU "Helios" AI ラックの予測されるメモリ容量/帯域幅およびスケール アップ/アウト帯域幅仕様と、公表されている NVIDIA "Vera Rubin" 72xGPU "Oberon" ラックの仕様の比較に基づいています。サーバー メーカーの構成によって、異なる結果が生じる場合があります。MI350-045A
    2025 年 9 月に AMD パフォーマンス ラボで実施された計算は、FP8/FP4 データ型と AMD Instinct™ MI455X 72xGPU "Helios" AI ラックの予測仕様と、NVIDIA "Vera Rubin" 72xGPU "Oberon" AI ラックの公表されている仕様の比較に基づいています。製品版の半導体によって、実際の結果は異なる場合があります。サーバー メーカーの構成によって、異なる結果が生じる場合があります。MI350-046B