概要
AI ワークロード用に最適化
モデルのトレーニングやファインチューニングが必要なチームもあれば、既存のオープン モデルを本番環境に投入する必要があるチームもあります。 ROCm は、AMD GPU 上で両方のアプローチに対応します。分散トレーニングのためのワークフローに加え、AI 推論を大規模に最適化、提供、運用するためのソフトウェアを備えています。
AI 推論
ROCm による本番環境対応の AI 推論
完全なオープンソース推論スタックを使用して、AMD GPU に主要なオープン モデルを展開します。事前に構築されたコンテナーとアップストリーム フレームワークのサポートにより、すぐに稼働を開始できます。
エンジンの選択
オープン モデルの提供を開始
AMD ROCm は、アップストリーム フレームワークのサポート、vLLM または SGLang のコンテナーなどを含むエンドツーエンドの推論スタックを提供します。これによってチームは、モデルをアプリケーションに統合する前に、まず実績のある推論ソフトウェアを使用して始めることができます。
実装面積の削減
メモリとサービス効率の向上
ROCm は、量子化されたモデル パッケージを、ネイティブの低精度実行および最適化された Transformer 用ホットパス カーネルと組み合わせて、チューニング作業を軽減しつつ、本番環境でのサービス提供のスループットと効率性を最大化します。
需要の増加に対応
GPU とノード全体での推論のスケーリング
モデルまたは要求ボリュームが大きくなり 1 台のサーバーでは対応できない場合は、複数の AMD Instinct™ GPU にサービスを分散します。サポートされている展開では、事前入力とデコードを個別に実行できるため、チームは各段階にリソースを割り当てることができます。
フリートの制御
Kubernetes 上で推論を実行
ROCm は、AMD GPU Operator、組み込みテレメトリ、モジュール型ドライバー アーキテクチャを介して Kubernetes と統合することで、セキュアなエアギャップ環境での自動ロールアウト、可観測性、予測可能なライフサイクル管理をサポートします。
AI トレーニング
AMD GPU 上で拡張可能なエンドツーエンド AI トレーニング
統一されたワークフローからクラスター規模の信頼性まで、Primus は大規模なトレーニングを簡素化し、迅速化します。
フレームワークの柔軟性
繰り返し実行できるトレーニングを開始
AMD Primus のレシピを通じて、Megatron-LM、PyTorch TorchTitan、または JAX MaxText 向けの統合ワークフローを使用し、AMD Instinct™ GPU 上でトレーニングを開始できます。1 つの CLI および再利用可能な設定を使用して、実験を再実行し、変更を比較できます。
GPU を効率的に稼働
Transformer トレーニングのボトルネックに対処
Primus は、最適化されたカーネルと通信対応の高速化により、トレーニングのスループットと GPU の使用率を向上させます。チームは、Primus スタック全体を通じてこれらの機能を使用したり、Primus Turbo をカスタム トレーニング環境に接続したりできます。
ジョブを継続的に実行
拡張性に優れた分散型トレーニング
モデルが大きくなり 1 台のサーバーで処理しきれなくなった場合、トレーニングは Primus によって複数の AMD Instinct™ GPU とノードにまたがって分散されます。Primus-SaFE は、トポロジに対応した配置と自動再試行を使用して、クラスターの規模が拡大するにつれて、長時間実行されるジョブを中断から回復できるようにします。
確認してから追跡
エンタープライズ対応のトレーニング運用
Primus により、チームはノードの正常性を評価してから大規模なトレーニング ジョブを開始できます。トレーニング中、テレメトリとダッシュボードによってパフォーマンスとクラスターの健全性が可視化されるため、チームは問題を特定して迅速にトラブルシューティングできます。
最新のニュース
ROCm を利用した AI 開発の進展に関する最新情報をご覧ください。
対応ハードウェア
開発者リソース
最新の ROCm ニュースが届きます。
脚注
©2024 Advanced Micro Devices, Inc. All rights reserved.AMD、AMD Arrow ロゴ、AMD ROCm、AMD Instinct、EPYC、Radeon Instinct、およびこれらの組み合わせは、Advanced Micro Devices, Inc. の商標です。PyTorch は、PyTorch の商標または登録商標です。この資料に使用されているその他の製品名は識別目的のみに使用されており、所有するそれぞれの企業の商標である可能性があります。
- ROCm でサポートされている Radeon パーツの全リストは、https://rocm.docs.amd.com/en/latest/reference/gpu-arch-specs.html で閲覧できます。
©2024 Advanced Micro Devices, Inc. All rights reserved.AMD、AMD Arrow ロゴ、AMD ROCm、AMD Instinct、EPYC、Radeon Instinct、およびこれらの組み合わせは、Advanced Micro Devices, Inc. の商標です。PyTorch は、PyTorch の商標または登録商標です。この資料に使用されているその他の製品名は識別目的のみに使用されており、所有するそれぞれの企業の商標である可能性があります。
- ROCm でサポートされている Radeon パーツの全リストは、https://rocm.docs.amd.com/en/latest/reference/gpu-arch-specs.html で閲覧できます。