AI 基礎架構形成系統層級的挑戰
生成式 AI 與代理式 AI 持續成長,正全面提高企業對基礎架構的需求;推論現已成為首要 AI 工作負載,訓練規模持續擴大,而代理式 AI 更在推論、協調流程和資料移動方面催生令人難以置信的運算需求。這些工作負載所仰賴的不只是加速器效能,儘管這點確實非常重要。
處理器必須協調工作負載,網路必須讓資料移動順暢無阻,軟體必須推升使用率並維持滿載,而實體機架本身必須大規模支援從電源與散熱,到可用性與可維修性的一切項目。
隨著客戶的部署增加,他們已不再單獨評估個別顯示卡,而是評估整個系統的輸出與效率。隨著客戶越來越重視多代理人工作流程,這項需求只會增加,因為互相連線的模型、應用程式、工具和資料都必須流暢共同作業。
客戶在擴大 AI 基礎架構時,零散且元件逐一建置的設計方式,可能會帶來額外的整合、網路和營運複雜性。AMD Helios™ 機架規模平台將運算、記憶體、網路、軟體、電源、散熱、安全性和可維修性整合至單一共同設計的機架規模平台中,協助因應這項挑戰。
專為超大規模與主權 AI 打造的平台
AMD Helios 機架規模平台採用完全整合設計,專為大量推論、尖端模型訓練、微調、主權 AI 和代理式 AI 所打造。AMD Helios 機架規模平台結合了 AMD Instinct™ 顯示卡、AMD EPYC™ 伺服器處理器、AMD Pensando™ NIC 與 DPU、AMD ROCm™ 軟體,以及符合 Meta Open Rack-wide 標準的開放式機架架構,為期望快速啟動或升級 AI 基礎架構的客戶提供一套多合一解決方案。
這款產品遠遠不只是用來發揮顯示卡使用率的簡單機架,而是一套專為領先業界之運算打造的完整藍圖1,可讓客戶將超大規模設計轉變成可部署的生產平台。
合作夥伴無須針對客戶及其 AI 需求配置最佳解決方案,可利用 AMD Helios 機架規模平台,結合 AMD 提供的最佳技術來生產針對以下項目最佳化且高度統合的系統:超大規模、AI 雲端/NeoCloud、主權 AI 和大型企業 AI 基礎架構部署的大量推論、尖端模型訓練、微調和代理式 AI。
AMD Helios 機架規模平台背後的建構元素
AMD Helios 機架規模平台整合多項核心 AMD 建構元素,從加速運算與工作負載協調流程,到資料移動、基礎架構卸載和實體可維修性,分別處理伺服器基礎架構挑戰的不同部分。
AMD Helios 機架規模平台的價值並非來自任何單一元件。透過運用以下每一項技術,並將其設計為平衡整全的系統,再搭配 AMD ROCm 軟體支援,客戶即可輕鬆取得驚人的 AI 效能,且這個效能可隨需求擴充。
AMD Instinct™ MI455X 顯示卡
對於大規模建置 AI 基礎架構的客戶而言,AMD Helios 機架規模平台的價值,在於能以完整且可重複部署的系統提供以下能力:72 個 AMD Instinct™ MI455X 顯示卡可提供最高 2.9 exaFLOPS 的 FP4 或 1.4 exaFLOPS 的 FP8 運算效能,支撐著這個強大運算力的,是最高 31 TB 的 HBM4,最高 1.7 PB/s 的 HBM 頻寬、最高 260 TB/s 的垂直擴充頻寬,以及最高 43 TB/s 的橫向擴充頻寬。AMD Helios 可讓推論、分散式訓練和大規模微調工作負載維持高效率運作。
請參閱《AMD Helios 指南》,深入瞭解 AMD Instinct MI455X 顯示卡
AMD EPYC™ 9006 系列伺服器處理器
AMD EPYC™ 9006 系列伺服器處理器為 AMD Helios 機架規模平台提供運算基礎,支援協調流程、系統服務和控制工作,確保大型加速器環境能高效率運作。
這對代理式 AI 極其重要,因為多個模型、應用程式、工具和資料來源需要持續互動。
AMD Pensando™ Vulcano 800 AI NIC
AMD Pensando™ Vulcano 800 AI NIC 提供以業界通用標準為基礎的乙太網路橫向擴充連線能力,可將工作負載延伸至多個機架與更大型的 AI 叢集。在機架內,UALink over Ethernet 將 72 個顯示卡連接成一個統一的垂直擴充加速器區塊,而 Vulcano NIC 則可將此效能延伸至機架之外,讓客戶能打造更大型且可重複部署的 AI 基礎架構,無需另外重新設計網路。
當推論與訓練工作負載轉為分散式運作後,網路可能成為影響系統實際效能的重大瓶頸。AMD Pensando AI NIC 可協助資料在基礎架構間高效率傳輸,降低通訊成為效能限制因素的風險。
閱讀 AMD Pensando Vulcano 800 AI NIC 相關部落格文章
AMD Pensando™ Salina DPU
AMD Pensando™ Salina DPU 可將部分網路、儲存和安全性服務從主控處理器卸載下來,讓處理器能將更多運算資源用於其主責的協調流程工作上,同時還能提供專用層,將 AI 基礎架構連接至前端網路與服務。這種解構化方法可將軟體定義網路功能移至專用資料處理硬體,進而提升基礎架構效率。
這種角色分工對 AI 雲端與多租戶基礎架構尤其重要,因為營運人員需要管理共用資源、基礎架構服務和工作負載隔離,又要避免將所有工作都交由處理器負責。
閱讀 AMD Pensando Salina DPU 相關部落格文章
採用業界開放標準打造的架構
AMD Helios 機架規模平台的最後一項建構元素,是運算系統周邊的實體架構。此架構符合多項開放標準,並以可重複配置的四顯示卡運算托盤為基礎,為超大規模部署提供符合標準的基礎,同時滿足企業客戶對可維修性的需求。這些標準包括:
Open rack-wide/符合 OCP 標準的機架設計
UALoE 垂直擴充
符合 UEC 標準的乙太網路橫向擴充
AMD ROCm 軟體
遵循這些標準,有助於將高密度 AI 運算轉變成可部署的實際執行基礎架構;電源、散熱、維護和元件更換等要素皆從機架層級納入考量,讓客戶揮別一次性的系統安裝方式,改用可重複部署且高效率的架構設計。
閱讀部落格文章,瞭解 AMD Helios 機架規模平台如何推動開放且可擴充的 AI 基礎架構
AMD Helios 解決大規模 AI 的各項挑戰
AMD Helios 機架規模平台的價值,從客戶對大規模 AI 基礎架構所追求的成果來看再清楚不過:更高的機架層級 AI 工廠輸出量、開放式的機架至叢集擴充能力、更高的基礎架構生產力、可維修性、安全性,以及在部署從單一系統邁向生產平台時所帶來的更佳成本效益。
挑戰:如果 AI 機架中的顯示卡經常需要等待指令,或等待其他系統元件跟上,就無法充分發揮其價值。規模擴大後,顯示卡之間或機架其他部分之間的通訊延遲將成為瓶頸,拖慢整個叢集的輸出。
解決方案:AMD Helios 機架規模平台中的每個元件都經過設計,以降低系統某一部分拖累其他部分的風險,讓客戶能充分運用更多加速器處理能力,並從已投入的基礎架構中獲得更多實際輸出。
挑戰:原本能在小規模下順利運作的 AI 環境,可能會隨著客戶增加更多機架而變得越來越複雜。如果缺乏明確的擴充規劃,每次擴展都可能帶來新的網路、整合和營運挑戰。
解決方案:AMD Helios 機架規模平台將整個機架視為統合單一的系統,而非彼此獨立的元件,協助加速器處理能力持續有效發揮。其雙層網路設計在機架內採用 UALoE 垂直擴充連線,讓 72 個顯示卡如同單一高速加速器區塊般運作;同時透過以通用標準為基礎的乙太網路橫向擴充,將此效能延伸至多個機架,協助客戶從已投入的基礎架構中獲得更多實際的 AI 工廠輸出。
挑戰:高密度 AI 基礎架構無法像傳統伺服器一樣直接安裝即可。從一開始就必須將電源、散熱、網路、元件更換和實體可維修性的需求納入考量。每次部署都從零開始設計,會增加大量時間成本、複雜性和安裝風險。
解決方案:AMD Helios 機架規模平台由 18 個可重複配置的四顯示卡運算托盤構成,並符合 Meta Open Rack Wide 標準。電源、散熱和可維修性等要素,都已納入機架架構設計中,而不是選定元件後還要留給客戶自行解決。
這表示客戶可獲得標準化的部署與擴充基礎,減少所需的客製化系統設計,讓基礎架構更容易規劃、部署,並可隨時間持續擴充。
挑戰:AI 基礎架構成本高昂,但並非每個模型、工作負載或客戶需求,都需要全天候使用顯示卡或機架的全部資源。如果缺乏彈性的資源配置,寶貴的系統處理能力可能閒置,或無法獲得有效分配。
解決方案:硬體式顯示卡分割可讓營運人員將資源劃分為較小的運算區段,依不同工作負載與使用者需求加以配置。超大規模業者和 AI 雲端供應商因而能在推論、訓練與微調工作負載之間,彈性配置並隔離顯示卡資源,以此提升使用率、支援多租戶環境,並確保 AI 基礎架構能隨工作負載從單一機架擴充至大型分散式叢集時,高效率地因應需求。
AMD Helios 機架規模平台也為整個機架提供以硬體為根基的安全性,包括裝置層級身分與證明機制、執行階段證明機制、記憶體加密、通用連結加密、安全的多顯示卡擴充,以及適用於多租戶配置的分割功能。這些功能的目的,都在於協助客戶保護 AI 資料與模型智慧財產,同時支援共用與多租戶基礎架構。
AMD ROCm™ 軟體基礎
硬體決定了客戶 AI 基礎架構的潛在效能。軟體則決定客戶能否輕鬆且有效地發揮這些效能。
AMD ROCm 軟體為 AMD Helios 機架規模平台提供開放式軟體基礎,讓客戶具備所需工具,可在機架規模與叢集環境中部署、管理及最佳化 AI 推論、訓練和微調。
AMD ROCm 軟體可搭配廣泛使用的 AI 模型、架構和執行環境,包括 PyTorch、TensorFlow、JAX、ONNX Runtime、vLLM、SGLang 和 Triton。近期生態系統發展成果包括釋出超過 200 萬個模型,並進一步擴大對開放原始碼 AI 架構與推論引擎的支援。
AMD ROCm 是以開放標準為核心開發而成,讓客戶在所使用的模型、工具和環境方面保有更大的彈性。其軟體最佳化也能在工作負載持續成長時,協助執行 AI 工作負載的硬體持續有效發揮效能,支援大規模環境下的高效率運作。
對合作夥伴而言,這表示與客戶的討論不應只聚焦於硬體本身。合作夥伴可協助客戶評估其偏好的模型與架構是否有支援、移轉現有應用程式可能需要進行哪些工作、團隊是否具備必要技能,以及平台如何與既有的協調流程、監控和管理工具連接。
AMD Helios 機架規模平台適用對象
AMD Helios 機架規模平台專為大規模營運 AI 基礎架構的組織所設計。雖然營運模式各有不同,但尋求機架規模 AI 的客戶都有共同需求,包括高密度運算、可擴充網路、可靠的營運能力,以及對自身基礎架構的掌控。
大規模 AI 營運業者:超大規模業者、AI 雲端/NeoCloud 供應商、尖端模型開發人員
這類客戶正在打造 AI 工廠,以支援全球規模的服務,以及 AI 領域快速成長的需求。其工作負載包括全機群推論、分散式訓練和大規模微調,時常會跨越大型叢集運作,而非侷限於單一機架。
對這類客戶而言,主要關注重點包括輸出密度、使用率、頻寬,以及從單一機架擴充至大型叢集時的成本效益;在大規模環境中,他們也十分重視可重複部署性與可維修性。
AMD Helios 機架規模平台結合高密度的機架層級運算與記憶體容量、開放式橫向擴充網路,以及可重複部署的架構,專為這類部署情境所設計。
主權 AI 與企業 AI 部署
主權 AI 與資料中心平台團隊可讓政府、公共機構和重要產業掌握自身 AI 基礎架構的控制權。這類部署要求系統在地端或國境內運作,同時滿足以安全性、控管和長期處理能力為核心的需求。
AMD Helios 機架規模平台整合運算、記憶體、開放式網路、安全性、ROCm 軟體和具可維修性的機架設計,協助這類客戶維持控制權、彈性和長期的基礎架構選擇空間。
OEM/ODM 與生態系統建置商
這類客戶在 AI 基礎架構市場中扮演的角色不同:他們需要將先進的機架規模設計轉化為可反覆建置、驗證、交付、維修和支援客戶的系統。
對這類客戶而言,AMD Helios 機架規模平台的價值不只在於機架本身的效能,更在於 AMD 將運算、網路、軟體、安全性、電源、散熱和實體可維修性整合成一套完整的 AI 工廠藍圖這件事情上。
這為 OEM/ODM 合作夥伴與生態系統建置商提供更明確的基礎,可運用 AMD 技術開發差異化系統。AMD Helios 有助於減少所需的客製化整合工作,同時仍保留充足空間,讓合作夥伴能在系統設計、驗證、部署和客戶專屬實作方面持續創新。
合作夥伴可提供的開放式 AI 工廠平台
AI 基礎架構的採購討論已不再侷限於逐一選購元件。客戶現在尋求的是囊括運算、記憶體、網路、軟體、安全性和實體機架架構的完整解決方案,以及這些元件如何作為一個整全協調的系統共同運作,協助他們從 AI 實驗階段邁向大規模實際執行。
AMD Helios 機架規模平台為合作夥伴提供可向客戶介紹的完整解決方案;透過整合這些強大技術、開放式機架標準與 AMD ROCm 軟體,為重視 AI 輸出、可擴充性與營運信心的客戶提供卓越的解決方案。
若要深入瞭解 AMD Helios 機架規模平台,以及您可以如何支援剛進入 AI 領域或希望進一步發展的客戶,請洽詢您的 AMD 代表,或造訪 AMD.com 取得更多資訊。
AMD Arena
透過針對 AMD 各類產品的訓練資源,培養關於 AMD AI 解決方案、AMD EPYC™ 伺服器處理器、AMD Instinct™ 顯示卡和其他產品的專業知識。
訂閱
取得關於最新 AMD 產品、訓練資源和「專家面對面」網路研討會的每月最新消息。
相關文章
尾註
- 根據 AMD 效能實驗室於 2026 年 6 月進行的計算,比較 AMD Helios 機架規模解決方案使用峰值矩陣 FP16、BF16、INT8、Open Compute Project MXFP6、MXFP8、FP8 和 MXFP4 資料類型時的峰值理論精度效能,以及 NVIDIA Vera Rubin NVL72 機架使用密集 NVFP4 與 FP8/FP6 資料類型時的效能。系統製造商可能改變配置,而產生不同的結果。MI400-005。
- 根據 AMD 效能實驗室於 2026 年 6 月進行的計算,比較 AMD Helios 機架規模解決方案使用峰值矩陣 FP16、BF16、INT8、Open Compute Project MXFP6、MXFP8、FP8 和 MXFP4 資料類型時的峰值理論精度效能,以及 NVIDIA Vera Rubin NVL72 機架使用密集 NVFP4 與 FP8/FP6 資料類型時的效能。系統製造商可能改變配置,而產生不同的結果。MI400-005。