从创新到部署就绪:AMD 借助 MRC 大规模推进 AI 网络技术
May 06, 2026
驱动全球先进 AI 模型(如 ChatGPT 背后的模型)究竟需要什么?
从最基础的层面看,全球先进 AI 模型需要海量 GPU 算力高度同步协同工作。随着 AI 系统规模扩大,能否高效整合算力越来越取决于连接计算单元的网络。成千上万块 GPU 必须持续保持同步、交换数据,并在遭遇不可避免的中断后迅速恢复。
在庞大规模下,网络可直接决定算力的有效利用率。
今天,AMD 联合 OpenAI、Microsoft 及其他行业领军企业共同宣布,将多路径可靠连接 (Multipath Reliable Connection, MRC) 技术贡献给开放计算项目 (OCP),使这一全新网络协议能够惠及更广泛的生态系统。AMD 长期投身于开放生态系统建设,持续推动以太网适应 AI 时代需求;如今,AMD 正助力 AI 网络转型,为需要构建 AI 基础设施的客户打造一套开源、可编程、可直接投入商用的基础平台。
对于 AMD 乃至整个行业而言,MRC 的意义远不止于提供一种面向前沿超级计算机的全新网络协议。它是迈向更加开放、可编程、高韧性 AI 基础设施构建平台的重要一步。随着云计算、企业、科研及主权 AI 领域的客户开始构建更大规模的 AI 集群,行业不仅需要网络在理想条件下速度足够快,更需要其在真实部署场景中做到性能稳定、自适应调节,同时易于运维。
MRC:专为大规模 AI 网络而生
MRC 专为传统单路径网络模型难以应对的大规模 AI 训练环境而设计。这些工作负载需要持续不间断的高速通信,即便是短暂的中断也可能影响系统整体进度。
MRC 并非沿单一路径发送流量,而是同时将数据包分散到多条路径上。这可有效减少拥塞热点,并限制可能拖慢同步训练速度的延迟波动。当故障不可避免地发生时,MRC 能够迅速调整,允许流量近乎实时地重新路由,从而避免传统网络恢复机制所带来的延迟。
从实际应用来看,MRC 有助于将网络转化为 AI 基础设施的“减震器”。MRC 不会让每一次网络波动事件都演变为业务中断,它能让网络在本地快速自适应调整,保障工作负载持续正常运行。这一点至关重要,因为在大规模 AI 场景下,性能不能仅以峰值带宽来衡量。真正的衡量标准是在实际运行环境中,加速器有多少有效算力能够持续稳定输出。
AMD 的贡献:从研发到部署
AMD 在塑造当今 MRC 运作方式的过程中发挥了开创性作用。AMD 联合主导了定义新一代 AI 网络的 MRC 规范的编写工作,并贡献了先进的拥塞控制技术,以帮助改善实际运行环境下的网络性能。
更重要的是,AMD 的贡献并非仅停留在理论层面。AMD 已联合头部云服务提供商,在测试集群中规模化实施和部署 MRC 技术及自家网络技术。此次验证表明,MRC 设计可反映网络在持续运行的 AI 工作负载下的实际表现。
“随着 GPU 和 CPU 持续推动算力发展,AI 规模化应用的真正瓶颈在于网络。AMD 联合 OpenAI 和 Microsoft 推出 MRC,标志着行业迈出了重要一步。AMD 提供的可编程能力使我们能够迅速将此类创新转化为大规模场景下的实际性能优势,因为在大规模场景中,稳定的吞吐量和高韧性远比理论峰值带宽更为重要。”
- AMD NTSG 事业部工程副总裁 Krishna Doddapaneni
可编程性依然是 AMD 的核心差异化优势。作为极少数能够将全面软硬件可编程性与成熟部署经验相结合的网络解决方案提供商之一,AMD 使得网络能够随着工作负载的演变而灵活适配。 在 MRC 规范正式制定之前,AMD 就已制定改进版 RoCEv2 传输协议的预标准实现方案,该方案最终演变成了如今的 MRC 标准。这得益于 AMD Pensando Pollara 400 AI NIC 的开放可编程性,正是这种可编程性为早期验证提供了极大的灵活性。AMD 是首批也是极少数在 400G NIC 上实现 MRC 的公司之一,能够加速向同样支持 MRC 传输协议的 AMD Pensando“Vulcano”800G AI NIC 进行无缝过渡。
从参与制定规范、贡献关键技术到完成测试部署,AMD 成为在实际 AI 基础设施中部署 MRC 的先行者。
重新定义 AI 基础设施的性能标准
对于大规模 AI 而言,性能由系统在真实条件下的表现决定,而非仅仅取决于峰值带宽。在保持 GPU 同步且高效产出的同时,实现稳定的吞吐量、有效的拥塞处理以及快速的故障恢复,才是驱动大规模 AI 网络的最优解。MRC 能够提升模型效率,并有助于使跨大型 GPU 集群连接大规模 AI 训练节点的网络协议变得高度可靠。
通过参与 MRC 规范制定、开发与技术贡献,AMD 与 OpenAI、Broadcom、Intel 及 Microsoft 通力合作,推动 AI 网络从理论概念落地为生产就绪的实用基础设施。