什么是 AI 网络?

AI 网络是为大规模 AI 提供支撑的高性能架构。它连接 GPU、加速器和系统,提供训练、推理和智能体 AI 工作负载在增长过程中所需的吞吐能力、同步性和性能一致性。

它举足轻重

随着 AI 工作负载规模和复杂性的不断提升,系统性能越来越依赖于网络。从前端网络到纵向扩展和横向扩展架构,每一层都影响着 AI 基础设施的运行效率。

大规模 AI 的性能取决于网络

Data center with glowing lights

性能优异

前沿 AI 模型需要一个能够以高带宽和低延迟将数据传输到加速器并在加速器之间传输的网络,以保持加速器的充分利用。

Abstract teal and orange light streaks overlaid with scrolling source code, suggesting data flow or AI processing

可编程

AI 协议发展迅速。可编程网络能够保持基础设施的灵活性,使其随时应对未来挑战。

Teal and orange network lines and nodes connected across a dark textured surface, symbolizing data connectivity

开放

开放系统将选择权交到组织手中,从而能够灵活构建基础设施,并在不同规模上实现更好的成本优化。

可扩展 AI 网络的 7 项架构设计原则

了解战略性网络选择如何影响 AI 的整体性能、基础设施成本、可扩展性和未来增长。

needed

前端:为 AI 工厂提供数据

前端网络连接用户和数据到 AI 基础设施,以实现大规模的可靠数据摄取。

在为 AI 工作负载保留计算资源的同时,可同时加速存储、安全和网络服务。

关键技术:

规模化:统一的 AI 系统

UALoE 和紧密耦合的软件开辟了可以纵向扩展的范围,其中许多 GPU 可以作为一个计算资源运行,同时高带宽网络支持张量并行、大型模型以及弹性、高效的工作负载。

它可以整合 72 个 GPU,并提供具有备用连接、自动故障响应和工作负载隔离的弹性网络以持续运行。

关键技术:

横向扩展与跨域:分布式 AI

横向扩展网络能够提供带宽、效率和弹性,以在多个数据中心之间大规模地进行训练和推理。

我们可以加速跨机架、数据中心和区域的分布式 AI,实现可预测的性能、快速恢复和更低的基础设施成本。

关键技术:

应用场景

模型训练

挑战

训练数十亿参数模型需要数十万个 GPU 之间进行精确、低延迟的同步。

解决方案

超低延迟的集体通信可加快训练速度并提高集群利用率。

Radiating teal and orange light streaks with sparkling particles, suggesting high-speed data transfer

分布式推理

挑战

实时响应数百万次推理请求,需要在不可预测的需求下保持稳定、低延迟的性能。

解决方案

低延迟、确定性网络能够保持推理响应的快速性和一致性,即使需求波动也是如此。

Abstract background

智能体 AI

挑战

智能体 AI 工作负载依赖于多个复杂服务之间的持续协调。

解决方案

加速的基础设施服务能够实现高效执行、低延迟通信,并提高大规模 AI 工作流程的利用率。

Teal and orange particle mesh forming a flowing wave over blurred cityscape lights

纵向扩展系统对生产型 AI 的重要性

随着 AI 规模超越单个节点,纵向扩展网络将多个 GPU 连接成一个计算资源,并提供高可用性,从而帮助在网络故障期间保持训练和智能体工作负载的运行。

这些 AI 工作负载通常对重启很敏感,因此扩展网络必须具备足够的韧性,以便在网络中断后快速恢复,而不会使正在进行的作业停滞或丢失累积的进度。

AMD AI 网络产品组合

AMD 提供广泛的 AI 网络技术组合,旨在满足现代 AI 基础设施的性能、可扩展性和韧性需求。

AMD AI 网络软件栈

Helios 管理软件拥有多代成熟的软件栈,可通过健康监测、遥测、RAS 和自动化,实现架构的智能化、健康运营。

Abstract blue digital circuit pathway with glowing light source and pixel-like data patterns

开放的生态和标准

AMD 与领先的行业组织合作,共同推动 AI 的发展。

Open Compute Project logo
Ultra Accelerator Link logo
Ultra Ethernet Consortium logo

FAQ

常见问题

AI 网络针对跨越了纵向和横向扩展架构运行的同步的、大容量 GPU 通信进行了优化,并提供传统工作负载不需要的额外智能拥塞管理、快速恢复和深度可观测性。

AI 网卡增加了可编程逻辑和专用加速功能,可优化 GPU 到 GPU 的通信,有助于降低延迟,并提高大规模可靠性。

纵向扩展(Scale-up)是指在节点或紧密耦合的系统内最大化性能。横向扩展(Scale-out)涉及在数据中心内的集群和 Pod 之间进行扩展。跨地域扩展(Scale-across)则实现了跨多个地理位置分散的数据中心的统一管理和编排,使它们能够作为一个统一的系统运行。

AMD 基于成熟的以太网标准,并保持广泛的合作伙伴生态系统关系,以帮助确保互操作性,同时允许供应商灵活调整。

UALoE(以太网超高速加速器链路)用于机架级系统,构建可扩展的网络架构。它使多个 GPU 能够作为一个统一的系统运行。UALoE 在紧耦合 GPU 性能的同时,保持了生产级 AI 所需的可靠性和开放性,所有这一切都基于以太网标准,为未来发展提供了灵活性。

AMD 软件栈包括用于自动化 Day 0/Day 2 操作的 AMD 集群控制器 (ACC)、用于 GPU 分区和隔离的 AMD Fabric 管理器 (AFM) 以及用于可靠交换操作的 AMD Fabric 操作系统 (AFOS)。它们协同工作,减少了手动配置,使大规模 AI 集群能够在生产环境中切实可行地运行。

联系我们

寻找 AMD 销售代表。