什么是 AI 网络?
AI 网络是支持大规模 AI 部署的高性能互连架构。它将 GPU、加速器和系统互连,带来出色的吞吐能力、同步能力以及稳定性能,可满足随着训练、推理和智能体 AI 工作负载不断增长的需求。
大规模场景下的卓越性能始于网络
高性能
前沿 AI 模型需要高带宽、低延迟的网络,以便能够将数据快速传输到加速器并在加速器之间高效传输数据,同时确保加速器得到充分利用。
可编程
AI 协议迭代速度很快。可编程网络可确保基础设施保持出色的灵活性,为应对未来的业务需求做好准备。
开放
开放式系统赋予企业自主选择权,助力构建灵活的基础设施并在各个规模层面实现更出色的成本优化。
可扩展 AI 网络的七大架构原则
了解战略性网络选择如何影响整体 AI 性能、基础设施成本、可扩展性以及未来业务发展。
前端网络:为 AI 工厂添能助力
前端网络将用户和数据接入 AI 基础设施,确保在大规模场景下实现可靠的数据摄取。
支持存储、安全、网络服务并行加速,同时预留算力资源供 AI 工作负载使用。
关键技术:
纵向扩展网络:一体化 AI 系统
UALoE 和紧密耦合的软件相结合,助力构建纵向扩展计算域,其中多个 GPU 如同单一计算资源协同工作,而富有弹性的高带宽网络为张量并行和大型模型提供支持并助力高效处理工作负载。
整合多达 72 个 GPU,并提供支持备用连接、自动故障响应和工作负载隔离的高弹性网络,以确保持续运行。
关键技术:
横向扩展和跨区域扩展网络:分布式 AI
横向扩展网络具备出色带宽、效率和弹性,可支持超大规模训练与推理工作负载跨多个数据中心分布式部署。
跨机架、跨数据中心、跨地域加速分布式 AI 工作负载,实现稳定性能、快速恢复,同时降低基础设施成本。
关键技术:
应用场景
- 模型训练
- 分布式推理
- 智能体 AI
模型训练
挑战
要训练数十亿参数规模的模型,需要在数十万个 GPU 之间实现精准、低延迟的同步。
解决方案
通过超低延迟集合通信,加快训练速度并提高集群利用率。
分布式推理
挑战
要实时响应数百万个推理请求,需要在不可预测的流量需求下保持稳定的低延迟性能。
解决方案
依托低延迟、确定性网络,可保持快速、稳定的推理响应性能,即使在需求波动时也是如此。
智能体 AI
挑战
处理智能体 AI 工作负载时,需要多个复杂服务之间持续保持协调。
解决方案
依托加速的基础设施服务,可实现高效执行、低延迟通信,并优化大规模 AI 工作流程中的资源利用率。
纵向扩展系统对于生产级 AI 的重要价值
随着 AI 部署规模超出单个节点,纵向扩展网络通过将多个 GPU 整合为统一计算资源并提供高可用性保障,助力确保训练和智能体工作负载在发生网络故障时仍可持续运行。
这些 AI 工作负载如果重启通常会产生高昂代价,因此纵向扩展网络必须富有弹性,能够在中断后快速恢复,而不造成正在运行的作业停滞或丢失累积的进度。
AMD AI 网络解决方案组合
AMD 提供阵容庞大的 AI 网络技术解决方案,旨在满足现代 AI 基础设施的性能、可扩展性和弹性需求。
AMD AI 网络软件栈
依托经过多代演进的成熟软件栈,Helios 管理软件可通过运行状况监控、遥测,RAS 和自动化技术,实现智能化网络运行状况管理。
开放生态系统和标准
AMD 携手行业领军企业,共同推进 AI 向前发展。
备受关注的 AMD AI 网络技术
常见问题解答
常见问题解答
AI 网络经过优化,可支持纵向扩展和横向扩展架构下的同步、高容量 GPU 通信,同时具备传统工作负载不需要的智能拥塞管理、快速恢复和深度可观测能力。
AI NIC 具备可编程逻辑和专用加速能力,可优化 GPU 间通信、降低延迟和提高大规模部署的可靠性。
纵向扩展是指在单个节点或紧密耦合的系统内充分释放性能。横向扩展是指在一个数据中心内跨集群和 Pod 进行扩展。跨区域扩展是指对分布在不同地理位置的多个数据中心进行统一管理和编排,使它们作为一个统一系统协同运行。
AMD 基于经过验证的以太网标准构建解决方案,并与众多生态系统合作伙伴建立合作关系,从而保障互操作性并保留厂商灵活性。
UALoE(Ultra Accelerator Link over Ethernet,基于以太网的超加速器链路)用于机架级系统,支持纵向扩展网络架构。它使多个 GPU 作为一个统一系统高效运行。UALoE 完全基于以太网标准构建,不仅可通过紧密整合多个 GPU 实现出色性能,还可保持生产级 AI 所需的可靠性和开放性,能够以超高灵活性满足未来需求。
AMD 软件栈包含 AMD Cluster Controller (ACC)、AMD Fabric Manager (AFM) 和 AMD Fabric Operating System (AFOS);其中 ACC 支持 Day 0/Day 2 自动化运维,AFM 支持 GPU 分区和隔离,而 AFOS 可保障交换机可靠运行。这些软件协同发力,可消除手动配置工作,并推动大规模 AI 集群在生产环境中落地应用。
联系我们
联系 AMD 销售代表。
附注
- 服务器制造商可能会采用不同的配置而得到不同的结果。MI350-045A
实际结果可能因所用芯片而有所不同。服务器制造商可能会采用不同的配置而得到不同的结果。MI350-046B
- 服务器制造商可能会采用不同的配置而得到不同的结果。MI350-045A
实际结果可能因所用芯片而有所不同。服务器制造商可能会采用不同的配置而得到不同的结果。MI350-046B