为 AI 时代打造的横向扩展网络
AMD AI NIC 技术历经多代技术创新,带来高性能、可编程的开放式网络解决方案,助力超大规模数据中心与云服务提供商从容自信地扩展 AI 基础设施。
AMD Pensando Vulcano 800 AI NIC
AMD Pensando Vulcano 800 AI NIC 开创业界先河,可在单 GPU 上支持高达 2.4 Tbps 的横向扩展带宽,满足要求严苛的 AI 工作负载的高速连接需求。
提升 AI 处理性能
延长集群正常运行时间
降低资本支出
实现卓越运营
透过数据了解 AMD Pensando Vulcano 800 AI NIC 的显著优势
从大模型训练到实现部署就绪,以更快速度取得成果。
开放式系统助力实现更加经济高效、可扩展的 AI 基础设施。
详细了解 AMD Pensando Vulcano 800 AI NIC
助力打造面向 AI 工作负载的 AI 就绪型横向扩展网络
了解横向扩展网络如何提升 GPU 利用率、加速 AI 任务,并降低 AI 基础设施的扩展成本。
可编程能力带来灵活选择协议的自由
AMD AI NIC 技术基于完全可编程的 P4 引擎打造而成,支持兼容 UEC 的 RDMA 和多路径可靠连接 (MRC) 等协议以及自定义传输协议,而且其功能可随着标准发展而灵活调整并升级。
- 智能数据包喷射
- 无序数据包处理和有序消息传递
- 选择性重传
- 路径感知拥塞控制
- 快速故障检测
智能数据包喷射
借助智能数据包喷射技术,团队能够全方位优化网络性能,包括增强负载均衡能力、提高整体效率以及提升可扩展性。通过优化网络性能,可显著缩短 GPU 与 GPU 之间的通信时间,从而加快任务完成速度并提高运营效率。
无序数据包处理和有序消息传递
即使采用多路径和数据包喷射技术,仍能确保按正确顺序传递消息。此外,通过高级无序消息传递功能,可高效处理未按顺序到达的数据包,让这些数据包无需缓冲即可直接顺利存入 GPU 显存。
选择性重传
通过选择性确认 (SACK) 重传技术,可确保仅重新传输丢弃或损坏的数据包,从而显著提升网络性能。SACK 能够高效检测并重新发送丢失或损坏的数据包,优化带宽利用率,降低数据包丢失恢复期间的延迟,同时充分减少冗余数据传输,从而实现卓越效率。
路径感知拥塞控制
利用实时遥测和网络感知算法,团队能够专注于处理工作负载,而无需在网络监控上投入过多精力。借助路径感知拥塞控制功能,可显著简化网络性能管理,使团队能够快速检测和解决关键问题,同时减轻多对一流量突发 (incast) 场景所带来的影响。
快速故障检测
借助快速故障检测技术,团队能够在毫秒内精准找到问题所在,实现近乎即时的故障转移和恢复,显著减少 GPU 停机时间。提供近乎实时的延迟指标、拥塞及丢弃统计数据,提升网络可观测性。
产品系列
备受关注的 AMD AI 网络技术
合作伙伴
- OEM 和 ODM
- 基础设施解决方案
- 存储
- 交换
- 生态系统
资源
联系我们
解锁 AI 网络未来
了解 AMD Pensando Pollara 400 AI NIC 如何重塑横向扩展 AI 基础设施。
深入了解数据中心网络解决方案
探索专为现代高性能数据中心设计的全套 AMD 网络解决方案。
附注
- 基于 AMD 工程芯片建模和 AMD 合成基准测试仿真,采用 MOE_4p5T hi_sparsity_ea9 基准测试和 FP8 训练数据类型,测算仿真 LLM 系统(搭载 8000 个 AMD Instinct GPU)在配备 3 个与 2 个 AMD Pensando Vulcano NIC 的情况下完成训练任务所需的天数,以此推测速度提升效果。
测算结果基于对纯训练计算(仅解码层)的分析;评估所使用的配置:全局批量大小为 4096,序列长度为 4K,同时使用 SwiGLU 激活函数。结果不包括评估和检查点开销。假定使用 FlashAttention v3,并支持 matmul–softmax 重叠。AllReduce 与 All2All 通信开销已全部纳入计算,未通过分块式计算与通信重叠进行隐藏。梯度同步和 FSDP 权重预取在不同重叠程度下进行评估,以评估横向扩展灵敏度。结果基于理想条件测算得出,无法反映经过充分优化的产品的实际运行表现;产品正式上市后,实际效果可能存在差异。MI400-018
- PEN-022: 截至 2026 年 5 月 18 日的 AMD 评估与定价:支持 32,000 个 GPU 的网络结构成本。评估对象为作为 Helios 机架级系统一部分部署的 Vulcano NIC (VULCANO-CUSTOM-2.4T),配备 1.6T Tomahawk 6 网络交换机 (200G SerDes);对比其他 800G NIC,配备 800G Tomahawk 6 交换机 (100G SerDes)。这两种网络架构均为基于 Tomahawk 5 800G 交换机平台构建的胖树 (fat-tree) 拓扑结构,其 NIC 成本被认为大体相当。基于 Vulcano 的设计带来更加经济高效的架构,包括减少交换机数量、增加网络上每个端口的带宽以及减少收发器线缆/光模块数量,预计可节省多达 33% 的网络交换成本。
TH6-100G Serdes 胖树拓扑(其他解决方案):
交换机 (TH6C BCM78914 - 128x800G):
• 叶交换机 1,000
• 脊交换机 500
• 交换机总数 1,500
• TH6 100G 交换机单价 $79,587
• 交换机总成本 $60M
线缆/光模块:
• NIC 收发器 (800G-DR8) 64,000 @ $500
• 叶/脊收发器 (800G-DR8) 192,000 @ $500
• MPO 线缆 256,000 @ $89
• 光模块/线缆总成本 $64M
TH6-100G 网络架构总成本(交换机 + 线缆/光模块): $124M
TH6-200G Serdes 胖树拓扑(Vulcano-Custom2.4T/AMD 解决方案):
交换机 (TH6P BCM78910 - 64x1.6T):
• 叶交换机 1,000
• 脊交换机 500
• 交换机总数 1,500
• TH6 200G 交换机单价 $66,336
• 交换机总成本 $50M
线缆/光模块:
NIC 收发器 (1.6T-DR8) 32,000 @ $900 (比其他解决方案少 50%)
叶/脊收发器 (1.6T-DR8) 64,000 @ $900
MPO 线缆 128,000 @ $89 (比其他解决方案少 50%)
光模块/线缆总成本 $43M
TH6-200G 网络架构总成本(交换机 + 线缆/光模块): $93M
节省的资本支出(仅限网络架构):
节省的金额: $30.7M
节省比例: 33.1%
价格数据来源:SemiAnalysis 超大规模网络模型数据(经许可使用);完整分析报告需订阅 SemiAnalysis 方可获取。截至 2026 年 5 月 17 日的交换机定价。结果可能因系统配置而有所不同
- 服务器制造商可能会采用不同的配置而得到不同的结果。MI350-045A
实际结果可能因所用芯片而有所不同。服务器制造商可能会采用不同的配置而得到不同的结果。MI350-046B
- 基于 AMD 工程芯片建模和 AMD 合成基准测试仿真,采用 MOE_4p5T hi_sparsity_ea9 基准测试和 FP8 训练数据类型,测算仿真 LLM 系统(搭载 8000 个 AMD Instinct GPU)在配备 3 个与 2 个 AMD Pensando Vulcano NIC 的情况下完成训练任务所需的天数,以此推测速度提升效果。
测算结果基于对纯训练计算(仅解码层)的分析;评估所使用的配置:全局批量大小为 4096,序列长度为 4K,同时使用 SwiGLU 激活函数。结果不包括评估和检查点开销。假定使用 FlashAttention v3,并支持 matmul–softmax 重叠。AllReduce 与 All2All 通信开销已全部纳入计算,未通过分块式计算与通信重叠进行隐藏。梯度同步和 FSDP 权重预取在不同重叠程度下进行评估,以评估横向扩展灵敏度。结果基于理想条件测算得出,无法反映经过充分优化的产品的实际运行表现;产品正式上市后,实际效果可能存在差异。MI400-018 - PEN-022: 截至 2026 年 5 月 18 日的 AMD 评估与定价:支持 32,000 个 GPU 的网络结构成本。评估对象为作为 Helios 机架级系统一部分部署的 Vulcano NIC (VULCANO-CUSTOM-2.4T),配备 1.6T Tomahawk 6 网络交换机 (200G SerDes);对比其他 800G NIC,配备 800G Tomahawk 6 交换机 (100G SerDes)。这两种网络架构均为基于 Tomahawk 5 800G 交换机平台构建的胖树 (fat-tree) 拓扑结构,其 NIC 成本被认为大体相当。基于 Vulcano 的设计带来更加经济高效的架构,包括减少交换机数量、增加网络上每个端口的带宽以及减少收发器线缆/光模块数量,预计可节省多达 33% 的网络交换成本。
TH6-100G Serdes 胖树拓扑(其他解决方案):
交换机 (TH6C BCM78914 - 128x800G):
• 叶交换机 1,000
• 脊交换机 500
• 交换机总数 1,500
• TH6 100G 交换机单价 $79,587
• 交换机总成本 $60M
线缆/光模块:
• NIC 收发器 (800G-DR8) 64,000 @ $500
• 叶/脊收发器 (800G-DR8) 192,000 @ $500
• MPO 线缆 256,000 @ $89
• 光模块/线缆总成本 $64M
TH6-100G 网络架构总成本(交换机 + 线缆/光模块): $124M
TH6-200G Serdes 胖树拓扑(Vulcano-Custom2.4T/AMD 解决方案):
交换机 (TH6P BCM78910 - 64x1.6T):
• 叶交换机 1,000
• 脊交换机 500
• 交换机总数 1,500
• TH6 200G 交换机单价 $66,336
• 交换机总成本 $50M
线缆/光模块:
NIC 收发器 (1.6T-DR8) 32,000 @ $900 (比其他解决方案少 50%)
叶/脊收发器 (1.6T-DR8) 64,000 @ $900
MPO 线缆 128,000 @ $89 (比其他解决方案少 50%)
光模块/线缆总成本 $43M
TH6-200G 网络架构总成本(交换机 + 线缆/光模块): $93M
节省的资本支出(仅限网络架构):
节省的金额: $30.7M
节省比例: 33.1%
价格数据来源:SemiAnalysis 超大规模网络模型数据(经许可使用);完整分析报告需订阅 SemiAnalysis 方可获取。截至 2026 年 5 月 17 日的交换机定价。结果可能因系统配置而有所不同 - 服务器制造商可能会采用不同的配置而得到不同的结果。MI350-045A
实际结果可能因所用芯片而有所不同。服务器制造商可能会采用不同的配置而得到不同的结果。MI350-046B