AMD Primus
大规模训练 AI 模型——无需复杂操作
Primus 将训练设置、优化的 Transformer 和生产运维整合到一个模块化的体验中。借助内置的可复现工作流程、内核加速、集群验证和监控功能,您可以快速从首次运行过渡到大规模训练。
借助 Primus,团队可以:
更快地监控分布式作业并调试问题
使用单个 CLI 启动可复现的训练实验
使用优化的算子加速 Transformer 工作负载
在进行大规模训练之前验证集群
Primus 平台
Primus 提供模块化组件,支持从实验性设置到集群规模的操作的整个训练生命周期。
框架
支持主流框架
密集型 LLM、MoE、扩散、多模态、RnR
- Megatron-LM
- Pytorch TouchTitan
- JAX MaxText
AMD Primus
AMD ROCm 上的训练工作流
大规模训练的参考架构
- 配置
- 验证
- 加速
- 观察
- 优化
AI 开发者
构建 AI 就用
AMD ROCm 核心 SDK
代码库 | 编译器 | 工具 | 运行时
性能基准测试
Primus 的基准测试表明,为何客户可以利用 AMD Instinct GPU 的处理能力进行快速模型开发,从单节点扩展到多节点集群,同时最大限度地利用 GPU,缩短训练时间,并提高各种模型架构的训练效率。
ROCm.AI 与 ROCm 7 对比
训练加速也在不断提升
DeepSeek-V3-16B
DeepSeek-V2-Lite
Qwen3-30B-A3B
版本更迭:性能更强
2.01x
2.54x
2.76x
平均
2.4 倍
模型间代际性能提升
并行化与调度
流水线并行、分片数据并行、梯度全归约重叠
内存管理
激活检查点、FP8 混合精度、融合梯度累积
优化的内核
融合 FlashAttention(前向 + 反向),分组 GEMM • 融合的优化器步骤
经大规模测试,在生产中得到验证
了解 Zyphra 如何在全栈 AMD 平台上从零开始构建 ZAYA1。此次合作展示了一个极具竞争力的模型,该模型在超过 1000 个 GPU 上训练,并在端到端 Instinct 技术栈的生产环境中实现了收敛。
开始使用 Primus
从模型选择到大规模训练的精彩历程
在 Instinct 上体验经过生产环境测试的参考架构,从零开始构建前沿 AI 模型!
1
在 Primus 生态系统中使用 Primus LM。
2
快来 GitHub 查看最新的预发布功能和源代码吧!
资源