AMD Primus
大规模训练 AI 模型 — 无需复杂操作
Primus 将训练环境设置、优化的 Transformer 和生产级运维相整合,提供统一的模块化体验。借助内置的可复现工作流程、内核加速、集群验证和监控功能,可快速从首次运行过渡到大规模训练。
借助 Primus,团队可以:
更加高效地监控分布式作业和调试问题
使用单个 CLI 启动可复现的训练实验
使用优化的算子加速 Transformer 工作负载
在进行大规模训练之前验证集群
Primus 平台
Primus 提供模块化组件,支持从实验环境设置到集群级运行的完整训练生命周期。
框架
支持主流先进框架
- Megatron-LM
- PyTorch TorchTitan
- JAX MaxText
AMD Primus
基于 AMD ROCm 的训练工作流程
大规模训练的参考架构
- 配置
- 验证
- 加速
- 观察
- 优化
AI 开发人员
无
生产级 RL - 即将推出
RL 工作流程路径
- OSS RL 堆栈
- 支持 veRL、Miles 和 Slime
- 经 AMD 验证的 Docker 和上游 CI/CD
构建基石
AMD ROCm Core SDK
库 | 编译器 | 工具 | 运行时
性能基准测试
Primus 基准测试表明,为何客户可以利用 AMD Instinct GPU 的强大处理能力进行快速模型开发,从单节点扩展到多节点集群,同时充分提升 GPU 利用率、缩短训练时间,并提高各种模型架构的训练效率。
ROCm.AI 与 ROCm 7 对比
加速训练优化
DeepSeek-V3-16B
DeepSeek-V2-Lite
Qwen3-30B-A3B
版本更迭:性能提升
2.01 倍
2.54 倍
2.76 倍
平均
2.4 倍
跨不同模型实现代际性能提升
并行和调度
流水线并行、分片数据并行、梯度全归约重叠
内存管理
激活检查点、FP8 混合精度、融合梯度累积
优化的内核
融合 FlashAttention(前向 + 反向)、分组 GEMM • 融合的优化器步骤
经大规模测试,在生产中得到验证
了解 Zyphra 如何在全栈式 AMD 平台上从零开始构建 ZAYA1 模型。此次合作带来了一个极具竞争力的模型,该模型基于端到端 Instinct 技术栈在超过 1000 个 GPU 上完成训练,并在生产环境中实现了收敛。
开始使用 Primus
从模型选择到大规模训练的旅程
体验经过生产环境测试的参考架构,在 Instinct 上从零开始构建前沿 AI 模型!
1
在 Primus 生态系统中使用 Primus LM。
2
在 GitHub 上查看最新的预发布功能和源代码!
资源