AMD Primus

大规模训练 AI 模型——无需复杂操作

Primus 将训练设置、优化的 Transformer 和生产运维整合到一个模块化的体验中。借助内置的可复现工作流程、内核加速、集群验证和监控功能,您可以快速从首次运行过渡到大规模训练。

借助 Primus,团队可以:
Software icon

更快地监控分布式作业并调试问题

Gear icon

使用单个 CLI 启动可复现的训练实验

Fast icon

使用优化的算子加速 Transformer 工作负载

Accomplishments icon

在进行大规模训练之前验证集群

Black fade

Primus 平台

Primus 提供模块化组件,支持从实验性设置到集群规模的操作的整个训练生命周期。

框架

支持主流框架

密集型 LLM、MoE、扩散、多模态、RnR

  • Megatron-LM
  • Pytorch TouchTitan
  • JAX MaxText

AMD Primus

AMD ROCm 上的训练工作流

大规模训练的参考架构

  • 配置
  • 验证
  • 加速
  • 观察
  • 优化

AI 开发者


none

验证 + 观察

  • Primus Tuning Agent & Primus Projection
  • Primus-Bench & Primus Preflight
  • Primus-Lens
none

生产前预训练

  • Primus-LM
  • Primus-Turbo
  • Primus-SaFE
none

生产级 RL - 即将推出

RL 工作流路径

  • OSS RL Stack
  • 支持 veRL、Miles 和 Slime
  • AMD 验证的 Docker 和上游 CI/CD

构建 AI 就用

AMD ROCm 核心 SDK

代码库 | 编译器 | 工具 | 运行时

性能基准测试

Primus 的基准测试表明,为何客户可以利用 AMD Instinct GPU 的处理能力进行快速模型开发,从单节点扩展到多节点集群,同时最大限度地利用 GPU,缩短训练时间,并提高各种模型架构的训练效率。

ROCm.AI 与 ROCm 7 对比

训练加速也在不断提升

DeepSeek-V3-16B

DeepSeek-V2-Lite

Qwen3-30B-A3B

版本更迭:性能更强
2.01x
2.54x
2.76x
平均 2.4 倍
模型间代际性能提升

并行化与调度

流水线并行、分片数据并行、梯度全归约重叠

内存管理

激活检查点、FP8 混合精度、融合梯度累积

优化的内核

融合 FlashAttention(前向 + 反向),分组 GEMM • 融合的优化器步骤

经大规模测试,在生产中得到验证

了解 Zyphra 如何在全栈 AMD 平台上从零开始构建 ZAYA1。此次合作展示了一个极具竞争力的模型,该模型在超过 1000 个 GPU 上训练,并在端到端 Instinct 技术栈的生产环境中实现了收敛。

Black fade