Visão geral

Otimizado para cargas de trabalho de IA

Algumas equipes precisam treinar ou ajustar um modelo; outras precisam colocar um modelo aberto existente em produção. O ROCm possibilita ambos os caminhos em GPUs AMD, com fluxos de trabalho para treinamento distribuído e software para otimizar, fornecer e operar inferência de IA em escala.

AI Inference

Inferência de IA de produção com ROCm

Implante os principais modelos abertos em GPUs AMD usando uma pilha de inferência de código totalmente aberto. Comece a trabalhar com contêineres pré-criados e suporte a estrutura de upstream.

Escolha seu mecanismo

Comece a executar modelos abertos

O AMD ROCm fornece uma pilha de inferência completa com suporte a estruturas upstream, contêineres vLLM ou SGLang e muito mais, para que sua equipe possa começar com um software de inferência estabelecido antes de integrar um modelo à sua aplicação.

Redução na ocupação de espaço

Melhore a memória e a eficiência do fornecimento

O ROCm combina pacotes de modelos quantizados com execução nativa de baixa precisão e kernels de caminho crítico otimizados para transformadores, reduzindo o esforço de ajuste e maximizando a taxa de transferência e a eficiência na execução em ambientes reais.

Atenda à crescente demanda

Dimensione inferência entre GPUs e nós

Quando um modelo ou o volume de solicitações ultrapassar a capacidade de um servidor, distribua a execução entre GPUs AMD Instinct™. As implantações suportadas podem separar o preenchimento prévio e a decodificação para que as equipes consigam alocar recursos para cada estágio.

Controle de frota

Opere a inferência no Kubernetes

O ROCm integra-se ao Kubernetes por meio do AMD GPU Operator, da telemetria integrada e de uma arquitetura modular de drivers, oferecendo suporte à implantação automatizada, à observabilidade e ao gerenciamento previsível do ciclo de vida em ambientes seguros e isolados da Internet.

Treinamento de IA

Treinamento de IA de ponta a ponta em grande escala em GPUs AMD

De fluxos de trabalho unificados à confiabilidade em escala de cluster, o Primus simplifica e acelera o treinamento de grandes modelos.

Flexibilidade da estrutura

Inicie sessões de treinamento que você pode repetir

Comece a treinar em GPUs AMD Instinct™ com fluxos de trabalho unificados por meio das receitas do AMD Primus para Megatron-LM, PyTorch TorchTitan ou JAX MaxText. Use uma única CLI e configurações reutilizáveis para executar experimentos novamente e comparar as alterações.

Mantenha as GPUs ocupadas

Resolva os gargalos de treinamento de transformadores

O Primus melhora a eficiência do treinamento e a utilização das GPUs com kernels otimizados e aceleração com reconhecimento das características de comunicação. As equipes podem usar esses recursos por meio da pilha completa do Primus ou conectar o Primus Turbo em ambientes de treinamento personalizados.

Mantenha os trabalhos em andamento

Treinamento distribuído dimensionável

Quando um modelo ultrapassa a capacidade de um único servidor, o Primus ajuda a distribuir o treinamento entre GPUs e nós AMD Instinct™. O Primus-SaFE usa posicionamento com reconhecimento de topologia e novas tentativas automáticas para ajudar trabalhos de longa execução a se recuperarem de interrupções à medida que os clusters crescem.

Verifique e monitore

Operações de treinamento prontas para empresas

O Primus ajuda as equipes a avaliar a integridade do nó antes de iniciar grandes trabalhos de treinamento. Durante o treinamento, sua telemetria e seus painéis fornecem visibilidade do desempenho e da integridade do cluster, ajudando as equipes a identificar problemas e solucioná-los mais rapidamente.

Últimas notícias

Leia sobre os últimos avanços no desenvolvimento de IA usando o ROCm.

Hardware compatível

Recursos para desenvolvedores

ROCm Developer screen shot

Boletim informativo do ROCm

Receba as últimas novidades sobre o ROCm.

Notas de rodapé

©2024 Advanced Micro Devices, Inc. Todos os direitos reservados. AMD, o logotipo de seta AMD, AMD ROCm, AMD Instintic, EPYC, Radeon Instinct e suas combinações são marcas registradas da Advanced Micro Devices, Inc. PyTorch é uma marca comercial ou marca registrada da PyTorch. Outros nomes de produtos usados nesta publicação são apenas para fins de identificação e podem ser marcas comerciais de suas respectivas empresas.

  1. Para obter uma lista completa das peças Radeon compatíveis com o ROCm, acesse https://rocm.docs.amd.com/en/latest/reference/gpu-arch-specs.html