Infraestrutura de IA: um desafio no nível do sistema

O crescimento da IA generativa e agêntica está aumentando a demanda na infraestrutura das empresas. A inferência é agora a principal carga de trabalho de IA, o treinamento continua a crescer e a IA agêntica está gerando um nível incrível de computação em inferência, orquestração e movimentação de dados. Essas cargas de trabalho dependem de mais do que apenas o desempenho do acelerador, por mais importante que ele seja.

As CPUs devem orquestrar as cargas de trabalho, as redes devem manter os dados em movimento, o software deve sustentar a utilização e o próprio rack físico deve dar suporte a tudo, desde energia e resfriamento até disponibilidade e facilidade de manutenção em escala.

À medida que as implantações dos clientes crescem, eles não avaliam mais as GPUs individualmente, mas sim o desempenho e a eficiência do sistema como um todo. Como os clientes se concentram cada vez mais em fluxos de trabalho com múltiplos agentes, essa exigência só aumenta, pois modelos, aplicações, ferramentas e dados interconectados devem operar juntos de maneira integrada.

À medida que seus clientes expandem a infraestrutura de IA, projetos fragmentados, componente por componente, podem gerar mais complexidade em termos de integração, redes e operações. A plataforma em escala de rack AMD Helios™ ajuda a resolver ao integrar computação, memória, redes, software, energia, resfriamento, segurança e facilidade de manutenção em uma única plataforma em escala de rack projetada de forma conjunta.

Plataforma projetada especificamente para IA em hiperescala e soberana

A plataforma em escala de rack AMD Helios é totalmente integrada e projetada especificamente para inferência em alto volume, treinamento de modelos de ponta, ajuste fino, IA soberana e IA agêntica. Combinando o poder das GPUs AMD Instinct™, das CPUs de servidor AMD EPYC™, das NICs e DPUs AMD Pensando™, do software AMD ROCm™ e de uma arquitetura de rack aberta alinhada aos padrões Meta Open Rack, a plataforma em escala de rack AMD Helios oferece uma solução completa para clientes que desejam iniciar ou atualizar sua infraestrutura de IA.

Muito além de um simples rack para utilização de GPUs, trata-se de um projeto completo desenvolvido para oferecer computação líder do setor,1 permitindo que os clientes transformem projetos em hiperescala em plataformas de produção prontas para implantação.

Em vez de terem que configurar a solução ideal para os clientes e as necessidades de IA deles, os parceiros podem usar a plataforma em escala de rack AMD Helios para combinar as melhores tecnologias que a AMD oferece e criar um sistema coeso, otimizado para inferência de alto volume, treinamento de modelos de ponta, ajuste fino e IA agêntica em implantações de infraestrutura de IA em hiperescala, nuvem de IA/NeoCloud, IA soberana e grandes empresas.

Os componentes fundamentais por trás da plataforma em escala de rack AMD Helios

A plataforma em escala de rack AMD Helios reúne vários componentes fundamentais da AMD que abordam diferentes aspectos do desafio da infraestrutura de servidores, desde computação acelerada e orquestração de cargas de trabalho até movimentação de dados, descarregamento da infraestrutura e facilidade de manutenção física.

O valor da plataforma em escala de rack AMD Helios não provém de um componente isoladamente. Ao usar cada uma dessas tecnologias e projetá-las para operar como um único sistema coordenado, com o suporte do software AMD ROCm, os clientes obtêm acesso fácil a um desempenho incrível em IA, capaz de se expandir conforme suas necessidades.

GPUs AMD Instinct™ MI455X

Para clientes que estão construindo uma infraestrutura de IA em grande escala, o valor da plataforma em escala de rack AMD Helios vem do que ela pode oferecer como um sistema completo e replicável: 72 GPUs AMD Instinct™ MI455X oferecem até 2,9 exaFLOPS de computação FP4 ou 1,4 exaFLOPS de computação FP8, apoiadas por até 31 TB de HBM4, com até 1,7 PB/s de largura de banda HBM, até 260 TB/s de largura de banda de expansão vertical e até 43 TB/s de largura de banda de expansão horizontal. A AMD Helios mantém as cargas de trabalho de inferência, treinamento distribuído e ajuste fino em grande escala em operação de forma eficiente.

Saiba mais sobre as GPUs AMD Instinct MI455X em nosso guia da AMD Helios 

CPUs de servidor AMD EPYC™ Série 9006

As CPUs de servidor AMD EPYC™ Série 9006 fornecem a base de processamento para a plataforma em escala de rack AMD Helios, oferecendo suporte à orquestração, aos serviços do sistema e às tarefas de controle necessárias para manter um grande ambiente de aceleradores operando com eficiência.

Isso é fundamental para a IA agêntica, na qual vários modelos, aplicações, ferramentas e fontes de dados interagem continuamente.

Leia mais sobre as CPUs de servidor AMD EPYC Série 9006 

NICs de IA AMD Pensando™ Vulcano 800

As NICs de IA AMD Pensando™ Vulcano 800 fornecem a conectividade Ethernet baseada em padrões para expansão horizontal, usada para estender as cargas de trabalho entre racks e clusters de IA maiores. Dentro do rack, o UALink sobre Ethernet conecta as 72 GPUs como um domínio de aceleradores coordenado para expansão vertical, enquanto as NICs Vulcano levam esse desempenho para além do rack, permitindo que os clientes construam uma infraestrutura de IA maior e repetível sem precisar tratar a rede como um projeto separado.

À medida que as cargas de trabalho de inferência e treinamento se tornam distribuídas, a rede pode se tornar um gargalo significativo para o desempenho efetivo do sistema. As NICs de IA AMD Pensando ajudam a manter os dados fluindo de forma eficiente pela infraestrutura, reduzindo o risco de que a comunicação se torne um fator limitante.

Leia o blog sobre as NICs de IA AMD Pensando Vulcano 800 

DPUs AMD Pensando™ Salina

As DPUs AMD Pensando™ Salina transferem determinados serviços de rede, armazenamento e segurança das CPUs de host, liberando mais capacidade das CPUs para sua função principal de orquestração e, ao mesmo tempo, fornecendo uma camada dedicada para conectar a infraestrutura de IA às redes e aos serviços de front-end. Essa abordagem desagregada pode melhorar a eficiência da infraestrutura ao transferir funções de rede definidas por software para um hardware dedicado de processamento de dados.

Essa separação de funções é particularmente importante para infraestruturas de IA em nuvem e multilocatárias, nas quais os operadores precisam gerenciar recursos compartilhados, serviços de infraestrutura e isolamento de cargas de trabalho sem sobrecarregar as CPUs com todas as tarefas.

Leia o blog sobre as DPUs AMD Pensando Salina 

Uma arquitetura baseada em padrões abertos do setor

O último elemento fundamental da plataforma em escala de rack AMD Helios é a arquitetura física que envolve a computação. Ela está alinhada a uma série de padrões abertos e construída em torno de bandejas de computação repetíveis com quatro GPUs, garantindo uma base compatível com padrões para implantação em hiperescala e facilidade de manutenção para clientes corporativos. Esses padrões incluem:

Projeto de rack aberto em toda a extensão/alinhado ao OCP

Escalabilidade vertical UALoE

Expansão horizontal de Ethernet alinhada ao UEC

Software AMD ROCm

A adesão a esses padrões ajuda a transformar a computação de IA de alta densidade em uma infraestrutura de produção implantável. Elementos como energia, resfriamento, manutenção e substituição de componentes são considerados no nível do rack, o que significa que os clientes podem ir além de instalações pontuais de sistemas e adotar um projeto de arquitetura repetível e eficiente.

Leia o blog sobre como a plataforma em escala de rack AMD Helios promove uma infraestrutura de IA aberta e dimensionável 

O AMD Helios resolve os desafios da IA em escala

O valor da plataforma em escala de rack AMD Helios é melhor compreendido pelos resultados que os clientes precisam obter de uma infraestrutura de IA em escala: maior rendimento da fábrica de IA em nível de rack, expansão aberta de rack para cluster, infraestrutura produtiva, facilidade de manutenção, segurança e melhor relação custo-benefício à medida que as implantações passam de sistemas individuais para plataformas de produção.

O desafio: as GPUs em um rack de IA não conseguem oferecer todo o seu valor se estiverem constantemente aguardando instruções ou que outros elementos do sistema acompanhem seu ritmo. Em grande escala, esse nível de comunicação lenta entre as GPUs ou outras partes do rack se torna um gargalo que retarda toda a produção do cluster.

A solução: cada componente da plataforma em escala de rack AMD Helios foi projetado para reduzir o risco de uma parte do sistema atrasar outra, permitindo que os clientes mantenham uma maior parte da capacidade de seus aceleradores produtiva e obtenham mais resultados úteis da infraestrutura na qual investiram.

O desafio: um ambiente de IA que funciona em pequena escala tende a se tornar cada vez mais complexo à medida que os clientes adicionam mais racks. Sem um plano de escalabilidade claro em vigor, toda expansão corre o risco de trazer novos desafios de rede, integração e operação.

A solução: a plataforma em escala de rack AMD Helios ajuda a manter a capacidade do acelerador produtiva, tratando o rack como um sistema coordenado, em vez de um conjunto de componentes isolados. Seu projeto de rede de duas camadas utiliza conectividade UALoE de expansão vertical dentro do rack para manter as 72 GPUs funcionando como um único domínio de acelerador de alta velocidade, enquanto a expansão horizontal baseada em Ethernet, de acordo com padrões, leva esse desempenho para todos os racks, ajudando os clientes a obter mais resultados úteis de IA da infraestrutura na qual investiram.

O desafio: uma infraestrutura de IA de alta densidade não pode ser simplesmente instalada como servidores convencionais. As demandas de energia, resfriamento, rede, substituição de componentes e facilidade de manutenção física precisam ser consideradas desde o início. Projetar cada implantação do zero acarreta um investimento de tempo valioso, além de aumentar a complexidade e o risco da instalação.

A solução: a plataforma em escala de rack AMD Helios é construída em torno de 18 bandejas de computação repetíveis com quatro GPUs e está alinhada aos padrões Meta Open Rack Wide. Elementos como energia, resfriamento e facilidade de manutenção são considerados como parte da arquitetura do rack, em vez de serem deixados para o cliente resolver após a escolha dos componentes.

Isso significa que os clientes ganham uma base padronizada para seus planos de implantação e expansão, reduzindo a quantidade de projeto de sistema personalizado necessária e tornando a infraestrutura mais fácil de planejar, implantar e expandir ao longo do tempo.

O desafio: a infraestrutura de IA é cara, mas nem todo modelo, carga de trabalho ou necessidade do cliente exige acesso a uma GPU inteira ou a um rack o tempo todo. Sem uma alocação flexível, a valiosa capacidade do sistema pode ficar ociosa ou ser atribuída de forma ineficiente.

A solução: o particionamento de GPUs baseado em hardware permite que os operadores dividam os recursos disponíveis em segmentos de computação menores, que podem ser adaptados a diferentes cargas de trabalho e usuários, oferecendo a hiperescaladores e provedores de nuvem de IA a capacidade de alocar e isolar recursos de GPU de maneira flexível entre cargas de trabalho de inferência, treinamento e ajuste fino, melhorando a utilização, oferecendo suporte a ambientes multilocatários e garantindo que sua infraestrutura de IA possa se adaptar com eficiência à medida que as cargas de trabalho passam de um único rack para grandes clusters distribuídos.

A plataforma em escala de rack AMD Helios também oferece segurança baseada em hardware em todo o rack, incluindo identidade e atestado no nível do dispositivo, atestado em tempo de execução, criptografia de memória, criptografia universal de links, escalonamento seguro com múltiplas GPUs e particionamento para configurações multilocatárias. Cada um desses recursos foi projetado para ajudar os clientes a proteger seus dados de IA e a propriedade intelectual dos modelos, ao mesmo tempo que oferece suporte à infraestrutura compartilhada e multilocatária.

A base do software AMD ROCm™

O hardware define o desempenho potencial da infraestrutura de IA de um cliente. O software é o que determina com que facilidade e eficácia os clientes podem colocar esse desempenho em prática.

O software AMD ROCm fornece a base de software aberta para a plataforma em escala de rack AMD Helios, oferecendo aos clientes as ferramentas necessárias para implantar, gerenciar e otimizar a inferência, o treinamento e o ajuste fino de IA em ambientes em escala de rack e em cluster.

O software AMD ROCm é compatível com modelos, frameworks e ambientes de execução de IA amplamente usados, incluindo PyTorch, TensorFlow, JAX, ONNX Runtime, vLLM, SGLang e Triton. Os avanços recentes no ecossistema incluem acesso a mais de 2 milhões de modelos e suporte ampliado a frameworks de IA de código aberto e mecanismos de inferência.

Como o AMD ROCm é desenvolvido com base em padrões abertos, os clientes podem manter maior flexibilidade em relação aos modelos, ferramentas e ambientes que usam, enquanto as otimizações de software ajudam o hardware que executa cargas de trabalho de IA a permanecer produtivo à medida que essas cargas crescem, garantindo umdesempenho eficiente em escala.

Para os parceiros, isso significa que o diálogo com o cliente deve ir além do próprio hardware. Os parceiros podem ajudar os clientes a avaliar se os modelos e frameworks preferidos deles são compatíveis, quais trabalhos podem ser necessários para migrar as aplicações existentes, se as equipes têm as habilidades necessárias e como a plataforma se conectará às suas ferramentas de orquestração, monitoramento e gerenciamento.

Para quem foi criada a plataforma em escala de rack AMD Helios

A plataforma em escala de rack AMD Helios foi projetada para organizações que operam infraestrutura de IA em escala. Embora suas operações sejam diferentes, os clientes que buscam IA em escala de rack compartilham a necessidade de computação de alta densidade, redes dimensionáveis e operações confiáveis, além de controle sobre sua infraestrutura.

Operadores de IA em grande escala: Hiperescaladores, provedores de nuvem de IA/NeoCloud e desenvolvedores de modelos de ponta

Esse público-alvo está construindo fábricas de IA para oferecer suporte a serviços em escala global e à demanda em rápido crescimento no setor de IA. Suas cargas de trabalho incluem inferência em escala de frota, treinamento distribuído e ajuste fino em grande escala, frequentemente operando em clusters extensos, em vez de racks isolados.

Para esses clientes, as principais preocupações giram em torno da densidade de saída, da utilização, da largura de banda e da viabilidade econômica de expandir a infraestrutura de racks individuais para clusters maiores. Eles valorizam a capacidade de repetição e a facilidade de manutenção em grandes frotas.

A plataforma em escala de rack AMD Helios combina alta capacidade de processamento e memória em nível de rack com redes abertas para expansão horizontal e uma arquitetura replicável, projetada especificamente para esse tipo de implantação.

Implantações de IA soberana e corporativa

As equipes de IA soberana e da plataforma de data center proporcionam a governos, instituições públicas e setores essenciais o controle sobre sua infraestrutura de IA. Esse tipo de implantação exige que as operações sejam realizadas no local ou dentro das fronteiras nacionais, ao mesmo tempo que atendem a requisitos centrados em segurança, governança e capacidade de longo prazo.

A plataforma em escala de rack AMD Helios combina computação, memória, rede aberta, segurança, software ROCm e um design de rack de fácil manutenção para ajudar esse tipo de cliente a preservar o controle, a flexibilidade e a liberdade de escolha da infraestrutura a longo prazo.

Fabricantes OEM/ODM e desenvolvedores de ecossistemas

Esses clientes desempenham um papel diferente no mercado de infraestrutura de IA: precisam transformar projetos avançados em escala de rack em sistemas que possam ser construídos, validados, entregues, mantidos e suportados de forma consistente para os clientes.

Para esse público, o valor da plataforma em escala de rack AMD Helios não é simplesmente o desempenho do próprio rack, mas o fato de que a AMD combinou computação, redes, software, segurança, energia, resfriamento e facilidade de manutenção física em um projeto completo de fábrica de IA.

Isso oferece aos parceiros OEM/ODM e aos desenvolvedores de ecossistemas uma base mais clara para o desenvolvimento de sistemas diferenciados com base na tecnologia da AMD. A AMD Helios ajuda a reduzir a quantidade de integração personalizada necessária, ao mesmo tempo que dá aos parceiros espaço para inovar no que diz respeito ao projeto de sistemas, à validação, à implantação e à implementação específica para cada cliente.

O que os parceiros da Open AI Factory Platform podem oferecer

A infraestrutura de IA já foi além das discussões sobre a compra de componentes isolados. Os clientes agora buscam soluções que abranjam todo o espectro de computação, memória, rede, software, segurança e arquitetura física de rack, e que mostrem como tudo isso funciona como um único sistema coordenado, para ajudá-los a ir além da fase experimental de IA e chegar à produção em escala.

A plataforma em escala de rack AMD Helios oferece aos parceiros uma solução completa para apresentar aos clientes. Ao combinar cada uma dessas poderosas tecnologias com padrões abertos de rack e o software AMD ROCm, ela representa uma solução incrível para qualquer cliente focado em resultados de IA, escalabilidade e confiança operacional.

Para saber mais sobre a plataforma em escala de rack AMD Helios e como você pode apoiar seus clientes que estão entrando ou avançando no setor de IA, fale com seu representante da AMD ou acesse amd.com para obter mais informações.

Acesse a página inicial da plataforma em escala de rack AMD Helios

AMD Arena


Desenvolva competências com os treinamentos sobre soluções de IA da AMD, CPUs de servidor AMD EPYC™, GPUs AMD Instinct™ e muitos outros produtos do portfólio AMD.

Artigos relacionados

Notas de rodapé
  1. Com base em cálculos realizados pelos Laboratórios de desempenho AMD em junho de 2026 para determinar o desempenho teórico máximo em precisão da solução em escala de rack AMD Helios utilizando os tipos de dados de matriz de pico FP16, BF16, INT8, MXFP6, MXFP8, FP8 e MXFP4 do Open Compute Project, em comparação com o rack NVIDIA Vera Rubin NVL72 utilizando os tipos de dados densos NVFP4 e FP8/FP6. Os fabricantes de sistemas podem variar as configurações, gerando resultados diferentes. MI400-005.