O que é a rede de IA?

A rede de IA é a estrutura de alto desempenho que impulsiona a IA em escala. Ela conecta GPUs, aceleradores e sistemas, proporcionando a produtividade, a sincronização e a consistência de desempenho que as cargas de trabalho de treinamento, inferência e IA agêntica exigem à medida que crescem.

A realidade crítica

À medida que as cargas de trabalho de IA crescem em escala e complexidade, o desempenho do sistema se torna cada vez mais dependente das redes. Da rede de front-end às malhas de expansão vertical e de expansão, cada camada determina o quanto a infraestrutura de IA opera com eficiência.

O desempenho em escala começa com redes

Data center with glowing lights

Potente

Modelos de IA de ponta exigem uma rede que mova dados para os aceleradores e entre eles com alta largura de banda e baixa latência para mantê-los totalmente utilizados.

Abstract teal and orange light streaks overlaid with scrolling source code, suggesting data flow or AI processing

Programável

Os protocolos de IA evoluem rapidamente. Uma rede programável mantém a infraestrutura flexível e pronta para o que vem a seguir.

Teal and orange network lines and nodes connected across a dark textured surface, symbolizing data connectivity

Aberto

Sistemas abertos colocam a escolha nas mãos das organizações, permitindo a criação de infraestruturas flexíveis e melhor otimização de custos em qualquer escala.

Os 7 princípios arquitetônicos das redes para IA escaláveis

Descubra como escolhas estratégicas de rede impactam o desempenho geral da IA, os custos de infraestrutura, a escalabilidade e o crescimento futuro.

necessário

Front-End: alimenta a fábrica de IA

A rede front-end conecta usuários e dados à infraestrutura de IA para uma ingestão confiável em escala.

Fornece aceleração simultânea de serviços de armazenamento, segurança e rede, preservando recursos de computação para cargas de trabalho de IA.

Principal tecnologia:

Expansão vertical: sistemas de IA unificados

O UALoE e o software estreitamente integrado habilitam um domínio de expansão vertical no qual várias GPUs atuam como um único recurso de computação, com redes de alta largura de banda que dão suporte ao paralelismo tensorial, a modelos de grande escala e a cargas de trabalho resilientes e eficientes.

Unifica 72 GPUs e fornece rede resiliente com conexões alternativas, resposta automatizada a falhas e isolamento de cargas de trabalho para operação contínua.

Principal tecnologia:

Expansão e distribuição: IA distribuída

A rede de expansão oferece a largura de banda, a eficiência e a resiliência para que o treinamento e a inferência em grande escala sejam distribuídos entre vários data centers.

Acelera a IA distribuída entre racks, data centers e regiões com desempenho previsível, recuperação rápida e menor custo de infraestrutura.

Principal tecnologia:

Casos de uso

Treinamento de modelos

Desafio

O treinamento de modelos com bilhões de parâmetros exige sincronização precisa e de baixa latência entre centenas de milhares de GPUs.

Solução

Comunicações coletivas de latência ultrabaixa aceleram o treinamento e melhoram a utilização do cluster.

Radiating teal and orange light streaks with sparkling particles, suggesting high-speed data transfer

Inferência distribuída

Desafio

Responder a milhões de solicitações de inferência em tempo real exige desempenho consistente e de baixa latência sob demanda imprevisível.

Solução

Redes determinísticas de baixa latência mantêm as respostas de inferência rápidas e consistentes, mesmo quando a demanda flutua.

Abstract background

IA agêntica

Desafio

Cargas de trabalho de IA agêntica dependem de coordenação contínua entre vários serviços complexos.

Solução

Serviços de infraestrutura acelerados permitem execução eficiente, comunicação de baixa latência e melhor utilização em fluxos de trabalho de IA em larga escala.

Teal and orange particle mesh forming a flowing wave over blurred cityscape lights

Importância dos sistemas de expansão vertical para IA de produção

À medida que a IA ultrapassa os limites dos nós individuais, a rede de expansão vertical conecta várias GPUs em um único recurso de computação e oferece a alta disponibilidade que ajuda a manter o treinamento e as cargas de trabalho de IA agêntica em execução mesmo diante de falhas de rede.

Essas cargas de trabalho de IA geralmente são sensíveis a reinicializações, portanto, a rede de expansão vertical deve oferecer a resiliência necessária para recuperar rapidamente a rede após interrupções, sem paralisar os trabalhos ativos nem perder o progresso acumulado.

Portfólio da AMD para redes de IA

A AMD oferece um amplo portfólio de tecnologias de redes para IA, criado para atender às demandas de desempenho, escalabilidade e resiliência da infraestrutura moderna de IA.

Pilha de software AMD para redes de IA

Com uma pilha de software madura e de múltiplas gerações, o software de gerenciamento Helios habilita operações inteligentes de integridade da malha por meio de monitoramento de integridade, telemetria, RAS e automação.

Abstract blue digital circuit pathway with glowing light source and pixel-like data patterns

DPUs AMD Pensando™

Serviços de rede, segurança e armazenamento são executados simultaneamente para permitir desempenho determinístico e uso eficiente de recursos em implantações de nuvem e IA.

AMD AI NICs™

NICs para IA de alto desempenho projetadas para aceleração coletiva e infraestrutura de IA dimensionável em escala.

AMD Helios Rackscale

Solução em escala de rack AMD Helios: desempenho líder de rack para IA em hiperescala1

O design da solução em escala de rack AMD Helios é uma infraestrutura de IA totalmente integrada, que combina as mais recentes GPUs AMD Instinct™, CPUs de servidor AMD EPYC™ e a rede AMD Pensando™, e é projetada com base em padrões abertos do setor, para viabilizar inferência em larga escala, treinamento de modelos de ponta e ajuste fino.

Ecossistema aberto e padrões

A AMD colabora com as principais organizações do setor para ajudar a avançar a IA.

Open Compute Project logo
Ultra Accelerator Link logo
Ultra Ethernet Consortium logo

Perguntas frequentes

Perguntas frequentes

A rede de IA é otimizada para a comunicação sincronizada e de alto volume entre GPUs que ocorre em arquiteturas de expansão vertical e expansão, além de oferecer gerenciamento inteligente adicional de congestionamento, recuperação rápida e observabilidade profunda, recursos que as cargas de trabalho tradicionais não exigem.

Uma NIC para IA adiciona lógica programável e aceleração dedicada que otimiza a comunicação entre GPUs, ajuda a reduzir a latência e aumenta a confiabilidade em escala.

A expansão vertical refere-se à maximização do desempenho dentro de nós ou sistemas estreitamente integrados. A expansão envolve a ampliação entre clusters e pods dentro de um data center. A expansão entre sistemas permite o gerenciamento e a orquestração unificados em vários data centers geograficamente distribuídos, fazendo com que operem como um único sistema unificado.

A AMD se baseia em padrões Ethernet comprovados e mantém amplas relações com ecossistemas de parceiros para ajudar a garantir a interoperabilidade, permitindo flexibilidade de fornecedores.

O UALoE (Ultra Accelerator Link over Ethernet) é usado em sistemas em escala de rack para malhas de rede expandidas. Ele permite que muitas GPUs operem como um único sistema unificado. Oferece o desempenho de GPUs fortemente acopladas, mantendo a confiabilidade e a abertura que a IA em produção exige, tudo baseado em padrões Ethernet para flexibilidade preparada para o futuro.

A pilha de software da AMD inclui o AMD Cluster Controller (ACC) para operações automatizadas do Dia 0/Dia 2, o AMD Fabric Manager (AFM) para particionamento e isolamento de GPUs e o AMD Fabric Operating System (AFOS) para operações confiáveis dos switches. Juntas, elas ajudam a eliminar a configuração manual e tornam clusters de IA em larga escala práticos para operação em produção.

Fale conosco

Entre em contato com um representante de vendas da AMD.

Notas de rodapé
  1. Cálculos realizados pelos laboratórios de desempenho AMD em junho de 2025, com base nas especificações projetadas de capacidade/largura de banda de memória e de largura de banda de expansão vertical/expansão do rack de IA "Helios" com AMD Instinct™ MI455X com 72 GPUs em comparação com o rack "Oberon" com NVIDIA "Vera Rubin" com 72 GPUs anunciado publicamente. Os fabricantes de servidores podem variar as configurações, gerando resultados diferentes. MI350-045A
    Cálculos dos laboratórios de desempenho AMD em setembro de 2025, com base nos tipos de dados FP8/FP4 e nas especificações projetadas do rack de IA AMD Instinct™ MI455X com 72 GPUs "Helios" versus especificações anunciadas publicamente do rack de IA NVIDIA "Vera Rubin" com 72 GPUs "Oberon". Os resultados reais baseados na produção de silício podem variar. Os fabricantes de servidores podem variar as configurações, gerando resultados diferentes. MI350-046B