DPUs AMD Pensando™
Serviços de rede, segurança e armazenamento são executados simultaneamente para permitir desempenho determinístico e uso eficiente de recursos em implantações de nuvem e IA.
Explore como a tecnologia de redes da AMD impulsiona o desempenho da IA
A rede de IA é a estrutura de alto desempenho que impulsiona a IA em escala. Ela conecta GPUs, aceleradores e sistemas, proporcionando a produtividade, a sincronização e a consistência de desempenho que as cargas de trabalho de treinamento, inferência e IA agêntica exigem à medida que crescem.
À medida que as cargas de trabalho de IA crescem em escala e complexidade, o desempenho do sistema se torna cada vez mais dependente das redes. Da rede de front-end às malhas de expansão vertical e de expansão, cada camada determina o quanto a infraestrutura de IA opera com eficiência.
Modelos de IA de ponta exigem uma rede que mova dados para os aceleradores e entre eles com alta largura de banda e baixa latência para mantê-los totalmente utilizados.
Os protocolos de IA evoluem rapidamente. Uma rede programável mantém a infraestrutura flexível e pronta para o que vem a seguir.
Sistemas abertos colocam a escolha nas mãos das organizações, permitindo a criação de infraestruturas flexíveis e melhor otimização de custos em qualquer escala.
Descubra como escolhas estratégicas de rede impactam o desempenho geral da IA, os custos de infraestrutura, a escalabilidade e o crescimento futuro.
A rede front-end conecta usuários e dados à infraestrutura de IA para uma ingestão confiável em escala.
Fornece aceleração simultânea de serviços de armazenamento, segurança e rede, preservando recursos de computação para cargas de trabalho de IA.
Principal tecnologia:
O UALoE e o software estreitamente integrado habilitam um domínio de expansão vertical no qual várias GPUs atuam como um único recurso de computação, com redes de alta largura de banda que dão suporte ao paralelismo tensorial, a modelos de grande escala e a cargas de trabalho resilientes e eficientes.
Unifica 72 GPUs e fornece rede resiliente com conexões alternativas, resposta automatizada a falhas e isolamento de cargas de trabalho para operação contínua.
Principal tecnologia:
A rede de expansão oferece a largura de banda, a eficiência e a resiliência para que o treinamento e a inferência em grande escala sejam distribuídos entre vários data centers.
Acelera a IA distribuída entre racks, data centers e regiões com desempenho previsível, recuperação rápida e menor custo de infraestrutura.
Principal tecnologia:
Treinamento de modelos
O treinamento de modelos com bilhões de parâmetros exige sincronização precisa e de baixa latência entre centenas de milhares de GPUs.
Comunicações coletivas de latência ultrabaixa aceleram o treinamento e melhoram a utilização do cluster.
Inferência distribuída
Responder a milhões de solicitações de inferência em tempo real exige desempenho consistente e de baixa latência sob demanda imprevisível.
Redes determinísticas de baixa latência mantêm as respostas de inferência rápidas e consistentes, mesmo quando a demanda flutua.
IA agêntica
Cargas de trabalho de IA agêntica dependem de coordenação contínua entre vários serviços complexos.
Serviços de infraestrutura acelerados permitem execução eficiente, comunicação de baixa latência e melhor utilização em fluxos de trabalho de IA em larga escala.
À medida que a IA ultrapassa os limites dos nós individuais, a rede de expansão vertical conecta várias GPUs em um único recurso de computação e oferece a alta disponibilidade que ajuda a manter o treinamento e as cargas de trabalho de IA agêntica em execução mesmo diante de falhas de rede.
Essas cargas de trabalho de IA geralmente são sensíveis a reinicializações, portanto, a rede de expansão vertical deve oferecer a resiliência necessária para recuperar rapidamente a rede após interrupções, sem paralisar os trabalhos ativos nem perder o progresso acumulado.
A AMD oferece um amplo portfólio de tecnologias de redes para IA, criado para atender às demandas de desempenho, escalabilidade e resiliência da infraestrutura moderna de IA.
Com uma pilha de software madura e de múltiplas gerações, o software de gerenciamento Helios habilita operações inteligentes de integridade da malha por meio de monitoramento de integridade, telemetria, RAS e automação.
O design da solução em escala de rack AMD Helios é uma infraestrutura de IA totalmente integrada, que combina as mais recentes GPUs AMD Instinct™, CPUs de servidor AMD EPYC™ e a rede AMD Pensando™, e é projetada com base em padrões abertos do setor, para viabilizar inferência em larga escala, treinamento de modelos de ponta e ajuste fino.
A AMD colabora com as principais organizações do setor para ajudar a avançar a IA.
Perguntas frequentes
A rede de IA é otimizada para a comunicação sincronizada e de alto volume entre GPUs que ocorre em arquiteturas de expansão vertical e expansão, além de oferecer gerenciamento inteligente adicional de congestionamento, recuperação rápida e observabilidade profunda, recursos que as cargas de trabalho tradicionais não exigem.
Uma NIC para IA adiciona lógica programável e aceleração dedicada que otimiza a comunicação entre GPUs, ajuda a reduzir a latência e aumenta a confiabilidade em escala.
A expansão vertical refere-se à maximização do desempenho dentro de nós ou sistemas estreitamente integrados. A expansão envolve a ampliação entre clusters e pods dentro de um data center. A expansão entre sistemas permite o gerenciamento e a orquestração unificados em vários data centers geograficamente distribuídos, fazendo com que operem como um único sistema unificado.
A AMD se baseia em padrões Ethernet comprovados e mantém amplas relações com ecossistemas de parceiros para ajudar a garantir a interoperabilidade, permitindo flexibilidade de fornecedores.
O UALoE (Ultra Accelerator Link over Ethernet) é usado em sistemas em escala de rack para malhas de rede expandidas. Ele permite que muitas GPUs operem como um único sistema unificado. Oferece o desempenho de GPUs fortemente acopladas, mantendo a confiabilidade e a abertura que a IA em produção exige, tudo baseado em padrões Ethernet para flexibilidade preparada para o futuro.
A pilha de software da AMD inclui o AMD Cluster Controller (ACC) para operações automatizadas do Dia 0/Dia 2, o AMD Fabric Manager (AFM) para particionamento e isolamento de GPUs e o AMD Fabric Operating System (AFOS) para operações confiáveis dos switches. Juntas, elas ajudam a eliminar a configuração manual e tornam clusters de IA em larga escala práticos para operação em produção.
Entre em contato com um representante de vendas da AMD.