¿Qué es la red de IA?

La red de IA es el entramado de alto rendimiento que impulsa la IA a escala. Conecta GPU, aceleradores y sistemas, lo que proporciona el rendimiento, la sincronización y la consistencia que exigen las cargas de trabajo de entrenamiento, inferencia e IA automatizada a medida que crecen.

La realidad crítica

A medida que las cargas de trabajo de IA crecen en escala y complejidad, el rendimiento del sistema depende cada vez más de la red. Desde las redes de front-end hasta las estructuras de escalabilidad vertical y escalabilidad horizontal, cada capa determina la eficiencia con la que se desempeña la infraestructura de IA.

El rendimiento a escala comienza con la red

Data center with glowing lights

Genera rendimiento

Los modelos de IA de vanguardia requieren una red que mueva datos hacia los aceleradores y entre ellos con el alto ancho de banda y la baja latencia necesarios para aprovecharlos al máximo.

Abstract teal and orange light streaks overlaid with scrolling source code, suggesting data flow or AI processing

Programable

Los protocolos de IA avanzan rápido. Una red programable mantiene la infraestructura flexible y lista para lo que venga después.

Teal and orange network lines and nodes connected across a dark textured surface, symbolizing data connectivity

Abierto

Los sistemas abiertos ponen el poder de elección en manos de las organizaciones, lo que permite crear infraestructuras flexibles y lograr una mejor optimización de costos a cualquier escala.

Los 7 principios arquitectónicos de las redes de IA escalables

Descubre cómo las decisiones estratégicas de red impactan en el rendimiento general de la IA, los costos de infraestructura, la escalabilidad y el crecimiento futuro.

necesario

Front-end: Alimenta la fábrica de IA

Las redes front-end conectan a los usuarios y los datos con la infraestructura de IA para lograr una ingesta confiable a escala.

Ofrecen una aceleración simultánea de los servicios de almacenamiento, seguridad y redes, al tiempo que preservan los recursos de procesamiento para las cargas de trabajo de IA.

Tecnología clave:

Escalabilidad vertical: Sistemas unificados de IA

UALoE y el software fuertemente acoplado permiten un dominio de escalabilidad vertical donde múltiples GPU actúan como un único recurso de procesamiento, con redes de alto ancho de banda que admiten el paralelismo de tensores, modelos de gran tamaño y cargas de trabajo eficientes y de alta resiliencia.

Unifica 72 GPU y proporciona una red resiliente con conexiones alternativas, respuesta automatizada ante fallas y aislamiento de cargas de trabajo para un funcionamiento continuo.

Tecnología clave:

Escalabilidad horizontal: IA distribuida

Las redes de escalabilidad horizontal ofrecen el ancho de banda, la eficiencia y la resiliencia necesarios para distribuir el entrenamiento y la inferencia a gran escala en múltiples centros de datos.

Aceleran la IA distribuida en racks, centros de datos y regiones con un rendimiento predecible, una recuperación rápida y un menor costo de infraestructura.

Tecnología clave:

Casos de uso

Entrenamiento de modelo

Desafío

El entrenamiento de modelos con miles de millones de parámetros exige una sincronización precisa y de baja latencia a través de cientos de miles de GPU.

Solución

Las comunicaciones colectivas de ultrabaja latencia aceleran el entrenamiento y mejoran la utilización de los clústeres.

Radiating teal and orange light streaks with sparkling particles, suggesting high-speed data transfer

Inferencia distribuida

Desafío

Responder a millones de solicitudes de inferencia en tiempo real exige un rendimiento constante y de baja latencia ante una demanda impredecible.

Solución

Las redes deterministas de baja latencia mantienen las respuestas de inferencia de forma rápida y constante, incluso cuando la demanda fluctúa.

Abstract background

IA agéntica

Desafío

Las cargas de trabajo de IA agéntica dependen de una coordinación continua entre múltiples servicios complejos.

Solución

Los servicios de infraestructura acelerada permiten una ejecución eficiente, comunicaciones de baja latencia y una mejor utilización en flujos de trabajo de IA a gran escala.

Teal and orange particle mesh forming a flowing wave over blurred cityscape lights

Importancia de los sistemas de escalabilidad vertical para la IA en producción

A medida que la IA se expande más allá de los nodos individuales, la red escalable conecta varias GPU en un único recurso de procesamiento y proporciona la alta disponibilidad que ayuda a mantener en funcionamiento las cargas de trabajo de entrenamiento y de agentes a pesar de los fallos de red.

Estas cargas de trabajo de IA suelen ser sensibles a los reinicios, por lo que la escalabilidad de la red debe proporcionar la resiliencia necesaria para recuperar rápidamente la red ante interrupciones sin paralizar los trabajos activos ni perder el progreso acumulado.

Portafolio de AMD para redes de IA

AMD ofrece un amplio portafolio de tecnologías de redes de IA diseñadas para responder a las exigencias de rendimiento, escalabilidad y resiliencia de la infraestructura de IA moderna.

Pila de software AMD AI Networking

Con una pila de software madura y multigeneracional, el software de gestión Helios permite operaciones inteligentes de salud de la estructura mediante la monitorización del estado, la telemetría, RAS y la automatización.

Abstract blue digital circuit pathway with glowing light source and pixel-like data patterns

DPU AMD Pensando™

Los servicios de redes, seguridad y almacenamiento se ejecutan de manera simultánea para permitir un rendimiento determinista y un uso eficiente de los recursos en implementaciones en la nube y de IA.

AMD Helios Rackscale

Solución a escala de rack AMD Helios: Rendimiento del rack líder en la industria para IA a hiperescala1

El diseño de la solución de escala de rack AMD Helios es una infraestructura de IA totalmente integrada que combina las últimas GPU AMD Instinct™, CPU para servidores AMD EPYC™ y redes AMD Pensando™, desarrollada a partir de estándares abiertos de la industria para permitir la inferencia a gran escala, el entrenamiento de modelos de vanguardia y el ajuste fino.

Ecosistema y estándares abiertos

AMD colabora con las principales organizaciones de la industria para impulsar el avance de la IA.

Open Compute Project logo
Ultra Accelerator Link logo
Ultra Ethernet Consortium logo

Preguntas frecuentes

Preguntas frecuentes

Las redes de IA están optimizadas para la comunicación sincronizada y de alto volumen entre GPU que se ejecuta en arquitecturas de escalabilidad vertical y horizontal, y ofrecen gestión inteligente de la congestión adicional, recuperación rápida y observabilidad profunda que las cargas de trabajo tradicionales no requieren.

Una AI NIC añade lógica programable y aceleración dedicada que optimiza la comunicación de GPU a GPU, ayuda a reducir la latencia y mejora la confiabilidad a escala.

La escalabilidad vertical se refiere a maximizar el rendimiento dentro de los nodos o sistemas fuertemente acoplados. La escalabilidad horizontal implica la expansión a través de clústeres y módulos dentro de un centro de datos. La escalabilidad entre centros de datos permite la gestión y orquestación unificadas en múltiples centros de datos dispersos geográficamente para que funcionen como un solo sistema unificado.

AMD se basa en estándares Ethernet comprobados y mantiene relaciones sólidas con un amplio ecosistema de socios para garantizar la interoperabilidad, al tiempo que brinda flexibilidad a la hora de elegir proveedores.

UALoE (Ultra Accelerator Link over Ethernet) se utiliza en sistemas a escala de rack para la ampliación de la arquitectura de redes. Permite que múltiples GPU funcionen como un único sistema unificado. Ofrece el rendimiento de las GPU acopladas firmemente, a la vez que mantiene la confiabilidad y apertura de la IA de producción, todo ello basado en los estándares Ethernet para una flexibilidad preparada para el futuro.

La pila de software de AMD incluye el controlador de clústeres de AMD (ACC) para operaciones automatizadas de Día 0 y Día 2, el Administrador de entramado de AMD (AFM) para la partición y el aislamiento de GPU, y el sistema operativo del entramado de AMD (AFOS) para un funcionamiento confiable de los conmutadores. En conjunto, ayudan a eliminar la configuración manual y hacen que la operación de clústeres de IA a gran escala sea viable en producción.

Comunícate con nosotros

Comunícate con un representante de ventas de AMD.

Notas al pie
  1. Cálculos realizados por los laboratorios de rendimiento de AMD en junio del 2025, basados en la capacidad de memoria/ancho de banda proyectado y las especificaciones de ancho de banda de escalabilidad horizontal/vertical del AMD Instinct™ MI455X 72xGPU “Helios” AI Rack frente al NVIDIA “Vera Rubin” 72xGPU “Oberon” Rack anunciado públicamente. Los fabricantes de servidores pueden variar las configuraciones, lo que arroja resultados diferentes. MI350-045A
    Cálculos realizados por los laboratorios de rendimiento de AMD en septiembre del 2025, basados en los tipos de datos FP8/FP4 y las especificaciones proyectadas para el rack de IA “Helios” de 72 GPU AMD Instinct™ MI455X frente a las especificaciones anunciadas públicamente para el rack de IA “Oberon” de 72 GPU NVIDIA “Vera Rubin”. Los resultados reales basados en silicio para producción pueden variar. Los fabricantes de servidores pueden variar las configuraciones, lo que arroja resultados diferentes. MI350-046B