Infraestructura de IA, un desafío a nivel de sistema

El crecimiento de la IA generativa y la IA agéntica está aumentando la demanda en toda la infraestructura empresarial; la inferencia es ahora la principal carga de trabajo de IA, el entrenamiento sigue escalando y la IA agéntica está impulsando un nivel increíble de procesamiento en cuanto a inferencia, orquestación y movimiento de datos. Estas cargas de trabajo dependen más que solo del rendimiento del acelerador, aunque es importante.

Las CPU deben organizar las cargas de trabajo, las redes deben mantener los datos en movimiento, el software debe mantener la utilización y el rack físico en sí debe admitir todo, desde la alimentación y la refrigeración hasta la disponibilidad y la facilidad de servicio a escala.

A medida que crecen las implementaciones de los clientes, ya no están evaluando las GPU individuales de forma aislada; evalúan el resultado y la eficiencia del sistema completo. A medida que los clientes se centran cada vez más en flujos de trabajo de múltiples agentes, este requisito solo aumenta debido a que los modelos, las aplicaciones, las herramientas y los datos interconectados deben funcionar en conjunto sin problemas.

A medida que tus clientes expanden su infraestructura de IA, los diseños fragmentados de componente por componente pueden crear una complejidad adicional de integración, redes y operaciones. La plataforma a escala de rack AMD Helios™ ayuda a solucionar este problema, ya que integra procesamiento, memoria, redes, software, alimentación, refrigeración, seguridad y facilidad de mantenimiento en una plataforma a escala de rack diseñada en colaboración.

Plataforma diseñada específicamente para la hiperescala y la IA soberana

La plataforma a escala de rack AMD Helios está totalmente integrada y diseñada específicamente para la inferencia de alto volumen, el entrenamiento de modelos de frontera, el ajuste fino, la IA soberana y la IA agéntica. Mediante la combinación de la potencia de las GPU AMD Instinct™, las CPU para servidores AMD EPYC™, las NIC y DPU AMD Pensando™, el software AMD ROCm™ y una arquitectura de rack abierta alineada con los estándares Meta Open Rack Wide, la plataforma a escala de rack AMD Helios ofrece una solución todo en uno para los clientes que buscan iniciar o actualizar su infraestructura de IA.

Mucho más que un simple rack para la utilización de GPU, es un plan completo diseñado para el procesamiento líder en la industria1, lo que permite a los clientes transformar diseños de hiperescala en plataformas de producción implementables.

En lugar de tener que configurar la solución óptima para los clientes y sus necesidades de IA, los socios pueden utilizar la plataforma a escala de rack AMD Helios para combinar las mejores tecnologías que ofrece AMD y producir un sistema cohesivo optimizado para la inferencia de alto volumen, el entrenamiento de modelos de frontera, el ajuste fino y la IA agéntica en implementaciones de infraestructura de IA a hiperescala, en la nube/neonube, soberana y para grandes empresas.

Los componentes básicos detrás de la plataforma a escala de rack AMD Helios

La plataforma a escala de rack AMD Helios reúne varios componentes básicos de AMD que abordan diferentes partes del desafío de infraestructura del servidor, desde el procesamiento acelerado y la organización de cargas de trabajo hasta el movimiento de datos, la descarga de infraestructura y la facilidad de servicio físico.

El valor de la plataforma a escala de rack AMD Helios no proviene de un componente por sí solo. Al utilizar cada una de estas tecnologías y diseñarlas para que funcionen como un sistema coordinado (y con el respaldo del software AMD ROCm), los clientes obtienen un fácil acceso al increíble rendimiento de la IA que puede escalar según sus necesidades.

GPU AMD Instinct™ MI455X

Para los clientes que desarrollan infraestructura de IA a gran escala, el valor de la plataforma a escala de rack AMD Helios reside en lo que puede ofrecer como un sistema completo y repetible: 72 GPU AMD Instinct™ MI455X proporcionan hasta un procesamiento 2,9 exaFLOPS de FP4 o 1,4 exaFLOPS de FP8, respaldadas por hasta 31 TB de HBM4, con un ancho de banda HBM de hasta 1,7 PB/s, un ancho de banda de escalabilidad vertical de hasta 260 TB/s y un ancho de banda de escalabilidad horizontal de hasta 43 TB/s. AMD Helios mantiene las cargas de trabajo de inferencia, entrenamiento distribuido y ajuste fino a gran escala en marcha de forma eficiente.

Obtener más información acerca de las GPU AMD Instinct MI455X en nuestra guía de AMD Helios 

CPU para servidores AMD EPYC™ Serie 9006

Las CPU para servidores AMD EPYC™ Serie 9006 proporcionan la base de procesamiento para la plataforma a escala de rack AMD Helios, ya que admiten la orquestación, los servicios del sistema y las tareas de control necesarias para mantener un gran entorno de aceleradores operando eficientemente.

Esto es vital para la IA agéntica, en la cual varios modelos, aplicaciones, herramientas y fuentes de datos interactúan continuamente.

Obtener más información acerca de las CPU para servidores AMD EPYC Serie 9006 

AI NIC AMD Pensando™ Vulcano 800

Las AI NIC AMD Pensando™ Vulcano 800 proporcionan la conectividad de escalabilidad horizontal basada en estándares Ethernet que se utiliza para extender las cargas de trabajo a través de racks y clústeres de IA más grandes. Dentro del rack, UALink a través de Ethernet conecta las 72 GPU como un dominio acelerador de escalabilidad coordinado, mientras que las NIC Vulcano llevan ese rendimiento más allá del rack para que los clientes puedan construir una infraestructura de IA más grande y repetible sin tratar la red como un rediseño aparte.

A medida que se distribuyen las cargas de trabajo de inferencia y entrenamiento, las redes pueden convertirse en un obstáculo importante para el rendimiento eficaz del sistema. Las AI NIC AMD Pensando ayudan a mantener los datos en movimiento de manera eficiente a través de la infraestructura, lo que reduce el riesgo de que la comunicación se convierta en un factor limitante.

Leer el blog sobre las AI NIC AMD Pensando Vulcano 800 

DPU AMD Pensando™ Salina

Las DPU AMD Pensando™ Salina descargan determinados servicios de red, almacenamiento y seguridad de las CPU host, lo que proporciona a estas últimas mayor capacidad para su función principal de orquestación, al tiempo que ofrece una capa dedicada para conectar la infraestructura de IA con las redes y los servicios de front-end. Este enfoque desagregado puede mejorar la eficiencia de la infraestructura al mover las funciones de red definidas por software al hardware dedicado de procesamiento de datos.

Esta separación de funciones es especialmente importante para la infraestructura en la nube y multiusuario de IA, donde los operadores necesitan gestionar recursos compartidos, servicios de infraestructura y el aislamiento de la carga de trabajo sin asignar todas las tareas a las CPU.

Leer el blog sobre las DPU AMD Pensando Salina 

Una arquitectura basada en estándares abiertos de la industria

El último componente básico de la plataforma a escala de rack AMD Helios es la arquitectura física que rodea el procesamiento; está alineada con una gama de estándares abiertos y construida en torno a bandejas de procesamiento repetibles de cuatro GPU, lo que asegura una base que respeta los estándares para la implementación de hiperescala y la facilidad de servicio para los clientes empresariales. Estos estándares incluyen:

Diseño de rack abierto de ancho completo/rack alineado con OCP

Aumento de escala de UALoE

Escalabilidad horizontal de Ether alineada con UEC

Software AMD ROCm

El cumplimiento de estos estándares ayuda a convertir el procesamiento de IA de alta densidad en una infraestructura de producción desplegable; elementos como la alimentación, la refrigeración, el mantenimiento y el reemplazo de componentes se consideran a nivel de rack, lo que significa que los clientes pueden ir más allá de las instalaciones de sistemas únicos y adoptar un diseño de arquitectura repetible y eficiente.

Leer el blog: Cómo la plataforma a escala de rack AMD Helios mejora la infraestructura de IA abierta y escalable 

AMD Helios resuelve los desafíos de la IA a escala

El valor de la plataforma a escala de rack AMD Helios se comprende mejor a través de los resultados que los clientes necesitan de la infraestructura de IA a gran escala: mayor producción de la fábrica de IA a nivel de rack, crecimiento abierto de rack a clúster, infraestructura productiva, facilidad de mantenimiento, seguridad y mejores resultados económicos a medida que las implementaciones pasan de sistemas individuales a plataformas de producción.

El desafío: las GPU en un rack de IA no pueden ofrecer todo su potencial si tienen que esperar constantemente a que las instrucciones u otros elementos del sistema se pongan al día. A gran escala, este nivel de comunicación lenta entre las GPU u otras partes del rack se convierte en un cuello de botella que ralentiza la producción total del clúster.

La solución: cada componente de la plataforma a escala de rack AMD Helios está diseñado para reducir el riesgo de que una parte del sistema frene a otra, lo que permite a los clientes mantener una mayor parte de la capacidad productiva de sus aceleradores y obtener un rendimiento más útil de la infraestructura en la que han invertido.

El desafío: es probable que un entorno de IA que funciona a pequeña escala se vuelva cada vez más complejo a medida que los clientes agregan más racks. Sin un plan de escala claro, cada expansión corre el riesgo de introducir nuevos desafíos en materia de redes, integración y operaciones.

La solución: la plataforma a escala de rack AMD Helios ayuda a mantener la capacidad del acelerador productiva al tratar el rack como un sistema coordinado en lugar de un conjunto de componentes aislados. Su diseño de red de dos capas utiliza conectividad de escalabilidad ascendente UALoE dentro del rack para mantener las 72 GPU funcionando como un único dominio acelerador de alta velocidad, mientras que la escalabilidad horizontal Ethernet basada en estándares traslada ese rendimiento a través de los racks, lo que ayuda a los clientes a obtener una producción de IA más útil de la infraestructura en la que han invertido.

El desafío: la infraestructura de IA densa no se puede instalar simplemente como servidores convencionales. Todas las demandas de potencia, refrigeración, conexión de redes, reemplazo de componentes y facilidad de servicio físico deben considerarse desde el principio. El diseño de cada implementación desde cero agrega una valiosa inversión de tiempo, complejidad y riesgo para la instalación.

La solución: la plataforma a escala de rack de AMD Helios está construida en torno a 18 bandejas de procesamiento repetibles de cuatro GPU y está alineada con los estándares Meta Open Rack Wide. Elementos como la alimentación eléctrica, la refrigeración y la facilidad de mantenimiento se consideran parte de la arquitectura del rack, en lugar de dejarse en manos del cliente para que los resuelva después de seleccionar los componentes.

Esto significa que los clientes obtienen una base estandarizada para sus planes de implementación y expansión, lo que reduce la cantidad de diseño de sistema personalizado requerido y facilita la planificación, implementación y expansión de la infraestructura con el tiempo.

El desafío: la infraestructura de IA es costosa, pero no todos los modelos, cargas de trabajo o necesidades del cliente requieren acceso a una GPU o un rack completo en todo momento del día. Sin una asignación flexible, la valiosa capacidad del sistema puede permanecer sin uso o asignarse de manera ineficiente.

La solución: la partición de GPU basada en hardware permite a los operadores dividir los recursos disponibles en segmentos de procesamiento más pequeños que pueden adaptarse a diferentes cargas de trabajo y usuarios, a fin de ofrecer a los hiperescaladores y proveedores de nube de IA la capacidad de asignar y aislar de manera flexible recursos de GPU a través de cargas de trabajo de inferencia, entrenamiento y ajuste fino, lo que mejora la utilización, respalda entornos multiinquilino y garantiza que su infraestructura de IA pueda adaptarse de manera eficiente a medida que las cargas de trabajo escalan desde racks individuales hasta grandes clústeres distribuidos.

La plataforma a escala de rack AMD Helios también ofrece seguridad basada en hardware en todo el rack, incluido identidad y certificación a nivel de dispositivo, certificación en tiempo de ejecución, cifrado de memoria, cifrado de enlace universal, escalado seguro de múltiples GPU y particionamiento para configuraciones multiusuario. Cada una de estas capacidades está diseñada para ayudar a los clientes a proteger sus datos de IA y la propiedad intelectual del modelo, al mismo tiempo que se apoya la infraestructura compartida y multiusuario.

La base del software AMD ROCm™

El hardware establece el potencial rendimiento de la infraestructura de IA de un cliente. El software es lo que determina la facilidad y efectividad con la que los clientes pueden poner en funcionamiento ese rendimiento.

El software AMD ROCm proporciona la base de software abierta para la plataforma a escala de rack AMD Helios, lo que brinda a los clientes las herramientas que necesitan para implementar, gestionar y optimizar la inferencia, el entrenamiento y el ajuste fino de la IA en entornos a escala de rack y en clústeres.

El software AMD ROCm funciona con modelos, marcos y entornos de ejecución de IA ampliamente utilizados, incluidos PyTorch, TensorFlow, JAX, ONNX Runtime, vLLM, SGLang y Triton. El progreso reciente del ecosistema incluye acceso a más de 2 millones de modelos y mayor soporte en marcos de IA de código abierto y motores de inferencia.

Debido a que AMD ROCm se basa en estándares abiertos, los clientes pueden mantener una mayor flexibilidad en los modelos, las herramientas y los entornos que utilizan, mientras que sus optimizaciones de software ayudan al hardware que ejecuta las cargas de trabajo de IA a medida que crecen las cargas de trabajo, lo que permite un rendimiento eficiente a escala.

Para los socios, esto significa que la conversación con el cliente debe extenderse más allá del propio hardware. Los socios pueden ayudar a los clientes a evaluar si sus modelos y marcos preferidos son compatibles, qué trabajo puede ser necesario para mover las aplicaciones existentes, si los equipos tienen las habilidades necesarias y cómo la plataforma se conectará con sus herramientas de organización, monitoreo y administración existentes.

Para quién está diseñada la plataforma a escala de rack AMD Helios

La plataforma a escala de rack AMD Helios está diseñada para organizaciones que operan infraestructura de IA a escala. Si bien sus operaciones difieren, todos los clientes que buscan IA a escala de rack comparten la necesidad de procesamiento de alta densidad, redes escalables y operaciones confiables, así como el control sobre su infraestructura.

Operadores de IA a gran escala: hiperescaladores, proveedores de IA en la nube/neonube, desarrolladores de modelos de frontera

Este público está construyendo fábricas de IA para apoyar los servicios a escala global y aumentar rápidamente la demanda en el espacio de la IA. Sus cargas de trabajo incluyen inferencia a escala de equipamiento, entrenamiento distribuido y perfeccionamiento a gran escala, y operan a menudo en clústeres extensos en lugar de en racks aislados.

Para este tipo de clientes, sus principales inquietudes se centran en la densidad de producción, la utilización, el ancho de banda y la rentabilidad de la escalabilidad, desde racks individuales hasta clústeres más grandes; valoran la repetibilidad y la facilidad de mantenimiento en equipamientos masivos.

La plataforma a escala de rack AMD Helios combina una densa capacidad de procesamiento y memoria a nivel de rack con una red abierta de escalabilidad horizontal y una arquitectura repetible diseñada específicamente para este tipo de implementaciones.

Implementaciones de IA soberana y empresarial

Los equipos de plataforma de IA soberana y centros de datos proporcionan a los gobiernos, las instituciones públicas y las industrias vitales el control sobre su infraestructura de IA. Este tipo de implementación requiere que las operaciones estén en las instalaciones o dentro de las fronteras nacionales, a la vez que se cumple con los requisitos centrados en la seguridad, la gobernanza y la capacidad a largo plazo.

La plataforma a escala de rack AMD Helios combina procesamiento, memoria, redes abiertas, seguridad, software ROCm y un diseño de rack de fácil mantenimiento para ayudar a este tipo de cliente a preservar el control, la flexibilidad y la posibilidad de elegir su infraestructura a largo plazo.

OEM/ODM y desarrolladores de ecosistemas

Estos clientes desempeñan un papel diferente en el mercado de la infraestructura de IA: necesitan convertir diseños avanzados a escala de rack en sistemas que puedan construirse, validarse, entregarse, recibir mantenimiento y soporte de forma repetida para los clientes.

Para este público, el valor de la plataforma a escala de rack AMD Helios no reside simplemente en el rendimiento del propio rack, sino en el hecho de que AMD combinó procesamiento, redes, software, seguridad, alimentación, refrigeración y facilidad de mantenimiento físico en un diseño completo para una fábrica de IA.

Esto proporciona a los socios OEM/ODM y a los desarrolladores de ecosistemas una base más clara para desarrollar sistemas diferenciados en torno a la tecnología AMD. AMD Helios ayuda a reducir la cantidad de integración personalizada necesaria y, al mismo tiempo, ofrece a los socios espacio para innovar en torno al diseño del sistema, la validación, la implementación y la implementación específica del cliente.

La plataforma de fábrica de IA abierta que los socios pueden ofrecer

La infraestructura de IA ha evolucionado más allá de las discusiones de compra de componentes individuales. Actualmente, los clientes buscan soluciones que abarquen todo el espectro de procesamiento, memoria, redes, software, seguridad y arquitectura física de racks, y cómo todos estos elementos operan como un sistema coordinado, para ayudarles a pasar de la experimentación con IA a la producción a gran escala.

La plataforma a escala de rack AMD Helios ofrece a los socios una solución completa para presentar a sus clientes; ya que combina cada una de estas potentes tecnologías con estándares de rack abiertos y el software AMD ROCm, representa una solución increíble para cualquier cliente centrado en la producción de IA, la escalabilidad y la confianza operativa.

Para obtener más información sobre la plataforma a escala de rack AMD Helios y cómo puedes apoyar a tus clientes a ingresar o avanzar en el espacio de IA, habla con tu representante de AMD o visita amd.com para obtener más información.

Visitar la página de inicio de la plataforma a escala de rack AMD Helios

AMD Arena


Obtén experiencia con capacitación sobre las soluciones AMD AI, CPU para servidores AMD EPYC™, GPU AMD Instinct™ y mucho más en toda la cartera de AMD.

Artículos relacionados

Notas al pie
  1. Basado en cálculos realizados por los laboratorios de rendimiento de AMD al mes de junio del 2026 para determinar el rendimiento de precisión teórica máxima de la solución a escala de rack AMD Helios utilizando tipos de datos de matriz de pico FP16, BF16, INT8, Open Compute Project MXFP6, MXFP8, FP8 y MXFP4, en comparación con el rack NVIDIA Vera Rubin NVL72 mediante el uso de tipos de datos FP8/FP6 y NVFP4 densos. Los fabricantes de sistemas pueden variar las configuraciones, lo que arroja resultados diferentes. MI400-005.