AMD presentó Helios, una solución de infraestructura de IA a escala rack para inferencia masiva, entrenamiento y ajuste fino de modelos de frontera. Su arquitectura reúne GPU Instinct MI455X, CPU EPYC de sexta generación, redes Pensando y software ROCm.

AMD Helios combina cómputo, redes y software abierto
Cada rack incorpora 18 bandejas de cómputo con cuatro GPU, para un total de 72 aceleradores. AMD indica que el sistema entrega hasta 2,9 exaflops FP4, 1,4 exaflops FP8, 31 TB de memoria HBM4 y 1,7 PB/s de ancho de banda de memoria.
La arquitectura utiliza UALink sobre Ethernet para la comunicación scale-up y Ethernet basado en estándares para scale-out, en línea con el Ultra Ethernet Consortium. Helios puede desplegarse desde un rack hasta clusters de IA a escala de gigavatios, con NIC Pensando Vulcano 800 para la conectividad entre nodos.

Vamsi Boppana, VP sénior de IA en AMD, explicó que la combinación de cómputo, redes y software abierto busca facilitar el crecimiento de la infraestructura conforme aumentan las cargas de inferencia y entrenamiento.
“La infraestructura de IA de frontera evoluciona rápidamente y los clientes necesitan plataformas que puedan ofrecer un rendimiento excepcional mientras escalan eficientemente conforme crecen las cargas de trabajo. AMD Helios reúne cómputo de primer nivel, redes de alto rendimiento y software abierto en una plataforma unificada a escala rack”.
El vocero señaló también que el diseño técnico a las cargas que la compañía pretende atender con Helios y al margen de elección ofrecido a sus clientes.
“En conjunto, estas tecnologías ofrecen a los clientes flexibilidad para acelerar la inferencia a gran escala, el entrenamiento de modelos de frontera y la próxima generación de infraestructura de IA”.

AMD compara Helios con NVIDIA Vera Rubin
Según cálculos y estimaciones de AMD, Helios ofrece frente a un rack NVIDIA Vera Rubin NVL72 un 15% más de rendimiento FP4 máximo teórico, 50% más capacidad HBM, 6% más ancho de banda HBM y 50% más ancho de banda scale-out. La empresa también proyecta hasta 30% más tokens por dólar.

Las cifras de memoria y rendimiento teórico se basan en cálculos de AMD Performance Labs realizados en junio y julio de 2026 sobre especificaciones publicadas. La estimación de costo utiliza la carga Kimi K2 Thinking, precios horarios proyectados para las GPU y configuraciones que pueden variar según el fabricante.

