Las empresas tecnológicas AMD y Cerebras Systems anunciaron una alianza técnica para desarrollar una plataforma desagregada de inferencia de IA. La propuesta integrará los sistemas en rack AMD Helios con Cerebras Wafer-Scale Engine dentro de un mismo flujo de trabajo, combinando procesamiento de alto rendimiento y generación de tokens con baja latencia.

Cerebras prevé desplegar AMD Helios en sus centros de datos y ofrecer inicialmente la solución mediante Cerebras Cloud durante el segundo semestre de 2026.
AMD Helios procesará prompts y WSE generará los tokens
La arquitectura separará las dos etapas principales de la inferencia. AMD Helios procesará los prompts, las ventanas de contexto extensas y grandes volúmenes de solicitudes, mientras Cerebras Wafer-Scale Engine se encargará de la decodificación y generación de tokens con baja latencia.
Las compañías estiman que esta combinación podría entregar hasta cinco veces más tokens por segundo por watt frente a una configuración basada únicamente en Cerebras WSE. La cifra proviene de un modelado realizado por AMD Performance Labs y Cerebras en julio de 2026 con el modelo Kimi 2.6 1T, por lo que puede variar según la configuración utilizada.
Lisa Su, presidenta del directorio y CEO de AMD, señaló que la diversidad de las cargas de inferencia exige una infraestructura más flexible.
“La inferencia de IA se está convirtiendo en una de las mayores oportunidades de infraestructura dentro de la IA […] Junto con Cerebras, estamos extendiendo ese liderazgo hacia las aplicaciones más sensibles a la latencia y creando una nueva y potente plataforma para IA agéntica en tiempo real”.

Cerebras Cloud ofrecerá la solución durante 2026
La plataforma estará orientada a aplicaciones donde el tiempo de respuesta condiciona el funcionamiento del sistema, entre ellas desarrollo de software, agentes autónomos, robótica y descubrimiento científico. AMD Helios funcionará como motor para procesar las solicitudes, mientras Cerebras WSE atenderá la generación rápida de tokens.
Andrew Feldman, CEO y cofundador de Cerebras, indicó que la alianza permitirá ampliar el acceso a su tecnología de inferencia.
“La demanda por inferencia ultrarrápida está creciendo a un ritmo sin precedentes. Cerebras ofrece la inferencia de latencia ultrabaja más rápida del mundo. […] Asociarnos con AMD nos brinda una oportunidad extraordinaria para llevar ese rendimiento a más clientes”.

La disponibilidad inicial está prevista para el segundo semestre de 2026 a través de Cerebras Cloud. AMD y Cerebras no informaron precios ni configuraciones comerciales específicas para el servicio.


