AMD y Cerebras Systems anunciaron una alianza técnica para desarrollar una plataforma desagregada de inferencia de IA
Helios procesará prompts y Cerebras generará tokens con baja latencia. | Créditos: AMD

AMD y Cerebras Systems anunciaron una alianza técnica para desarrollar una plataforma desagregada de inferencia de IA

Las empresas tecnológicas AMD y Cerebras Systems anunciaron una alianza técnica para desarrollar una plataforma desagregada de inferencia de IA. La propuesta integrará los sistemas en rack AMD Helios con Cerebras Wafer-Scale Engine dentro de un mismo flujo de trabajo, combinando procesamiento de alto rendimiento y generación de tokens con baja latencia.

AMD y Cisco llevan control empresarial a la IA local
La alianza explorará IA agéntica local con control centralizado, seguridad empresarial y menor dependencia de la nube

Cerebras prevé desplegar AMD Helios en sus centros de datos y ofrecer inicialmente la solución mediante Cerebras Cloud durante el segundo semestre de 2026.

AMD Helios procesará prompts y WSE generará los tokens

La arquitectura separará las dos etapas principales de la inferencia. AMD Helios procesará los prompts, las ventanas de contexto extensas y grandes volúmenes de solicitudes, mientras Cerebras Wafer-Scale Engine se encargará de la decodificación y generación de tokens con baja latencia.

Las compañías estiman que esta combinación podría entregar hasta cinco veces más tokens por segundo por watt frente a una configuración basada únicamente en Cerebras WSE. La cifra proviene de un modelado realizado por AMD Performance Labs y Cerebras en julio de 2026 con el modelo Kimi 2.6 1T, por lo que puede variar según la configuración utilizada.

Lisa Su, presidenta del directorio y CEO de AMD, señaló que la diversidad de las cargas de inferencia exige una infraestructura más flexible.

“La inferencia de IA se está convirtiendo en una de las mayores oportunidades de infraestructura dentro de la IA […] Junto con Cerebras, estamos extendiendo ese liderazgo hacia las aplicaciones más sensibles a la latencia y creando una nueva y potente plataforma para IA agéntica en tiempo real”.
Meta prepara hasta 6 GW de infraestructura con GPU AMD
Meta prueba Helios y una GPU Instinct personalizada basada en MI450, valida servidores EPYC Venice y colabora en próximos sistemas de IA junto con AMD

Cerebras Cloud ofrecerá la solución durante 2026

La plataforma estará orientada a aplicaciones donde el tiempo de respuesta condiciona el funcionamiento del sistema, entre ellas desarrollo de software, agentes autónomos, robótica y descubrimiento científico. AMD Helios funcionará como motor para procesar las solicitudes, mientras Cerebras WSE atenderá la generación rápida de tokens.

Andrew Feldman, CEO y cofundador de Cerebras, indicó que la alianza permitirá ampliar el acceso a su tecnología de inferencia.

“La demanda por inferencia ultrarrápida está creciendo a un ritmo sin precedentes. Cerebras ofrece la inferencia de latencia ultrabaja más rápida del mundo. […] Asociarnos con AMD nos brinda una oportunidad extraordinaria para llevar ese rendimiento a más clientes”.
AMD y Anthropic desplegarán hasta 2 GW con GPU para IA
La alianza incluye sistemas Helios con GPU Instinct MI455X, una inversión de hasta US$5 mil millones y el uso de Claude para acelerar el software ROCm

La disponibilidad inicial está prevista para el segundo semestre de 2026 a través de Cerebras Cloud. AMD y Cerebras no informaron precios ni configuraciones comerciales específicas para el servicio.