Intel propone medir los flujos de IA agéntica completados por rack
Concurrencia, latencia y consumo determinan la capacidad efectiva del sistema. | Creada con IA.

Intel propone medir los flujos de IA agéntica completados por rack

Intel planteó que la infraestructura de IA agéntica no debe compararse solo por el rendimiento de un núcleo, la densidad de núcleos o la capacidad teórica del rack. La compañía propone medir los flujos de agentes completados dentro de límites definidos de latencia, costo y energía.

¿Qué es un agente de IA y cuándo realmente tiene sentido usarlo?
Los agentes de IA deciden pasos, usan herramientas y actúan con límites, pero no sustituyen automatizaciones cuando bastan reglas claras

La concurrencia desplaza el cuello de botella

La publicación cita un análisis de 739 conversaciones anonimizadas de Claude Code. El procesamiento y la espera asociados a la CPU pasaron de menos del 1% de la latencia total con una solicitud a un máximo del 15% con 32 solicitudes concurrentes, principalmente por planificación de tareas y gestión de colas.

Karin Eibschitz Segal, autora de la columna de opinión publicada por Intel, resumió el problema al señalar que el valor del acelerador depende de que el resto de la infraestructura mantenga el flujo de datos y tareas.

“El acelerador más caro es el que espera al resto del sistema”.

La misma investigación estima que las GPU de los agentes que ejecutan código realizan trabajo útil durante entre el 50% y el 60% del tiempo total. Cuando un agente espera una base de datos, un sistema de recuperación o un entorno aislado, el acelerador también permanece inactivo.

Intel invertirá 5.000 millones de euros en producción de chips en Irlanda
La ampliación de Leixlip aumentará la producción de procesadores Xeon y reforzará la capacidad europea para fabricar chips avanzados dentro de Irlanda

Intel define una métrica basada en capacidad efectiva

La compañía denomina “agentes entregados por rack” a los flujos que un rack puede completar de manera confiable con el rendimiento, la calidad y la latencia requeridos. El cálculo combina capacidad teórica, eficiencia de enrutamiento, equilibrio de recursos y eficiencia de descarga de tareas.

El límite operativo aparece cuando la incorporación de agentes hace que la latencia exceda el objetivo definido, no cuando se alcanza el máximo de una tabla teórica. Intel sostiene que las comparaciones de rendimiento deberían declarar concurrencia, objetivo de latencia y pérdidas entre la capacidad teórica y la entregada.

El gráfico ilustrativo muestra cuándo la latencia p99 alcanza el objetivo definido. La ejecución adaptativa admite 300 agentes concurrentes por nodo frente a 235 con asignación estática, un 28% más. | Créditos: Intel.

Como respaldo de su planteamiento, Intel señaló que Xeon 6 Flat Memory Mode integra memoria conectada mediante CXL y DDR5 nativa en un mismo espacio de direcciones. En una evaluación conjunta con SAP, alcanzó el 96% del rendimiento de una configuración basada completamente en DDR5, con un costo total de propiedad de memoria aproximadamente 25% menor.

Intel prevé informar agentes por rack con un objetivo de latencia p99 y trazas reales de IA agéntica, junto con mediciones de eficiencia de enrutamiento, beneficios de la descarga de funciones, eficiencia del host en sistemas con GPU y agentes por watt bajo una restricción energética definida para el rack.