Huawei presentó un nuevo SuperCluster para entrenamiento e inferencia de inteligencia artificial que utiliza UnifiedBus para interconectar sus distintos subsistemas. La arquitectura puede conectar hasta 512.000 NPU mediante una red Clos de dos niveles y cuatro planos, mientras una configuración multirail permite escalar hasta un millón de NPU.

UnifiedBus conecta los componentes del SuperCluster
El sistema integra Ascend SuperPoD, Kunpeng SuperPoD y clústeres de caché KV mediante UnifiedBus, con comunicación directa entre los distintos subsistemas y sin conversiones entre múltiples protocolos. Huawei también incorpora un sistema de almacenamiento multinivel para acceder directamente a las distintas capas de caché KV.

Uno de sus componentes es Atlas 960E, un SuperPoD construido con procesadores Ascend 960 y la interconexión óptica Hi-ONE basada en Near-Packaged Optics o NPO. Cada sistema admite hasta 4.096 NPU, alcanza 8 EFLOPS en FP8 y dispone de hasta 1 PB de memoria HBM.
Atlas 960E utiliza 5.500 unidades Hi-ONE con una capacidad de transmisión de 7,2 Tbit/s por unidad, en lugar de los 48.000 módulos ópticos 800G que Huawei estima necesarios en una configuración convencional. La compañía calcula una reducción superior a 550 kW en consumo eléctrico y una disponibilidad del sistema de 99,8%.

TaiShan 950 y OceanStor M900 completan la arquitectura
Huawei también actualizó TaiShan 950, un SuperPoD de propósito general conectado mediante una red óptica UnifiedBus que puede integrar hasta 4.096 nodos y disponer de un pool de memoria unificada de 256 TB. Este sistema funciona junto con OceanStor M900, un clúster de almacenamiento de memoria de contexto orientado a cargas de inferencia con agentes.

OceanStor M900 incorpora caché KV multinivel, acceso directo de un salto y capacidad de caché a escala de petabytes para la capa L3.5. La combinación de estos sistemas permite que el SuperCluster reúna cómputo de IA, procesamiento general y almacenamiento de contexto bajo la misma arquitectura de interconexión.



