NVIDIA presentó en el AI Infra Summit nuevos avances de Vera Rubin y su plataforma DSX orientados a aumentar la eficiencia energética de las fábricas de inteligencia artificial, con el foco puesto en la cantidad de tokens que pueden procesarse por cada megavatio disponible.
El evento realizado en el Santa Clara Convention Center reunió a más de 8.000 asistentes este año, frente a 3.500 en la edición anterior, instancia donde Ian Buck abordó la eficiencia de estas infraestructuras y las nuevas colaboraciones desarrolladas alrededor de las plataformas de NVIDIA.

Entre los anuncios realizados durante el encuentro estuvieron el trabajo de Annapurna Labs de Amazon con NVIDIA en la tecnología de memoria NVHBM, la integración de d-Matrix con NVLink Fusion y nuevos resultados de Emerald AI, Lambda y Pinterest utilizando distintas tecnologías de la compañía. Ian Buck, vicepresidente de hyperscale y computación de alto rendimiento de NVIDIA:
“Una infraestructura que sea flexible, confiable, que dure 10 años y que realmente se convierta en un activo para resolver los problemas computacionales de las industrias del mundo, eso es lo que pueden construir con Vera Rubin, con DSX y con todas las innovaciones que tenemos aquí”.
NVIDIA busca obtener más tokens con la misma energía disponible
La estrategia presentada en AI Infra Summit considera una plataforma completa que abarca sistemas Vera Rubin, software de inferencia Dynamo, bibliotecas NeMo y tecnologías de red como NVLink, Spectrum-X, ConnectX y BlueField, con un diseño coordinado desde el silicio hasta la infraestructura eléctrica.
Uno de los resultados corresponde a Lambda, que realizó la primera validación de NVIDIA DSX MaxLPS sobre servidores Blackwell y consiguió operar 19 nodos dentro del presupuesto energético utilizado habitualmente para 16 nodos a plena potencia.

La prueba aumentó el rendimiento total del clúster en 24%, desde cerca de 4 millones hasta 5 millones de tokens por segundo, mientras el rendimiento por watt mejoró 23% mediante la redistribución dinámica de potencia entre GPU y racks.
NVIDIA indica que DSX MaxLPS puede entregar hasta 1,4 veces más tokens por megavatio mediante la optimización energética de toda la instalación y permitir hasta 40% más capacidad de GPU dentro del mismo presupuesto de potencia en determinados despliegues con Vera Rubin NVL72.
En una presentación preliminar para MLPerf Inference v6.1, Vera Rubin NVL72 alcanzó hasta 3,7 veces el throughput de GB300 NVL72, mientras una configuración de 288 GPU GB300 distribuida en cuatro racks obtuvo una eficiencia de escalamiento de 99%.

Los resultados de NVIDIA en MLPerf Inference v6.1 también mostraron hasta 1,6 veces más rendimiento que en la versión v6.0 mediante optimizaciones de software, sin cambios de hardware entre ambas mediciones.
En las pruebas AgentX de SemiAnalysis con DeepSeek V4 Pro, Vera Rubin NVL72 registró hasta 30 veces más throughput por megavatio que GB300 NVL72 y hasta 45 veces menor costo por millón de tokens.
NVIDIA también presentó DSX Flex como parte de su estrategia energética para las fábricas de IA, tecnología capaz de ajustar dinámicamente el consumo según señales de la red y priorizar determinadas cargas de trabajo cuando sea necesario reducir temporalmente la demanda eléctrica.


