
AI Infrastructure2026-09-17
NVIDIA AI Blog
Vera Rubin NVL72 de NVIDIA arrasa en MLPerf Inference
NVIDIA ha anunciado que su sistema Vera Rubin NVL72 obtuvo los mejores resultados en el estreno de MLPerf Inference v6.1, una release de benchmarks que mide con qué rapidez y eficiencia los sistemas de IA manejan cargas de inferencia reales. La empresa enmarca el resultado no como un simple récord de velocidad, sino como evidencia de que el rendimiento de inferencia se está convirtiendo en una métrica económica central para las fábricas de IA. Bajo esa mirada, cada mejora de throughput se traduce en más tokens generados por unidad de tiempo, lo que puede aumentar directamente los ingresos de quienes venden acceso a modelos o ejecutan servicios de IA a gran escala.
NVIDIA también insiste en que el rendimiento a nivel de sistema importa tanto como las especificaciones de cada chip. El Vera Rubin NVL72 se posiciona como una plataforma de escala de rack, y su desempeño en el benchmark refleja avances coordinados en GPU, red, memoria y software.
El escalado eficiente de la infraestructura es otro pilar: a medida que los clientes añaden más hardware, el throughput debería crecer de forma predecible en lugar de estancarse por cuellos de botella. La optimización continua del software es la tercera palanca, ya que permite mejorar despliegues existentes con el tiempo sin necesidad de reemplazar el hardware.
El debut en MLPerf ofrece a los clientes una forma estandarizada de comparar estas afirmaciones frente a sistemas de la competencia, y a la vez señala que la puja en infraestructura de IA se está corriendo de la velocidad bruta de entrenamiento hacia la economía de la inferencia. Para empresas y proveedores de nube, la conclusión es que elegir una plataforma de inferencia implica hoy equilibrar rendimiento, eficiencia de escalado, madurez del software y coste total por token. El resultado de NVIDIA probablemente avivará ese debate a medida que las cargas de IA pasan de la experimentación a la producción de gran volumen.