En directo
[Herramientas]El nuevo sistema Vera Rubin de NVIDIA triplica el rendimiento de su predecesor en inferencia de IA[Negocios]NVIDIA, Google y Emerald AI crean una alianza para que los centros de datos de IA consuman electricidad de forma flexible[Investigación]La Universidad de Manchester predice la contaminación del aire en todo el Reino Unido con modelos de IA climática de NVIDIA[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red[Herramientas]Perplexity lleva sus agentes de IA a Windows para trabajar sin conexión[Negocios]Bruselas reunirá a 900 empresas y gobiernos para acelerar el uso de IA en sanidad, movilidad y administración pública[Investigación]Un robot aprende tareas nuevas viendo un solo vídeo, sin volver a entrenarse[Modelos de IA]IBM y Confluent lanzan modelos de series temporales para analizar datos en tiempo real[Herramientas]El nuevo sistema Vera Rubin de NVIDIA triplica el rendimiento de su predecesor en inferencia de IA[Negocios]NVIDIA, Google y Emerald AI crean una alianza para que los centros de datos de IA consuman electricidad de forma flexible[Investigación]La Universidad de Manchester predice la contaminación del aire en todo el Reino Unido con modelos de IA climática de NVIDIA[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red[Herramientas]Perplexity lleva sus agentes de IA a Windows para trabajar sin conexión[Negocios]Bruselas reunirá a 900 empresas y gobiernos para acelerar el uso de IA en sanidad, movilidad y administración pública[Investigación]Un robot aprende tareas nuevas viendo un solo vídeo, sin volver a entrenarse[Modelos de IA]IBM y Confluent lanzan modelos de series temporales para analizar datos en tiempo real
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasNVIDIA Blog3 min

El nuevo sistema Vera Rubin de NVIDIA triplica el rendimiento de su predecesor en inferencia de IA

El sistema Vera Rubin NVL72 debutó en las pruebas MLPerf con hasta 3,7 veces más rendimiento que la generación anterior, mientras NVIDIA demuestra que su plataforma escala con un 99% de eficiencia al añadir más hardware.

Por Redacción3 min
En resumen

NVIDIA presentó su sistema Vera Rubin NVL72, que alcanzó hasta 3,7 veces más rendimiento que el GB300 NVL72 en las pruebas MLPerf Inference v6.1 (benchmarks estándar que miden velocidad de ejecución de modelos de IA). El sistema combina hardware optimizado con técnicas de software que permiten generar más tokens por segundo y servir más usuarios simultáneos, reduciendo el coste por respuesta.

Compartir
El nuevo sistema Vera Rubin de NVIDIA triplica el rendimiento de su predecesor en inferencia de IA
Herramientas · NVIDIA Blog

NVIDIA ha presentado los resultados de su nuevo sistema Vera Rubin NVL72 en las pruebas MLPerf Inference v6.1 (un conjunto de benchmarks estándar de la industria que miden qué tan rápido distintos sistemas pueden ejecutar modelos de IA), según informó la compañía en su blog oficial. El sistema logró hasta 3,7 veces más rendimiento que su predecesor GB300 NVL72 en tareas de procesamiento de imagen y texto, como las que ejecuta el modelo Qwen3-VL (un modelo multimodal que puede entender tanto texto como imágenes). En pruebas con DeepSeek-R1 (un modelo de razonamiento que piensa paso a paso antes de responder), el rendimiento fue 2,5 veces superior.

Estos números tienen implicaciones directas en el negocio de la IA: cada rack (armario que contiene 72 GPUs, las tarjetas gráficas especializadas que ejecutan estos modelos) de Vera Rubin puede generar muchos más tokens (las unidades básicas de texto que procesan estos modelos, equivalentes aproximadamente a palabras o fragmentos de palabras) por segundo, lo que significa servir a más usuarios simultáneos y reducir el coste por cada respuesta generada. Las mejoras vienen de una combinación de hardware optimizado —con Tensor Cores mejorados (unidades especializadas dentro de las GPUs para operaciones matemáticas de IA) y uso de NVFP4, una precisión numérica reducida que ocupa menos memoria— y técnicas de software como la separación de la fase de lectura inicial del texto (prefill) y la generación de respuesta (decode).

Más allá del rendimiento bruto, NVIDIA demostró que su arquitectura escala de forma casi perfecta: al pasar de un rack a cuatro racks (de 72 a 288 GPUs), el rendimiento creció proporcionalmente con una eficiencia del 99%. Esto significa que duplicar el hardware duplica realmente la capacidad, algo que no sucede automáticamente en sistemas distribuidos y que resulta crítico para quien invierte millones en infraestructura. El sistema GB300 NVL72 también mostró resultados destacados en generación de vídeo, produciendo 0,65 vídeos de 720p por segundo, nueve veces más que un único nodo.

La compañía continúa optimizando su software de forma constante: entre la versión 6.0 y 6.1 de las pruebas MLPerf, el rendimiento en ciertos modelos mejoró hasta 1,6 veces solo mediante actualizaciones de software, sin cambiar el hardware. Estas mejoras incluyen kernels más eficientes (las rutinas de bajo nivel que ejecutan operaciones específicas en la GPU), mejor gestión de la memoria caché y técnicas de desagregación que distribuyen distintas partes del proceso entre múltiples GPUs. Las optimizaciones continuaron incluso después del cierre de entregas, con mejoras adicionales aún pendientes de verificación oficial.

NVIDIA también presentó resultados de su plataforma Jetson AGX Thor (un ordenador compacto diseñado para ejecutar IA en dispositivos que no pueden depender de la nube, como robots o sistemas embebidos) en benchmarks de agentes de IA, un área emergente donde los modelos no solo responden preguntas sino que razonan, planifican y ejecutan acciones en múltiples pasos. En pruebas preliminares con el benchmark AgentX, Vera Rubin NVL72 mostró un rendimiento 30 veces superior al GB300 NVL72. Diecinueve partners del ecosistema NVIDIA participaron en estas pruebas, incluyendo Azure, Oracle Cloud, Dell Technologies y Supermicro, demostrando que estas mejoras funcionan también en despliegues comerciales reales.

Fuente original
NVIDIA Blog
Más en · Herramientas