NVIDIA Blackwell Ultra GB300 NVL72 es impresionante: hasta 50x más tokens por megavatio y 35x menor coste por token en inferencia

Matias 6 Comments 2026-02-18 10:43:06

La GB300 NVL72 de NVIDIA basada en Blackwell Ultra ya tiene cifras públicas encima de la mesa y no son menores, de hecho, son impresionantes. Según los datos compartidos junto a métricas de SemiAnalysis (InferenceX), en pruebas con DeepSeek R1 0528 en FP4 (8K/1K), los verdes hablan de hasta 50x más tokens por megavatio y hasta 35x menor coste por token frente a H200 en FP8 bajo cargas 1K/1K. Además, la plataforma puede rozar los 18.000 tokens por segundo por GPU manteniendo latencias contenidas, una métrica que es clave para mantener las consultas, por ejemplo, en Chatbots. Lo que nadie va a dudar después de ver los datos es que el rendimiento de la GB300 NVL72, como sistema completo para IA, es una locura.

Microsoft, Oracle Cloud o CoreWeave son de los primeros socios de NVIDIA en implementar Blackwell Ultra con estas GB300 NVL72 para sus infraestructuras. Y no es para menos, los datos son impactantes, vienen desde fuera de la compañía y, de algún modo para sacar pecho, se hacen eco de lo que está llegando a los centros de datos de IA por todo el planeta, justificando su alto coste con un rendimiento de estas GB300 NVL72 realmente impresionante.

Menos latencia y "long-context", los asistentes de codificación van a dar un salto exponencial a finales de este año y sobre todo en 2027

NVIDIA GB300 NVL72 50 veces más rendimiento en Tokens por vatio

Hay que aclarar un concepto que NVIDIA lleva promocionando desde finales del año pasado y principios de este 2026: la IA Agéntica. Cuando NVIDIA habla de IA agéntica (agentic AI) no se refiere simplemente a un chatbot más listo o competente. Se refiere a sistemas de IA que actúan como agentes autónomos, es decir, estas IA a modo de agentes son capaces de planificar, decidir, ejecutar tareas que le vayamos dando, o le programemos en cadena y utilizar herramientas externas diversas sin intervención constante del usuario.

Es, por decirlo de alguna manera, el siguiente paso de la IA para ser más autónoma. Dicho esto, se necesita un salto de hardware muy potente para que esto sea una realidad, y eso es precisamente lo que ha querido mostrar NVIDIA en la noche de ayer.

Por ejemplo, en el gráfico de tokens por GPU frente a latencia “end to end”, la GB300 NVL72 se mueve cerca de los 18.000 tok/s por GPU con latencias en el rango de 20 a 40 segundos en configuraciones exigentes. Frente al AMD Instinct MI355X, el throughput es claramente superior y la degradación bajo mayor latencia es más progresiva. Esto es importante porque en entornos reales la carga no es constante ni ideal, cambia, y cuando aumenta se genera más latencia, empeorando el rendimiento final.

El rendimiento de la GB300 NVL72 es superlativo, la eficiencia el formidable

NVIDIA GB300 NVL72 35 veces mejor en reducción del coste del token

El segundo gráfico, tokens por GPU frente a interactividad (tok/s por usuario), es aún más revelador. A medida que la interactividad escala hacia 150 o incluso 300 tok/s por usuario, la caída de rendimiento de la GB300 es gradual, no colapsa por tramos o de golpe. Con el MI355X la bajada es mucho más abrupta como se puede apreciar, lo que evidencia que el rendimiento se mantiene más tiempo en un rango más alto con la GB300 NVL72.

En entornos multiusuario con alta concurrencia, que es algo que valoran muy concienzudamente las empresas de centros de datos de IA, esta diferencia impacta directamente en cuántas solicitudes puede absorber el sistema sin disparar el coste por respuesta.

En términos económicos, que es otro parámetro que lógicamente buscan, el dato clave es el coste por millón de tokens. En escenarios 1K/1K, NVIDIA afirma lograr hasta 35x menor coste frente a su H200 en FP8.

NVIDIA GB300 NVL72 long context AI en DeepSeek-R1 coste por millón de tokens

Aquí intervienen NVFP4 y el stack Dynamo con TensorRT y MTP, es cierto, que optimizan precisión, planificación de cargas y uso de memoria, pero eso no le quita mérito en el rendimiento conseguido a la GB300 NVL72.

El dato energético es probablemente el más determinante a escala industrial, quizás, el más buscado. NVIDIA comenta que han logrado hasta 50x más tokens por megavatio. En un momento donde muchos data center están limitados por potencia eléctrica disponible y capacidad de refrigeración, aumentar los tokens por MW significa más rendimiento por rack y mejor retorno del CAPEX energético.

La GB300 NVL72 no se presenta únicamente como una GPU más rápida del mundo para IA, se posiciona como una plataforma completa orientada a reducir el coste real de la inferencia, mantener estabilidad bajo alta interactividad y maximizar productividad energética. Y en 2026, eso es lo que define la viabilidad económica de desplegar modelos a gran escala, siendo el principal reclamo de NVIDIA para esta GB300 NVL72 más allá del rendimiento puro.

boton whatsapp sharkinformatica
boton whatsapp sharkinformatica