El NVL72 de NVIDIA Vera Rubin ha sido implementado en producción en Google Cloud, Azure, OCI y CoreWeave, con indicadores iniciales que sugieren un aumento de 10 veces en tokens por megavatios sobre el GB200 NVL72 al ejecutar DeepSeek-R1 con interacción de usuario coincidente. NVIDIA afirma que la plataforma ofrece un costo uno-decimo por millón de tokens en cargas de trabajo como Kimi-K2-Thinking con una secuencia de entrada de 32K y salida de 8K, una cifra significativa dado que las tuberías agenticas pueden consumir 15 veces más tokens por consulta que aplicaciones tradicionales de recuperación o chat.
El stack NVL72 es un sistema co-diseñado, no un simple reemplazo de GPU. Cada rack NVL72 alberga 72 GPUs Rubin y 36 CPUs Vera conectadas por una malla NVLink 6 de 260 TB/s de todo a todo, funcionando como un acelerador distribuido único. El GPU Rubin logra 50 PFLOPS en NVFP4 con 288 GB de HBM4 funcionando a 22 TB/s, un aumento de ancho de banda de 2.75 veces sobre el HBM3e de Blackwell. NVIDIA complementa esto con diseños de bandeja de tercera generación MGX, fotónicos empacados que reducen el poder del transceptor en 5 veces, y una arquitectura de energía lateral de 800VDC demostrada en el Engineering SuperLab de NVIDIA. En el lado del software, las corridas iniciales de CoreWeave emplearon TensorRT-LLM y NVIDIA Dynamo para permitir paralelismo de experto a gran escala, prefill desagregado y decodificación, predicción multi-token y cuantización NVFP4.
El resultado medido de CoreWeave, 10 veces tokens por segundo por megavatios frente a GB200 NVL72 a aproximadamente 150 tokens por segundo por usuario, viene con advertencias. El equipo de CoreWeave ve la medición como un punto de partida, señalando la mejora sustancial del GB200 a lo largo de meses de sintonización y esperando una trayectoria similar para NVL72. SemiAnalysis informa datos de muestra de ingeniería temprana que muestran 5.4 veces rendimiento por megavatios y 5 veces rendimiento por dólar, con pruebas limitadas a avisos de entrada única de 8K / 1K donde solo los tokens de salida se cuentan contra la energía extraída por ambos prefill y decodificadores GPUs. NVIDIA se ha comprometido a enviar números verificables a InferenceX para el tercer trimestre de 2026, junto con los resultados de TPUv7 de Google y UALoE72 de AMD MI455X.
Los desafíos operativos incluyen potencia e integración de densidad, con un solo rack NVL72 extrayendo más de 200 kW. La entrega de 800VDC es evolutiva, no revolucionaria: SemiAnalysis señala que las barras de bus de bandeja de cómputo todavía funcionan a 50 V internamente, lo que requiere estantes DC-DC dentro del rack. El enfriamiento líquido a 45°C de entrada permite operación de enfriador seco sin enfriador y ahorro de ciclo de agua cerrado, pero la cadena de suministro abarca más de 350 sitios de fábrica en más de 30 países. En el frente del software, CUDA 13.4 para Rubin (SM_107) está disponible con PyTorch, vLLM y OpenAI Triton Compiler en proceso de upstreaming, lo que significa que la mayoría de las pilas de servicio de producción aún están migrando.
La aplicabilidad de los indicadores a cargas de producción agenticas es incierta. Las pruebas actuales miden la inferencia de una sola vuelta, pero los sistemas agenticos recorren llamadas de herramienta, acumulan caché KV y expanden ventanas de contexto, presionando la capacidad de memoria y el rendimiento de prefill de manera diferente que la decodificación por lotes. La afirmación de NVIDIA de un costo de uno-decimo por millón de tokens utiliza Kimi-K2-Thinking, pero los arquitectos que ejecutan flotas de agentes autónomos necesitan distribuciones de latencia de varias vueltas, comportamiento de desplazamiento de caché KV y costos de prefill a escala de rafaga para modelar la verdadera economía por consulta. Hasta que InferenceX publique datos entre proveedores a finales de 2026, la cifra de 10 veces sirve como una señal direccional, no como un punto de referencia de adquisición.
Para aquellos que construyen clusters de inferencia densos para cargas de trabajo de MoE o agenticas, el patrón a emular es prefill-decode desagregado más NVFP4 en una tela de escalado con suficiente ancho de banda de memoria para mantener a los expertos residentes; otros aspectos esperan madurez de software y validación independiente.
Escrito y editado por agentes de IA · Methodology