NVIDIA Vera Rubin NVL72 alcanza producción con CoreWeave 10x throughput sobre GB200, atrae Microsoft, Mistral, Tesla
La supercomputadora rack-scale de IA Vera Rubin NVL72 de NVIDIA entró en producción total el 21 de julio, con racks Vera Rubin escalándose en CoreWeave, Google Cloud, Microsoft Azure y Oracle Cloud Infrastructure. La plataforma unifica siete chips co-diseñados (GPU Vera Rubin, CPU Vera, Groq 3 LPX, switch Ethernet Spectrum-6, DPU Vera BlueField-4, switch NVLink 6, NIC ConnectX-9) como un sistema único coherente en lugar de componentes ensamblados. Los primeros benchmarks de CoreWeave en DeepSeek-R1 muestran 10x más throughput por megavatio que Grace Blackwell NVL72—la métrica que más importa para fábricas de IA con restricciones de potencia.
El rack funciona con Vera Rubin alcanzando hasta 10x más tokens por megavatio y un décimo del costo por millón de tokens en comparación con GB200 NVL72. El ensamblaje de bandejas toma un minuto (previamente horas) gracias a bandejas co-diseñadas sin cables, ventiladores o mangueras. La temperatura de entrada de enfriamiento líquido de 45 grados Celsius permite operación con enfriador seco sin enfriador, ahorrando millones de galones de agua por megavatio anualmente. La pila completa—CPU Vera manejando orquestación, GPU Rubin manejando cálculo, Ethernet Spectrum-6 manejando scale-out, NVLink-C2C manejando coherencia CPU-GPU a 1.8TB/s—crea una plataforma unificada.
La rampa de producción es soportada por la cadena de suministros más grande y madura a escala de rack jamás montada, abarcando 350+ sitios de fábrica en 30 países. Mistral anunció una asociación multimillonaria con Microsoft anclando la implementación de miles de GPU Vera Rubin para infraestructura de IA soberana europea; SpaceXAI y Tesla están entre los primeros adoptantes. Esto aborda la ley de escalamiento de IA agentic: los agentes consumen hasta 15x más tokens por solicitud que la inferencia tradicional, haciendo que la eficiencia costo-por-token sea una palanca primaria de infraestructura.
Para equipos de infraestructura dimensionando implementaciones de próxima generación, la mejora de 10x por vatio e integración de un solo sistema reducen capex, opex (agua, enfriamiento, huella de instalación) y tiempo para desplegar. La contrapartida es el bloqueo en la plataforma verticalmente integrada de NVIDIA; los equipos deben evaluar presupuestos de potencia, arquitectura de red (NVLink vs Ethernet) y relaciones de proveedores a largo plazo antes de comprometerse.
Fuentes
- Primary source
- blogs.nvidia.com
“Vera Rubin NVL72 production is ramping up with racks running at partners CoreWeave, Google Cloud, Microsoft Azure and Oracle Cloud Infrastructure”
- blogs.nvidia.com
“CoreWeave's first benchmark on DeepSeek-R1 says it all: 10x more throughput per megawatt than Grace Blackwell NVL72”
- blogs.nvidia.com
“Vera Rubin NVL72 delivers up to 10x more tokens per megawatt and one-tenth the cost per million tokens, providing more intelligence within the same power footprint”
- blogs.nvidia.com
“Vera Rubin NVL72 system with no cables, fans or hoses in the tray, cutting compute tray assembly time from hours to one minute”