CoreWeave Alimenta Primer Rack Vera Rubin; Costo de Inferencia Por Token se Reduce 10x vs. Blackwell en Rollout Q3
CoreWeave completó el primer bring-up del sistema Vera Rubin NVL72 de producción el 1 de junio de 2026, marcando el primer despliegue validado por la industria de la plataforma de escala de rack de próxima generación de NVIDIA. El sistema ahora está ejecutando trabajos de cómputo en tiempo real. Vera Rubin ofrece 3,6 EFLOPS de rendimiento de inferencia NVFP4 por rack (5x Blackwell) y costo por token 10x menor, con reclamaciones que van desde 70–90% de reducción de costo de token para modelos de 70B+ parámetros en alta concurrencia. La plataforma combina 72 GPUs Rubin (336B transistores cada, 50 PFLOPS FP4 por GPU) y 36 CPUs Vera con núlcleos ARM Olympus personalizados para cargas de trabajo agentic de baja latencia. Disponibilidad Q3 2026 confirmada con AWS, Google Cloud, Microsoft Azure y OCI.
La eficiencia de token 10x proviene de hardware co-diseñado: 22 TB/s de ancho de banda de memoria por GPU (vs. 8 TB/s en Blackwell), NVLink 6 entregando 260 TB/s de ancho de banda de escala de rack, y Ethernet Spectrum-X habilitado para fotónica. Para ganancias específicas de carga de trabajo: modelos de 7B–13B están limitados por ancho de banda de memoria, lo que produce rendimiento 2–3x por dólar; modelos de 405B+ ejecutando FP4 están limitados por cómputo, logrando ganancias cercanas a 10x. Precio inicial de nube esperado en 30–50% de prima sobre Blackwell, pero la economía de equilibrio favorece despliegues de inferencia a gran escala. Rubin Ultra (144 GPUs, 15 EFLOPS) apunta a Q3 2027.
Para ops y equipos de infraestructura, esto marca la inflexión de economía vinculada al entrenamiento a economía vinculada a la inferencia. En la escala de CoreWeave y con Microsoft/Mistral anclando capacidad europea, los racks Vera Rubin estarán asignados a través de 2027. El acceso práctico para la mayoría de los equipos llega en 2027; el enfoque inmediato a corto plazo debe ser contratos de capacidad de reserva Blackwell o precio spot. El precio premium refleja tanto la escasez como la ganancia de eficiencia real—valide sus suposiciones de token-por-megavatio contra benchmarks Rubin antes de la fecha límite 2H2026.