aiexpert
Início / Notícias / Nota
Chips · 21 de jul. de 2026, 16:03 · 5 fontes

NVIDIA Vera Rubin NVL72 atinge produção com CoreWeave 10x throughput sobre GB200, atrai Microsoft, Mistral, Tesla

Supercomputador rack-scale de IA Vera Rubin NVL72 da NVIDIA entrou em produção total em 21 de julho, com racks Vera Rubin escalando em CoreWeave, Google Cloud, Microsoft Azure e Oracle Cloud Infrastructure. A plataforma unifica sete chips co-projetados (GPU Vera Rubin, CPU Vera, Groq 3 LPX, switch Ethernet Spectrum-6, DPU Vera BlueField-4, switch NVLink 6, NIC ConnectX-9) como sistema único coerente em vez de componentes montados. Benchmarks iniciais de CoreWeave em DeepSeek-R1 mostram 10x mais throughput por megawatt que Grace Blackwell NVL72—a métrica que mais importa para fábricas de IA com restrição de potência.

O rack funciona com Vera Rubin alcançando até 10x mais tokens por megawatt e um décimo do custo por milhão de tokens em comparação com GB200 NVL72. Montagem de bandeja leva um minuto (anteriormente horas) graças a bandejas co-projetadas sem cabos, ventiladores ou mangueiras. Temperatura de entrada de resfriamento líquido de 45 graus Celsius permite operação com dry-cooler sem chiller, economizando milhões de galões de água por megawatt anualmente. Stack total—CPU Vera manipulando orquestração, GPU Rubin manipulando computação, Ethernet Spectrum-6 manipulando scale-out, NVLink-C2C manipulando coerência CPU-GPU em 1.8TB/s—cria plataforma unificada.

Rampa de produção é suportada pela maior, mais madura cadeia de suprimentos rack-scale jamais montada, abrangendo 350+ sites de fábrica em 30 países. Mistral anunciou parceria multibilionária com Microsoft ancorando implantação de milhares de GPUs Vera Rubin para infraestrutura de IA soberana europeia; SpaceXAI e Tesla estão entre adotantes iniciais. Isso aborda a lei de escalamento de IA agentic: agentes consomem até 15x mais tokens por requisição que inferência tradicional, tornando eficiência custo-por-token uma alavanca primária de infraestrutura.

Para times de infraestrutura dimensionando implantações próxima geração, a melhora 10x-por-watt e integração single-system reduzem capex, opex (água, resfriamento, espaço de instalação) e tempo-para-deploy. O tradeoff é lock-in na plataforma verticalmente integrada de NVIDIA; times devem avaliar orçamentos de potência, arquitetura de rede (NVLink vs Ethernet) e relacionamentos de fornecedor de longo prazo antes de se comprometer.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source blogs.nvidia.com
  2. 02 blogs.nvidia.com blogs.nvidia.com “Vera Rubin NVL72 production is ramping up with racks running at partners CoreWeave, Google Cloud, Microsoft Azure and Oracle Cloud Infrastructure”
  3. 03 blogs.nvidia.com blogs.nvidia.com “CoreWeave's first benchmark on DeepSeek-R1 says it all: 10x more throughput per megawatt than Grace Blackwell NVL72”
  4. 04 blogs.nvidia.com blogs.nvidia.com “Vera Rubin NVL72 delivers up to 10x more tokens per megawatt and one-tenth the cost per million tokens, providing more intelligence within the same power footprint”
  5. 05 blogs.nvidia.com blogs.nvidia.com “Vera Rubin NVL72 system with no cables, fans or hoses in the tray, cutting compute tray assembly time from hours to one minute”